https://www.youtube.com/watch?v=CVcyli4i5g0
通俗整体解释:
这期播客相当于一次“机器人现在到底行不行”的接地气汇报。嘉宾来自谷歌 DeepMind,负责 Gemini Robotics。核心结论不是“明年机器人统治工厂”,而是:跑得快、跳得帅的的人形只是运动控制进步的面子;真正难点是让机器人用同一套“脑”在不同身体上稳定做有用的事,比如叠衣、抓物、绑垃圾袋、读仪表、与人自然交流。团队把系统分成“会想”的 ER2(懂图、视频、语言、规划,已开放 API)、“会动”的 VLA(把想法变全身动作)和“装在本体上的小模型”三档。现在 pick‑and‑place 之类已接近能用,但长任务、软物、没见过的家用工况仍常掉链子,所以整体还像 AI 的 GPT‑2 阶段,不算智能爆发。运动可在仿真里练,操作因接触、变形太复杂还得真机数据;少看一次演示就能学会仍有水分。安全不是附加项,而是能否进家/进厂的前提;未来是否必须给机器人装“内心模拟世界”去预判,还在试。对普通人来说,短期更可能先看到仓库/商业场景的部分自动机器人,以及个别慢悠悠做家务、读表、递东西的试验品,而不是全面替代人的人形劳工。
整体文章标题:
谷歌DeepMind Gemini Robotics 2 与通用机器人现状深度访谈:从机器人奥运会、全身控制、跨本体到安全对齐与世界模型
第(一)部分 开场背景、节目定位与本期核心议题概览(0% - 6%)
1 节目与嘉宾介绍: 主持人欢迎 Google DeepMind 研究员、Gemini Robotics 研究负责人 Keerthana Gopalakrishnan 第四次回到《Cognitive Revolution》。说明本期聚焦“通用机器人何时真正有用”这一大问题,并结合当下纯数字 AI 已经产生巨大影响、但机器人若进入物理世界可能带来更科幻式拐点的背景展开。
2 AI 2027 与机器人经济预设: 主持人引述 AI 2027 类预测——人形机器人可能在 2027 年中变得有用,2028 年形成“机器人建工厂、工厂造更多机器人”的指数级机器人经济;同时也提到这种路径会带来 AI 接管风险。用这一激进时间线作为参照,追问真实研究进展是否支撑如此预期。
3 本期路线预告: 先讨论中国夏季“机器人奥运会”及人形跑步超过人类最快选手的现象;再讲 Gemini Robotics 2 三模型体系,包括 ER2 作为具身推理“系统2”、基于 Gemini Flash 并通过 API 开放,以及 Robotics 2 与 OnDevice 2 把高层工具调用转成全身动作、目前仅限可信测试;最后谈整体进度为何仍像“GPT‑2 时代”、硬件部署、可靠性/安全/对齐,以及是否需要世界模型等未来方向。
第(二)部分 中国机器人奥运会、人形跑步速度与公众想象评析(6% - 18%)
1 奥运片段与家庭/社交反响: Keerthana 提到父亲主动聊“人形机器人跑步”视频;印度从政朋友在学生抗议场合也拿中国机器人跑得比最快人类还快来讨论。说明这类比赛虽在研究层不意外,但极大点燃公众想象。
2 与二十年前 DARPA 挑战对比: 主持人整理网络拼图:早年 DARPA 机器人勉强开门、经常摔倒;现在人形可跑、可参赛,进步跨度非常大。Keerthana 认可这是双足运动控制_state‑of‑the‑art 的公开展示,也承认它把“机器人到哪了”变成大众可感知的基准。
3 “跑过博尔特”是否有实用价值: 主持人追问人形跑 20 公里/小时级是否只是炫技。Keerthana 区分——运动控制(locomotion)和操作(manipulation)是两个大方向;跑步在平地被仿真推得很远,国防等少数场景可能要速度,但她团队更关注“在物理世界替人做有用事”。 productive 人类本身也不靠博尔特速度工作,因此脚速不是实用瓶颈。
4 失败画面与训练方式暗示: 提到跑步中撞墙、着火、散架等片段,说明不可能用大量实体机器人反复撞墙训;由此引出后续仿真训练话题。
第(三)部分 仿真到现实、运动控制与操作任务的难度差异(18% - 30%)
1 Sim‑to‑Real 基本逻辑: 解释机器人仿真到真机的“sim‑to‑real gap”。越能在仿真里稳定学习,越容易先被解决;运动控制因可建模地面、墙壁、平整接触,成为仿真受益者。
2 跑步为何适合仿真: 地面/跑道接触相对规则、刚体、可全机建模;可用运动模仿预训练,再用强化学习按具体机身微调,针对“跑更快”做目标优化;若只是直线赛跑,导航成分也低。
3 操作任务为何更难: 操作核心在“接触时刻与物体反应”。布类折叠涉及摩擦与形变,仿真会失真;柔性、易变形物体比刚性体难。相反木方块、很多 pick‑and‑place 因接触动力学可预测,仿真已较成熟。
4 刚体—柔体光谱: 总结“物体/环境越刚性、变形越小,仿真越准;越软、越依赖摩擦/接触细节,越要吃真实数据”。这为后面为什么操作泛化仍弱、需要真实示范与基础模型做铺垫。
第(四)部分 实际可委托任务、研究前沿迁移、全身操作与成功率曲线(30% - 42%)
1 研究员视角的“委托”悖论: 主持人问生活里有没有机器人已好用到可委托。Keerthana 说研究员会不断被“已解决”挤出研究区:早期 pick‑and‑place 都难,现在基础模型轻易做;前沿于是移到人形全身操作。
2 从夹爪到人形手的跨越: 早先演示多用 gripper;近一两年转人形手。Gemini Robotics 已做“whole‑body manipulation with generalization”——边迈步/深蹲边抓放、闭环、对不同物体推理;一年前若说现在能做到会惊讶。举 Twitter 浇水壶深蹲抓取视频为例。
3 METR 式任务长度与成功率框架: 引入“任务时长/人做多久”的难度轴,并叠加 50%/80%/99% 成功率。现实机器人不像电脑 LLM 容错:掉东西、坏物就麻烦。pick‑and‑place 已接近高成功可部署;但长序列、软物、精细决策仍低。
4 泛化与精通的正交关系: 强调可建极窄专用 AI 把单任务做到极高成功,但成本不随任务数摊薄;通用基线像“抬升所有船的潮水”,先具身常识/通用理解,再快速微调到精通。认为机器人会复刻 LLM 从专用到通用基线的路径。
第(五)部分 少样本/单样本泛化、上下文学习与“机器人相当于几个 GPT”定位(42% - 50%)
1 视频/图像/语言提示操作: 把“给机器人演示一次”视作 video prompting;文本提示 unseen 物体抓取是语言泛化,圈图提示是 image prompting,整段演示是 video prompting。能 in‑context 学会可显著降低部署与示教成本。
2 记忆复制 vs 真泛化: 提醒 ICL 仍会“照抄”示范;若换场景、换物体、换要求,是否适应才是关键。像“绑垃圾袋”这种多步柔操作,当前仍早。pick‑place 因数据多、语义简单,少样本更成熟。
3 评分仍只算 GPT‑2 的两大原因: 一是少样本在大量不同任务上还不够稳;二是 cross‑embodiment 问题——同一“脑”放到不同机器人/新机身若不会做,就不算通用脑。LLM 不管跑手机、Mac、Linux 行为一致,机器人脑还远没到这种本体无关性。
第(六)部分 Gemini Robotics 2 三模型架构、延迟权衡与家用/商用路径(50% - 62%)
1 三模型分工: ER2=系统2式具身推理脑,基于 Gemini Flash 线、偏机器人调优,做图像/视频/语义理解,已通过 API 开放;Gemini Robotics(VLA)=把意图转成机器人动作的策略模型;OnDevice 2=缩小版、跑机器人本机、不依赖云,功能近似但受限于机载算力。
2 基于 Gemini 3.5 Flash 的能力与推理开销: 有多模态、思维链;但 CoT 与大型多模态推理会有响应时延。主持人自测 API:从“把香蕉放到盘子”到工具调用约 6 秒,真实高频场景可能太慢。
3 应用决定时延容忍度: 流水线/装配要快;家里“叠衣服”不在乎慢只在乎做好;因此会有 flash/pro/ondevice 多档。云模型更大更强但需网络,分布式部署(如远程机器人)可能用机载;长期看快/慢模型并行,再把大模型能力蒸馏到小模型。
4 商用先于家用但可被“慢模型”反转: 传统判断 warehouse/factory/commercial 场景更可控、先规模化的;但 Keerthana 指出若慢模型够智能、家用夜间 chores 不要求低延迟,反而可能让家庭某些任务早于严苛工业场景落地。安全在家因儿童等要求更高,仍是商用量产更先。
第(七)部分 ER2 与基础 Flash 的差异、具身基准、128k 上下文与上下文工程(62% - 70%)
1 ER2 专属前沿基准: 相比通用 Flash,ER2 更贴近机器人用例,如仪表读数、巡检、指向、细粒度具身问答;二者非竞争而是协同,通用 Gemini 能力回流、机器人专用模型再在特定用例微调更优。主持人自测简单“抓放”Flash 与 ER2 都行,但复杂仪器/语义指向才显 ER2 价值。
2 128k 上下文约等于多少机器人记忆: 取决于图像帧、token 化与其他传感信息,约 3 分钟密集上下文;pro 类更长,适合离线分析长片段。纯靠把整段机器人长任务塞进 ER2 不现实,需要持续扩上下文或摘要。
3 机器人上下文工程建议: 不全存原始图像,可将过往步骤用文本摘要压缩;保留与当前任务相关的关键帧/状态。类比人做饭——既记得“翻蛋”的精细画面,也用语言叙述流程;ER 解析人意图时用文本/多模态混合更可解释,减少 RAM 式冗余。
第(八)部分 API 开放动机、外部构建案例、工具定义与 ER 指挥 VLA 的接口(70% - 78%)
1 为何先开放 ER 而非动作模型: ER 更接近 Gemini、成熟度更高;VLA 动作模型更前沿、服务与可靠性未到广泛开放。AI Studio 开放后使用量远超可信测试伙伴的小范围反馈,学术圈拿它做基准、甚至尝试低层控制令人意外。
2 外部演示与典型构建: 举 Boston Dynamics Spot 机器狗用 ER 读仪表、发零食;学术基准;agent+机器人讨论。ER 开放也便于反向收集“哪里强/哪里弱”的免费评测信号。
3 工具/affordance 定义方式: 像数字 agent 一样给 ER2 写工具描述,它按通用推理选工具;但机器人无统一 API/协议标准,对常见机型更友好,冷门机身需适配。VLA 本质把“图像/语言→关节空间”映射;当前特定机器人基础模型仍优于让超大通用脑直接管关节。
4 指向、消歧与多模态 steerability: ER 不一定要给像素坐标,可用语言“拿黄色东西”或指向物体;香蕉/柠檬歧义可通过指向、形状描述(椭圆/月牙)、视频示范解决。理想是 ER 与 VLA 间接触接口越来越丰富,而非只传文本指令导致信息损失。
第(九)部分 全身控制频率、跨本体零样本、编排错误复合与“煎蛋”可靠性(78% - 85%)
1 全身控制到底控什么: VLA 从指尖到脚全人形联合控制,需要语义目标+全身体感+环境感知;低层稳定控制器若没有语义脑,只保平衡做不了复杂任务。并非把“稳定”和“做事”完全拆成两个独立系统。
2 可信测试与跨本体现状: 与 Apptronik、Agility、Boston Dynamics 等共建 VLA;新本体完全零样本高可靠仍缺先例。OnDevice 模型用约 200 示例即可在多种机身上学很多任务,因已有通用物理与多本体控制基础。
3 ER+VLA 编排与错误复合: 多步任务里 ER 负责推进/切换、VLA 执行;两者各自有成功率,串联后整体成功率为乘积式下降。时延、任务切换、完成判定都会成为失败源,而不只是“手没抓准”。
4 煎蛋等不可逆任务对照: 有专门数据与调参,煎蛋可高可靠;通用模型没见过你家灶台则可能失败。过熟、打翻、地上蛋液会造成清理风险;对比 Lego 装配错了可重来,允许重试的任务更易部署,一次失误就搞砸的任务门槛高得多。
第(十)部分 机械手硬件进展、异形本体、玩具机器人、软体机器人与展会体验(85% - 91%)
1 从单夹爪到多指灵巧: Gemini Robotics 1(约去年3月)展示夹爪灵巧;1年多后 2 代做多指、可绑垃圾袋、细力控。手成为新灵巧前沿,夹爪相对不再是最难。市面多款手可研究,但仍需更可靠、可重复、降价。
2 力量与开罐场景: 不同手差异大——Wuji 手接近 10 岁儿童力量/人手尺寸;Shadow 手可提约 20kg、能开罐但极紧瓶盖未必;说明“开 Jar”仍可能成为人/机器人分工笑话。
3 异形与长尾本体: 可信计划中出现无人机装机械臂等奇怪形态;总体本体分布以双臂、手、人形为主,其余是长尾。只要有数据,怪本体也能学。玩具方面,早年桌面对战/游戏机器人多因新鲜感购买后闲置;现在接大模型可能改变,但消费玩具仍未爆发。
4 软体与触觉、展会观察: 软体机器人分软身/软手,AI 控制关键是可重复、耐用、触觉手套(UMI 类);纯机械软体仍处研究。Keerthana 参加上海 WIC,觉得很多演示像摆拍、泛化不足;腾讯半人形按摩座椅短时按压不痛但人类按摩仍更好。
第(十一)部分 安全对齐、拟人交互姿态、世界模型/数据路线与远期脑机/远程本体(91% - 100%)
1 安全即能力: 不安全机器人不会被采用。分操作安全(不因人笨/故障撞人、倒地伤人或压人)与高层对齐安全(不越护栏、遇感知识别异常不蛮干)。举例给人形头上套篮子挡视线,正确反应是请求人取下而非盲做。
2 人形带来的认知混淆与 HRI: 人会因拟人外观把它当人,又知道它是机器,边界模糊;人形出错会被更严批评。GR2 的 HRI 姿态不是硬编码点头,而是由模型按对话自然生成手势;拍摄采访里机器人能自评“某步做错了”; Favorite videotape 不愿放篮子的片段显示一定自我报告能力。意识问题仅带过不深聊。
3 世界模型 vs 反应式循环: 主持人引 Jim Fan 观点——机器人应向前仿真/预测未来再行动,而非只看当前—推理—执行循环。Keerthana 持开放:机器人学不迷信单一方法,VLA/agent/世界模型都未定型;DeepMind 本身有世界模型资源,可按问题取用。
4 数据组合而非单源至上: 电话遥操(teleop)精准但不易扩展;UMI/传感器示教较可扩展且标签准;第一人称人类视频可扩展但动作噪声大、需映射到机器人。未来更可能是按“规模×精度”混合,硬件进步也会改变各数据源权重。
5 多机、急停与远期形态: 多机器人可走“总控智能+单机执行”或单机组队;用户既要高层自然语言也要低层反馈。安全硬件有硬急停(断电可能倒)、软急停(冻结)、末端力控/柔顺;也有充气囊被戳即停的想法。最后聊果蝇全脑数字模型控小机器人、跨大西洋遥操作、背后多臂、以及她家狗约 25 万亿参数神经网络,说明远期“一个脑多本体/人机混合”值得期待。
Top comments (0)