
One Brain
观点集合
一个大脑,任何身体:Google DeepMind 的 Keerthana 谈 Gemini Robotics 2、跨身体迁移与人形机器人
- 🗓️ 日期:
2026-10-03| 🎙️ 节目:The Cognitive Revolution
Gemini Robotics 2 将具身推理、动作控制与端侧执行拆开,推动全身控制和跨身体迁移,但约200个样本仍不能证明新身体可零样本高可靠泛化。早期商业部署更可能落在工厂、仓库和专业服务;传送带无法容忍6秒延迟,而机械手成本、可靠性、安全及模型交接错误仍是关键风险。
查看访谈对话精读提要
Keerthana 认为,中国走红的机器人奥运会确实展示了运动能力的进步,但并不是衡量机器人近期实用性的好指标。 在平坦、坚硬地面上奔跑对仿真尤其友好,而真正有用的操作能力会在接触、摩擦、可变形物体和不可预测环境面前迅速失效。她的直白校准是:“我的很多朋友效率很高,但我们跑不过 Usain Bolt。”
机器人仍处于“GPT-2 时刻”,因为令人印象深刻的演示还没有变成可迁移、可靠的智能。 要达到 GPT-3 级别的进展,模型需要从多个任务的多个样本中学习,并拥有一个能够跨越人形机器人、机械臂和其他身体形态迁移的大脑;如今,能力仍高度依赖具体机器人和具体设置。单次模仿很有前景,但复制演示并不等于场景变化后仍能泛化。
Gemini Robotics 2 通过3个模型,将具身推理与物理执行拆开。 Gemini Robotics ER2 是负责更高层级、调用工具的“大脑”;Gemini Robotics 2 是控制运动的视觉-语言-动作模型;Gemini Robotics On-Device 2 则是更小的本地版本。这一架构让大模型负责理解意图、专门的动作模型负责控制身体,但额外的模型交接也会带来延迟和失败风险。
受控的商业环境仍最可能成为早期部署切入口,尽管在家庭场景中,模型延迟可能没那么重要。 Nathan 强调可重复的工厂、仓库任务和专业服务;Keerthana 也认同,商业使用场景比家庭更容易控制。在传送带上,6秒停顿不可接受;但如果机器人彻夜叠衣服,慢6秒并不重要。Keerthana 预计,快模型和慢模型会同步发展,大模型获得的能力将逐步迁移到更小的模型中。
跨身体迁移正在快速改善,但“一个大脑,任何身体”仍是愿景,而不是已经解决的能力。 Google DeepMind 的模型如今能够控制从“指尖到脚”的人形机器人,其端侧项目据称只需约200个样本,就能让任务适配新的身体。但 Keerthana 认为,目前几乎没有先例能让一种全新的身体形态在完全零样本的情况下,可靠性极高地执行大量任务。
硬件进展速度超出了 Keerthana 的预期,剩余工作正转向可靠性、可重复性、成本和安全的力控制,而灵巧手正逼近能力瓶颈。 在大约1年3个月内,前沿能力已经从夹爪推进到多指控制、系垃圾袋和全身操作。她说,Shadow hand 可能可以举起约20公斤。商业化剩余工作,是让机械手具备可重复性、耐用性和可负担的成本,并能在精细物体和人类身边安全工作。
Keerthana 拒绝认定世界模型或任何单一数据来源就是机器人领域的制胜配方。 遥操作精确,但成本高、难以规模化;配备传感器的 UMI 演示更容易扩展,同时保留精确的、由传感器生成的动作标签;第一视角的人类视频数量庞大,却充满噪声。她反复强调的原则是经验主义:预测应当拿结果检验,而不是被当作定论,因为机器人仍处于足够早期的阶段,多种架构和数据组合都可能证明有用。
🔗 原始收听与视频来源: 一个大脑,任何身体:Google DeepMind 的 Keerthana 谈 Gemini Robotics 2、跨身体迁移与人形机器人