一个大脑,任何身体:Google DeepMind 的 Keerthana 谈 Gemini Robotics 2、跨身体迁移与人形机器人
摘要
Keerthana 认为,中国走红的机器人奥运会确实展示了运动能力的进步,但并不是衡量机器人近期实用性的好指标。 在平坦、坚硬地面上奔跑对仿真尤其友好,而真正有用的操作能力会在接触、摩擦、可变形物体和不可预测环境面前迅速失效。她的直白校准是:“我的很多朋友效率很高,但我们跑不过 Usain Bolt。”
机器人仍处于“GPT-2 时刻”,因为令人印象深刻的演示还没有变成可迁移、可靠的智能。 要达到 GPT-3 级别的进展,模型需要从多个任务的多个样本中学习,并拥有一个能够跨越人形机器人、机械臂和其他身体形态迁移的大脑;如今,能力仍高度依赖具体机器人和具体设置。单次模仿很有前景,但复制演示并不等于场景变化后仍能泛化。
Gemini Robotics 2 通过3个模型,将具身推理与物理执行拆开。 Gemini Robotics ER2 是负责更高层级、调用工具的“大脑”;Gemini Robotics 2 是控制运动的视觉-语言-动作模型;Gemini Robotics On-Device 2 则是更小的本地版本。这一架构让大模型负责理解意图、专门的动作模型负责控制身体,但额外的模型交接也会带来延迟和失败风险。
受控的商业环境仍最可能成为早期部署切入口,尽管在家庭场景中,模型延迟可能没那么重要。 Nathan 强调可重复的工厂、仓库任务和专业服务;Keerthana 也认同,商业使用场景比家庭更容易控制。在传送带上,6秒停顿不可接受;但如果机器人彻夜叠衣服,慢6秒并不重要。Keerthana 预计,快模型和慢模型会同步发展,大模型获得的能力将逐步迁移到更小的模型中。
跨身体迁移正在快速改善,但“一个大脑,任何身体”仍是愿景,而不是已经解决的能力。 Google DeepMind 的模型如今能够控制从“指尖到脚”的人形机器人,其端侧项目据称只需约200个样本,就能让任务适配新的身体。但 Keerthana 认为,目前几乎没有先例能让一种全新的身体形态在完全零样本的情况下,可靠性极高地执行大量任务。
硬件进展速度超出了 Keerthana 的预期,剩余工作正转向可靠性、可重复性、成本和安全的力控制,而灵巧手正逼近能力瓶颈。 在大约1年3个月内,前沿能力已经从夹爪推进到多指控制、系垃圾袋和全身操作。她说,Shadow hand 可能可以举起约20公斤。商业化剩余工作,是让机械手具备可重复性、耐用性和可负担的成本,并能在精细物体和人类身边安全工作。
Keerthana 拒绝认定世界模型或任何单一数据来源就是机器人领域的制胜配方。 遥操作精确,但成本高、难以规模化;配备传感器的 UMI 演示更容易扩展,同时保留精确的、由传感器生成的动作标签;第一视角的人类视频数量庞大,却充满噪声。她反复强调的原则是经验主义:预测应当拿结果检验,而不是被当作定论,因为机器人仍处于足够早期的阶段,多种架构和数据组合都可能证明有用。
精读
1. 走红的机器人竞速展示的是具身化最容易的一环
Keerthana 最早是通过父亲和印度的朋友了解到中国机器人奥运会的;他们惊讶于人形机器人似乎跑得比最快的人还快。这些演示之所以引发公众想象,一方面是因为奔跑是直观的基准,另一方面是因为自 DARPA 时代以来,机器人已经取得巨大进步——当年的机器甚至很难不摔倒地走过一扇门。
Nathan 的质疑值得保留:速度究竟有用,还是只是吸睛?Keerthana 承认,快速移动能力可能对国防有价值,但她的团队关注的是帮助人类在物理世界中完成工作的机器人:“我的很多朋友效率很高,但我们跑不过 Usain Bolt。”腿部速度很少是高价值工作的瓶颈。
移动能力之所以进步快于操作能力,是因为平地和刚性物体相对容易建模。控制器可以在仿真环境中学习运动,通常先通过模仿学习、再用强化学习微调,然后迁移到实体机器人;但涉及大量接触的任务需要处理更复杂的物理。拿起一个木块相对可行,折叠布料则会暴露摩擦、形变和交互等问题,而现代模拟器对这些因素的刻画仍然很差。
2. 研究前沿已经从抓取推进到全身智能
Keerthana 记得,基础的抓取与放置曾经是严肃的研究问题。基础模型让许多这类行为变得相对容易,推动研究人员转向人形机器人、多指机械手和协调式全身操作。她的团队大约在2年前开始研究人形机器人,当时连抓起一个苹果都很困难。
Gemini Robotics 2 真正有意义的进步,并不只是会走路或移动得更快,而是能够下蹲、调整自身位置,并以闭环方式操作陌生物体。Keerthana 提到一段视频:人形机器人在尝试拿到一个喷壶时改变了身体姿态;如果是1年前,她会对这样的行为感到意外。
“全身控制”意味着视觉-语言-动作模型在处理周围场景时,会把人形机器人的身体从指尖一直考虑到脚部。底层机制仍可能负责稳定,但语义控制器并不是只向一条孤立的机械臂下达指令,而是在用户任务的要求下协调整个身体的动作。
3. 可靠性与泛化是两个彼此独立的维度
Keerthana 将技能和泛化称为“正交的两个维度”。一个经过窄范围工程优化的系统,已经可以把1个或2个任务做得非常好,但要执行许多窄任务,成本可能很快就与只执行第1个或第2个任务的成本大致相当。通用基础模型则能同时提升许多任务的表现,并降低后续专门化的成本,这与语言模型从任务专用模型转向 GPT 和 Gemini 式基础模型的过程相似。
Nathan 希望看到类似 METR 的曲线,把任务复杂度与50%、80%或99%的成功率连接起来。Keerthana 没有给出一条清晰曲线,但表示抓取与放置正在接近一个强劲、可用的信号。她更大的观点是,机器人不能只优化任务成功率,还必须保留支撑适应能力的广泛理解。
物理部署会显著抬高可靠性门槛。语言模型漏掉某项内容后还可以被纠正;机器人则可能摔坏物体、制造危险,或损伤自身。因此,重试成本低的任务更容易:机器人可以撤销一次乐高拼错,但鸡蛋掉落后会制造一摊湿滑的残局,还要额外解决第2个问题。
4. 单次演示是提示,不是泛化能力的证明
最近的系统可以从少量、甚至看似单次的演示中学习,但 Keerthana 将这类结果视为普通提示的一条连续谱。基础模型可以通过语言、一张标出了目标物体的图片,或一段视频演示得到引导。上下文学习无需针对任务重新训练,因此能缩短部署时间,但并没有消除底层的泛化难题。
关键测试在于,精确的演示发生变化后会怎样。这些模型可以记住并复现展示给它们的内容;更难的问题是,它们能否适应不同的场景、物体或摆放方式。抓取与放置受益于大量既有数据,而“只演示1次,然后让它系垃圾袋”仍然是强得多的挑战。
因此,Keerthana 仍把机器人称为“GPT-2”。要达到 GPT-3 的对应阶段,需要从多个任务的多个样本中学习,并显著增强跨身体形态的迁移能力。一个只能在单一机器人、单一配置上工作的“大脑”,还不是软件那种能够在手机、电脑和操作系统之间保持一致行为的通用大脑。
5. Gemini Robotics 2 将推理、动作与本地执行拆开
Keerthana 将 Gemini Robotics ER2 描述为一个建立在 Gemini Flash 模型之上的、能够调用工具的具身推理系统,主要理解图像、视频、语义和机器人场景。Gemini Robotics 2 是把用户意图或 ER2 的指导转化为动作的 VLA,而 Gemini Robotics On-Device 2 则是为在机器人本地运行而设计的更小模型。
Nathan 让自己的编程代理把 ER2 接入一个基于浏览器的二维场景,并配备简单的抓取与放置工具。模型理解了“把香蕉移到盘子里”之类的请求。他还测试了一个在抓取前发生移动的物体;模型失败后,又收到了一张物体出现在不同位置的图片。在他的小规模测试中,Flash 和 ER2 的整体表现大致相同,而且两者都做得不错。
ER2 最先通过 API 发布,是因为它更接近已经成熟的 Gemini 技术栈。动作模型离大规模部署仍更远,还需要在可靠性和服务化方面进行更多研究。将 ER2 开放给经过验证的合作伙伴之外的用户后,团队获得了规模大得多的反馈流,其中包括学术基准测试,以及用它进行出人意料的低层级控制的实验。
6. 延迟与记忆迫使机器人构建分层大脑
Nathan 观察到,从要求 ER2 移动物体到收到工具调用,中间大约有6秒。Keerthana 的回答取决于工作负载:传送带不能等,但如果机器人彻夜慢慢叠衣服,家庭用户可能并不在意。大模型可能解锁更先进的能力,而小模型或端侧模型则负责响应速度、本地执行,以及在云连接不可靠时继续运行。
她预计快系统和慢系统会并存,而不是先后出现。一些能力可能先在大模型中出现,再迁移到更小的模型中。云端部署可以运行在远程服务器上,例如 Michigan;端侧模型则服务于需要本地执行的应用。
Nathan 介绍,ER2 的128,000个 token 上下文,大致相当于3分钟经过高密度表示的机器人历史,具体取决于帧采样和 token 化方式。Keerthana 的上下文工程原则是“非常密集的记忆”:重要时保留原始视觉细节,不那么重要时则把长时间活动压缩成简短文字。做饭机器人可能只需要记住自己翻过鸡蛋,而不必保存动作中的每一个像素。
7. 当下,丰富的接口比通用机器人 API 更重要
ER2 可以像数字版 Gemini 代理一样接入工具,但机器人领域还没有类似 Model Context Protocol 的标准接口。每种身体形态暴露出的控制方式和 API 都不同,因此面对陌生身体形态时可能需要额外工程工作。Keerthana 表示,当前针对具体机器人的模型在直接控制上仍然更好,大型推理模型则负责调度它们。
ER2 与 VLA 之间的接口已经不只是原始坐标。VLA 可以响应语言、指向、图像或视频演示;ER2 可以指示它向左看、低下头、返回,或与被指代的物体互动。Keerthana 认为,发展方向是建立更丰富的连接,文字只是其中一种沟通模态。
Nathan 用“香蕉还是柠檬”的例子揭示了设计问题:ER2 应该说出物体名称、指向它、描述其形状,还是提供像素坐标?Keerthana 没有认定某一种答案会永久胜出,因为“可控性”仍是活跃的研究领域。最合适的抽象层,取决于动作模型最终能够可靠理解什么,也会随之演变。
8. 跨身体迁移确有进展,但多层编排会叠加错误
Google DeepMind 正在与 Apptronik、Agile Robots 和 Boston Dynamics 共同开发 VLA。Keerthana 说,跨身体迁移已经实现了“一大步”提升,但要让模型在全新的身体上,以完全零样本的方式执行大量任务并保持高可靠性,仍然缺乏有意义的先例。
端侧项目展示了共同物理基础的价值:借助大约200个样本,测试人员可以在不同身体上教授多个任务,因为模型已经理解了相当多的物理世界,并拥有此前的控制经验。不过,大多数身体形态仍集中在熟悉的设计上——类似人手的机械手、空间中的向量、双手系统和人形机器人;安装在无人机上的机械手则位于更为陌生的长尾。
Nathan 指出,依次执行10个子任务会带来不断叠加的出错机会。Keerthana 强调,即便推理和运动执行单独来看都运行良好,完成检测、任务衔接以及判断何时重新规划仍可能失败。
9. 机械手的进步快于其经济性改善
在大约1年3个月内,Keerthana 更新了自己对硬件的预测。过去接近夹爪能力前沿的任务,如今越来越多可以由多指机械手完成;与此同时,多指机械手还带来了夹爪从未具备的能力,包括系垃圾袋、精细的手指运动,以及与身体姿态一体化的操作。
市场上如今已经有多种能力不错的机械手,但可靠性、可重复性和价格仍未解决。Keerthana 说,Wuji hand 的水平相当于10岁儿童:尺寸接近成人,但有些弱。Shadow hand 可能可以举起约20公斤,也已经被看到打开罐子;但它的扭矩,以及打开密封很紧的罐盖时能否成功,仍不确定。
在顺应性和触觉反馈能够改善操作的场景中,软体机器人很重要,但 Keerthana 再次把重点放在实际标准上:“什么是可重复的,什么是耐用的?”配备传感器的手套和 UMI 式系统很有意思,因为它们可以采集演示和由传感器生成的动作信息;力传感也让模型能够连接精细部件,而不至于把它们压坏。
10. 安全是一项横跨机械、感知与意图的能力
Keerthana 不接受简单的能力与安全二选一:“人们不会使用危险的机器人和危险的代理。”最有用的系统必须遵循指令,同时不制造混乱、不违反约束。Nathan 和 Keerthana 都预计商业场所会先于家庭部署;Keerthana 强调,商业环境更容易控制,而家庭中有儿童,安全门槛更高。
机器人还会出现不同于恶意行为的运行故障。人形机器人可能仅仅因为摔倒、传感器失灵或误判接触,就伤害到某个人。在一次测试中,有人把一个篮子套在机器人的头上;正确反应不是继续盲目执行,而是识别障碍并请求移走篮子。
安全机制从切断电源的硬急停,到冻结机器人、同时保持平衡的软急停不等;前者可能让本就不稳定的机器人直接倒下。更好的力传感和顺应性控制则提供了另一层保护。对 Keerthana 来说,安全是一个“全系统问题”,从机械设计和紧急控制,一直延伸到感知、规划以及高层级地遵循人类意图。
11. 人形交互、世界模型与数据配方仍未定型
Gemini Robotics 2 引入了更自然的人机交互:手势是在上下文中生成的,而不是逐个预先编写。在拍摄期间,机器人可以讨论自己的任务,承认自己可能犯了错,并在交谈时配合手势。Keerthana 称其为“半涌现式”能力——交互能力是有意开发的,但并没有逐个手势进行编程。
类人外观既会增强依恋,也会抬高预期。刚接触的观察者可能忘记人形机器人其实是一台机器,同时又会比面对明显机械化的机械臂时,更严厉地评判它的错误。Keerthana 认为,人形机器人在科学上很有价值,因为它们同时暴露出3个前沿问题:全身控制、多指灵巧性,以及自然的人机交互。
对于预测型世界模型,她诚实的回答是:“现在还没有定论。”机器人研究人员应该对问题本身保持执着,而不是对某一种偏爱的办法产生感情;VLA、动作模型和显式预测系统都可能发挥作用。这个领域的“配方还没有稳定下来”,因此,经验比较比架构上的确定性更有价值。
同样的不可知论也适用于数据。遥操作精确,但成本高、难以规模化,而且随着机器人能力提升,其价值可能下降;传感器丰富的 UMI 演示更容易扩展,同时保留动作标签;第一视角的人类视频数量庞大,却无法清晰提供手部和末端执行器的精确运动信息。Keerthana 预计,随着硬件改善,数据组合也会变化;最终,用户既需要高层级委托,也需要在个性化或安全有要求时进行低层级控制。