No Priors 第141期|与 Sunday Robotics 联合创始人 Tony Zhao 和 Cheng Chi 对谈
摘要
Tony Zhao 将机器人行业定位在“GPT 时刻和 ChatGPT 时刻之间”:这个领域似乎已经找到了可规模化的配方,但尚未把规模转化为优秀的消费级产品。 传统的感知—规划—执行系统要求每个任务、每种环境都定制接口;新一代学习方法则试图扩展数据和模型,而不是反复重建面向单一任务的系统。他押注机器人会沿着其他 AI 领域的路径发展:相关数据越多,实用性就越强。
Sunday 的核心资产,是一套真实世界数据引擎:已采集近1000万条长时程轨迹,参与者超过500人。 Cheng Chi 的 UMI 工作以 GoPro 和夹爪替代受实验室限制的遥操作;Diffusion Policy 稳定了多模态模仿学习,ALOHA 让灵巧数据采集更直观,ACT/action chunking 加上 transformer 则帮助双手任务实现规模化。3名学生在约2周内采集了1500段端到端的浓缩咖啡制作视频。
手套式采集的表面简单,掩盖了全栈执行的难度。 Sunday 将数据设备、机器人控制、自动筛选与清洗、校准、训练流水线和机械设计放在一起迭代;手套从 V0 做到 V5,每个版本约迭代20次。正如 Zhao 回忆,创始人最初担心有人会“直接拿走我们的手套”(“just take our glove”),后来才发现“事情比我们想象的难得多”。
当简化能更快、更便宜地造出有用机器人时,Sunday 不追求人形机器人的完整性。 这款友好、卡通化的机器人只有3根手指,因为人们做家务时经常会并用它们,比如抓握把手或打开洗碗机。感知能力可以修正廉价、柔顺且不精确的硬件,让机器人在保持机械安全与柔顺性的同时,达到足够的精度。
创始人目前认为,模仿学习在操作任务上的样本效率更高,而强化学习在移动任务上表现良好。 地面接触相对容易模拟,但要复现会变形的手、透明杯、橙汁、反光和各种物理属性,极其困难且昂贵。对于操作任务而言,“把手放到杯子前面,再以合适力度合拢”可能比模拟整个世界更容易示范。
商业化将从2026年的家庭内测开始,2027年或2028年能否向大众交付,明确取决于可靠性、能力、安全性和价格。 当前原型机成本为6000美元至2万美元;达到几千台的产量后,Sunday 预计材料成本大概率低于1万美元,因为昂贵的小批量外壳加工会转向注塑成型,意味着售价可能在这一水平附近。Zhao 设想10年内家庭机器人数量超过10亿台,而 Cheng 描绘的一种未来是:家庭劳动的边际成本趋近于零。
创始人评估机器人视频的原则是“零假设”(“make zero assumptions. No Priors.”)。 先验证机器人是否自主运行,再把视频中被验证的能力限定为那个具体物体、具体人、具体环境和具体操作序列,而不是据此推断机器人具备泛化能力。Sunday 的证据包括长时程餐桌清理、易碎玻璃处理、在约6套 Airbnb 房源进行零样本测试、制作浓缩咖啡和叠袜子;不过 Cheng 表示,团队开发期间打碎了很多玻璃。
精读
1. 机器人已有规模化配方,但还没有 ChatGPT 级产品
Zhao 的框架是:机器人处在“GPT 时刻和 ChatGPT 时刻之间”(“in between the GPT moment and the ChatGPT moment”)。研究人员越来越认可一些有前景的操作方法,但没有人知道从机器人领域相当于 GPT-2 的阶段跃迁到 GPT-3 会带来什么,因为这个领域直到最近才获得具有实际规模的数据。
传统机器人学依赖人类设计的感知—规划—执行模块。每个任务和环境都要重新设计接口——本质上“每个任务都对应一篇论文”——因此研究机构和公司不断丢弃面向单一任务的工程成果,而不是积累通用能力。
Tony 介绍,Diffusion Policy 解决了示范数据对同一观测包含多个有效响应时模仿学习不稳定的问题。这使多个操作员、包括一些未经训练的操作员能够贡献数据,同时避免训练发散或机器人行为异常。
2. 更好的接口先释放灵巧性,真实世界数据再释放规模
ALOHA 大幅缩短了人体动作与机器人响应之间的延迟,让遥操作更像玩电子游戏。示范动作变得流畅且灵巧后,transformer 开始表现良好;此前机器人学依赖3层 MLP 和 ConvNet 多年,一直难以用好 transformer。
ACT 和 action chunking 预测的是一段轨迹,而不是单个毫秒级动作。Zhao 的直觉来自生物学:人类先感知,再持续移动一段时间而无需再次观察,因此动作分块能带来更一致的运动和更好的整体表现。
Chi 摆脱实验室遥操作限制的关键是 UMI:用3D打印夹爪和 GoPro 同步捕捉视频与手部动作。3名学生把设备带进餐厅,在2周内采集了约1500段制作浓缩咖啡的视频,形成异常庞大的数据集,并训练出一套端到端策略,让机器人能在 Stanford 周边未见过的地点完成出杯。
失败案例同样提供了关键信息:由于采集期一直下雨,这套策略在直射阳光下失效。“要让机器人在阳光环境中工作,它必须见过阳光环境”说明,决定泛化能力的是真实世界数据的覆盖广度,而不只是轨迹数量。
3. 全栈迭代把采集规模转化为执行难题
Sunday 从两位创始人在 Chi 的公寓里把机器人固定在桌上起步,发展到2024年末约8人,再到约30-40人。打造产品而不是演示原型,要求机械工程、控制、软件、AI、供应链和运营共同优化同一套系统。由于通用家用机器人尚不存在,正确的接口和标准仍未确定;创始人表示,这也让外部合作伙伴很难使用,因为他们对“好”的标准一直在变化。
目前近1000万条真实世界轨迹已覆盖导航和长时程任务,而不只是孤立的拿杯子动作。超过500人使用手套,持续暴露各种故障模式;V5 设备从 V0 到 V5,每个版本约经历20次迭代。自动校准和故障检测保护了数据质量,不必让人逐段检查每个视频。
4. 有用的家用机器人,靠简化人形取胜
Sunday 的使命,是把家用机器人放进每个人家里,接管那些对人之所以为人“真正重要”程度不高的家务,把时间还给家庭、爱好和热情。如果机器人变得便宜、安全且有能力,Zhao 设想10年内家庭机器人数量超过10亿台。
Sarah Guo 追问:为什么不直接造一个完整的人形机器人?核心设计答案是,只要不影响实用性,就尽可能简化。3根手指已经覆盖抓握把手或打开洗碗机的大部分收益,无需为通常会协同运动的手指分别增加执行器。
工业机器人必须快速、刚性高且精确,因为它们是在“盲目执行一条轨迹”。感知能力改变了这一约束:廉价、柔顺的执行器在机械上可能不够精确,但 AI 系统可以修正硬件误差,在保持“机械上天然安全且柔顺”的同时,满足家庭场景所需的精度。
商业化仍取决于测试结果。2026年,经过筛选的用户将把真实机器人带回家;能否在2027年或2028年向大众交付,要看实际表现。原型机成本为6000美元至2万美元,但达到几千台的产量后,Sunday 预计材料成本大概率低于1万美元,主要因为 CNC 加工、手工喷漆的外壳会转向注塑成型。
5. 模拟越难,操作任务越偏向模仿学习
创始人最初预计,手套数据会落后于分布完全匹配的遥操作。实际情况相反:这种形态促成了更自然、更灵巧的动作;经过约20轮工程迭代,以及将人类影像转换为机器人风格数据的全流程软硬件工作后,他们已经不再认为两者存在有意义的质量差距。
强化学习适合那些易于模拟的环境,尤其是移动任务,因为相关物理模型主要是刚体动力学和地面接触。Chi 表示,完美的模拟器可以让任何任务都成为可能,因此实际问题在于哪种方法能更快实现目标。操作任务则恰好相反:动作本身可能更容易采集,而准确模拟透明容器、液体颜色、反光、会变形的手、接触和力度,成本极高。
数据规模扩大后,数据质量的重要性反而上升。硬件故障和不受控的真实世界行为要求持续监控和可重复的清洗流程;与此同时,Sunday 在采访前约3个月才开始认真开展研究,因为数据稀缺时期形成的“可爱、花哨的研究想法”未必能扩展成产品。
Chi 认为仍有两项挑战:找到能在大规模数据上稳定运行的训练配方,以及让硬件可靠。学习团队不断把硬件推向极限,因此零部件会损坏;机械团队和学习团队在同一家公司内协作,可以迅速把故障反馈到设计环节。
6. 演示可信度取决于自主性、泛化能力和序列长度
Zhao 的第一道检验,是判断演示由机器人自主完成,还是由人遥操作。如果视频只展示把一个杯子递给一个人,就只能假设这一个具体交互有效;观众会本能地联想到不同的杯子、不同的人、衣物和餐具,但应该“只根据被充分展示的内容做判断”。
序列长度很重要,因为每一次交互都会引入新的失败概率。Sunday 的清理演示涵盖移动操作、倾倒厨余、装载餐具和操作洗碗机,还包括单手处理两只透明酒杯时对力度的敏感控制。Chi 表示,团队实验过程中“打碎了很多很多玻璃”。
为测试泛化能力,团队预订了约6套 Airbnb 房源,并进行零样本任务:将餐具收进收纳筒、把盘子装入洗碗机。机器人没有接受任何针对特定家庭的示范,却能处理反光银器、毫米级精度的抓取,甚至透明桌面;团队将这种表现归因于数据集中超过500人带来的多样性覆盖。
制作浓缩咖啡和叠袜子都在测试细粒度力度控制。传统遥操作让操作员的手实际上处于“麻木”状态,可以施加很大的力而没有感知;使用手套则能自然感受到接触。叠袜子还会形成一个力闭环:僵硬的抓握可以施加事实上不受限的力量,但外观上没有变化,因此手套提供的自然力度反馈对灵巧操作很有价值。