先锋 趋势 方法 投研 作者
Vol.232 产业观察44|具身智能+AI4S,能诞生什么新物种?
返回节目精读

Vol.232 产业观察44|具身智能+AI4S,能诞生什么新物种?

摘要

  • 具身智能行业仍未收敛:WRC现场是“几百家公司都在做几百个平行的实验”。 连文昭判断,行业对天花板和预期有共识,但路线——点到点预编程、VLA、生成世界模型——百花齐放;与去年的最大差别不是能力(“展示出来的能力其实是差不多的”,还是叠衣服、折盒子),而是全行业从展示性 Demo 转向场景落地与产业价值。
  • VLA被点名为“绕过理解的捷径”,世界模型也不能停在 pixel-to-pixel。 直接从观测回归动作导致过拟合,泛化标准被拉低——“物体从一个位置向左移动 0.5 厘米还能抓到,就叫泛化了;我从来不觉得这个叫泛化”;原洛的解法是以物体为中心、把力模态纳入预测并做闭环,因为力取决于机器人自身施加到环境中的作用,与动作高度耦合。
  • 本期最反直觉的判断是软硬进展错位:硬件进展快于体感,软件演示快于范式创新。 新一代本体的重复/绝对定位精度“已经能逼近以往工业机器人的级别”,两年前不敢想象;而算法演示虽炫,研发范式仍在沿用大语言模型的 next-token 作业方式,拉长时间维度看进展没有想象中那么快——机器人问题是逻辑+几何+物理,比大语言模型更难。
  • AI for Science 的瓶颈正移向湿实验,机器人提供“生成到验证 Gap”的物理 API。 李丰援引本周 Moderna 个性化肿瘤疫苗三期临床显著结果与 AI 筛选:发现效率提上去后,需要足够多、足够快、足够整齐的实验数据闭环;连文昭称常见实验流程“80%以上已经可以复现”,实验室仪器利用率过去可能只有 30%—40%,机器人可轻量、甚至零成本改造嵌入既有实验室。
  • 终局愿景是 GPU 式的“物理基座”。 机器人闭环产生标准化、可信赖的数据,形成科学智能的基础设施——“有了 GPU 以后,我可以做以前不敢想的事情”,解锁过去不敢设计的实验;商业上降本增效最易算账,仪器利用率与通量提升普遍可接受,而“AI提出更好假设”的价值尚未被广泛接受,但未来可能是最大的价值来源。
  • 中国机器人出海需求真实,但要过“开机测试”。 WRC 海外访客明显增多——欧洲、中东、日韩、东南亚;在连文昭接触到的小样本中,不少人带着集成商、经销商或转售等实质诉求,中国“逐渐成为事实上的全球机器人中心”;但规模化的筛选标准是机器人“跑了一天,第二天它是不是还愿意开机”,海外工程师稀缺、地缘政治不可控,且市场预期“确实是偏高的”。
  • 原洛自评:硬件保下限、模型提上限,当前“下限稳、上限可部署可交付”。 与华大智造、中科院合作,细胞培养、细胞毒性检测已在客户场地真实跑起来;能力边界的具象是撕保鲜膜——真实需求,“又高透又高反,还薄还一撕就破”,硬做能做但“特别硬着头皮上”。

精读

1. 返场时点:WRC举行、宇树上市,机器人行业两年后的复盘

  • 李丰开场定调:两年多前机器人“刚开始受到关注”时请过连文昭,如今北京世界机器人大会(WRC)与机器人体育比赛同期举行,“这周宇树机器人也刚刚上市,虽然上市之后表现跌宕起伏,但不管怎么样也是一个机器人的标志性事件”——在这个节点重看行业变化。
  • 连文昭现状:原洛科技2023年成立,既做类人型机器人本体也做大脑模型,正在推“OPN——以物理为中心的物理原生模型”,以 AI for Science 泛实验室场景为“练兵场和试金石”;他同时在上海交通大学人工智能学院担任教授,研究机器人在未知环境的安全运动与场景泛化。

2. 三段美国履历:从 Vicarious 类脑网络到 Figure 的数据链路

  • 博士毕业后加入硅谷 AGI 公司 Vicarious——“据传和 OpenAI、DeepMind 齐名”的早期 AGI 企业,做类脑神经网络,把机器人部署到美国邮政等物流客户;后入 Google X 早期机器人项目 Intrinsic,做“类似手机里的安卓”的跨硬件机器人操作系统(Intrinsic 今年早些时候又并回 Google)。
  • 2023年加入 Figure,搭建了其最早的一些数据采集链路和模仿学习框架;后来 Figure 成为美国机器人行业的标杆企业。

3. WRC体感:从秀 Demo 转向场景落地,方法论仍未收敛

  • 连文昭的核心观察:“几百家公司都在做几百个平行的实验”——行业没有共识,方法百花齐放,“证明行业的天花板或者说未来的预期是有共识的,一定很高、一定很好,但如何兑现这个预期,大家都还在努力回答”。
  • 与去年对比要“把握预期”:展示的能力“其实是差不多的”,但今年明显场景化、强调产业价值;去年、更不用说前年,基本是展示一个小能力就结束。双足跳舞依然热闹,“情绪价值是一个真正的价值”,他更关注的是上肢操作从展示能力走向可靠性。

4. 海外访客增多:潜在合作需求真实,但要过开机测试

  • 非华人面孔明显增多:欧洲、日韩、中东、东南亚都有访客;在连文昭接待和交流的小样本中,希望把机器人带到当地推广、做集成商、经销商或转售商的比例很高。卡塔尔半岛电视台也到原洛展台取景并交流。
  • 需求可行性判断:能力上“绝大多数都可以做到,但前提是你愿不愿意付出足够的成本”——海外工程师数量低于国内,协同投入可能更大,地缘政治也不可控。
  • 规模化的筛选标准是可靠性:机器人推过去“跑了一天,第二天它是不是还愿意开机?如果它自己主动愿意开机,客户的付费意愿肯定很强”;行业传递的预期“确实是偏高的”,但更大的预期也带来了更大的需求池,方便进一步筛选。

5. 从“直觉物理”到世界模型:VLA是绕过理解的捷径

  • 李丰回顾:两年前连文昭就提“直觉物理”,如今世界模型/物理模型成为热门创业方向,“我们也投了几家这样的初创公司……过去6个月估值上涨得非常快”。
  • 连文昭对 VLA 的批评:采集数据后直接从观测回归动作,“它其实是一个捷径,绕过了理解,直接去生成动作”,结果容易过拟合、泛化不及预期;他对泛化标准的不满是:物体从一个位置向左移动0.5厘米还能抓到就叫泛化,“我从来不觉得这个叫泛化,这是本来就应该具备的能力”。
  • 对 pixel-to-pixel 世界模型的批评:逐像素预测和重建“太麻烦了,也有些反直觉”,会使模型把大量表达能力用于恢复像素,而不是建模真正关心的状态。

6. 原洛的解法:以物体为中心+力模态闭环的“世界动力学模型”

  • 力为什么是关键模态:视觉换个角度得到的信息与机器人本体关系不大,但力“完全取决于机器人自身施加到环境中的作用”——施加的力大,反馈的力就大——因此与动作极其绑定、耦合。
  • 机制:模型同时预测未来图像与未来的力,再把预测的力与实际施加动作后的实测力比较、做闭环反馈,不能只做前馈;随着数据增多,估计误差逐渐减小,对物体交互规律的理解也逐步提升。

7. 收敛方向要从终局倒推:零样本/小样本泛化+可评估的安全边界

  • 倒推逻辑:终局是“零样本、小样本泛化”——把机器人放到新环境里,经过一次展示,甚至无需展示,就可以动起来、理解并完成任务;同时要“绝对安全、知道自己的边界、异常能处理”。因此需要提高数据效率,并能评估自身输出的不确定性边界。
  • 正在发生的尝试:降低数据采集成本(egocentric 第一视角数据,原洛2023年起就在实验室采集)、提高信息密度(以物体为中心、从二维或多视角二维信息中隐式推导三维——“三维是对环境更本质的理解”)、采集力觉和触觉数据(包括触觉手套等传感器);原洛也在探索视觉与触觉融合,并建立了自己的数据采集链路。

8. 软硬进展错位:硬件进展快于体感,软件演示快于范式创新

  • 硬件“看起来发展没那么快,但工程上取得的进展很快”:新一代机器人的重复定位精度、绝对定位精度“已经能逼近以往工业机器人的级别”——两年前不敢想象;得益于国家投入与百花齐放,上游机加工、电子、传感器成熟,协议和标准逐渐形成,“硬件迭代速度甚至已经能够逼近软件迭代速度”。
  • 软件方面,直觉上看到的事情和演示的漂亮程度提升很快,但拉长时间维度看,进展没有想象中那么快:研发范式没有特别大的颠覆,仍在沿用大语言模型的方式。机器人输入空间极其复杂——视觉、力觉、触觉、关节以及无法通过视觉观测的状态(“水是满的还是空的、电器是开的还是关的”)——输出空间则是机器人自身的控制,因此与大语言模型本质不同。

9. 具身智能的定义:逻辑之上,还有几何和物理

  • 李丰的外行框架——他自陈非技术背景:语言是逻辑关系,同一个意思可以有多种表达;机器人则面对明确的物理和环境约束,“不能把手穿过桌面,也不能直接把瓶子捏破”。
  • 连文昭完全赞同,并补充说大语言模型中很多局部最优可能都是好的;但机器人不只是逻辑问题,还包含几何(运动学:关节转动多少度、末端移动多少厘米)和物理(动力学:施加多大力、摩擦力是多少、物体会被推多远或转多少度),因此“是一个比大语言模型更难的问题”。他的非正式定义是:“在很多约束条件下如何去改变目标物体的状态”——“很多时候有精确解,做到就是做到”。
  • 结论:如果这一判断成立,机器人可以借鉴 LLM 的 next-token prediction,用关联近似因果;但文字本身没有时间概念,物理世界有时间维度,还必须加入因果约束和时间维度。

10. 为什么死磕 AI for Science:不可能三角里牺牲速度,选最难的考场

  • 场景选择逻辑:通用性、可靠性、速度的不可能三角中,速度只求达到一定阈值,通用性适当收缩到“解决几十件、上百件或者更多事情”,但场景不能把技术天花板卡死、不能牵引到短视路线——所以选长序列(拷问逻辑)、高精度(拷问几何和物理)、高柔性的泛实验室任务,“如果能把这些做好,一定能解决未来走向家庭场景时的很多问题,甚至是1万件事情”。
  • 行业真痛点一:实验不可复现——“25度混匀”有人从4度冰箱拿出后放到25度环境中一小时,有人直接倒;实验过程中还可能打喷嚏。正是这些细节导致实验难复现,“10年、10个亿、10%的成功率”仍是痛点;机器人可以忠实、细粒度地执行每一步,并记录每个条件和参数。
  • 痛点二:昂贵仪器绑定人的朝九晚五,利用率可能只有30%—40%,研发流程被拉长;机器人作为实验助理串联、调度仪器,能够“提质又提量”,危险实验也不必由人完成。

11. Moderna信号与湿实验瓶颈:机器人是“生成到验证 Gap”的物理 API

  • 李丰援引本周信号:Moderna 已宣布个性化肿瘤疫苗三期临床有显著结果,其中包括药物联用;新闻也提到筛选过程中使用了 AI。他引述的判断是,AI 改变科学发现范式后,“最大的瓶颈就来到了湿实验”,需要足够多、足够快、足够整齐的数据回到预测循环。
  • 连文昭介绍能力:液体、固体、粉末或颗粒样品处理,离心机、PCR 等常见仪器及流程,“80%以上已经可以复现”,至少局部能够形成小闭环;这相当于自动驾驶上高速后的 L2 辅助驾驶,是辅助而非替代科研人员。下班前安排晚上6点做实验,不必半夜2点回来换液,第二天早上9点结果已经读出。
  • 关键类比:机器人行业常讲“think-to-real gap”,这里是“生成到验证的 Gap”——数字 AI 已能在巨大搜索空间提出假设和实验流程,但不可能靠人海战术逐一验证;原洛提供可被调度的物理 API,把这个鸿沟闭环起来。

12. 硬件保下限、模型提上限;撕保鲜膜标出能力边界

  • 分工判断:“硬件上的提升是保的下限”——创业初期外采和自研的机械臂都抖动厉害、精度不够,现在硬件已经达到要求;“软件模型带来的更多是上限”——用多大成本教会、训练好模型来完成新任务。当前“下限比较稳,上限也已经达到了可部署、可交付的状态”,并将继续减少新任务所需样本量。
  • 还要克服的是高柔性:拧紧没拧紧、插紧没插紧、是否严丝合缝对齐等微小状态估计与反馈控制,需要大量数据采集清洗和训练架构调整。
  • 商业验证与竞争位置:与华大智造、中科院深入合作,细胞培养、细胞毒性检测已在客户场地真实运行;WRC逛展时,他没有发现与自身方向特别相关的公司,场馆虽大,但用商场类比,很多展示内容相似。
  • 边界的具象样本:撕保鲜膜是真实接到的需求,“硬做也能做,但真的特别硬着头皮上”——保鲜膜“又高透、又高反,还薄、一撕就破”,感知和力控都难;策略是以现有能力为圆心逐步、有机地拓宽。

13. 终局愿景:像 GPU 之于计算,做科学智能的“物理基座”

  • 价值主张:“人就是一个最好的 API,可以调度所有的接口”——智能机器人同样能以轻量、甚至零成本改造嵌入既有实验室,兼容新老异构仪器;更大的价值是闭环产生标准化、可信赖的数据,“有了 GPU 以后,我可以做以前不敢想的事情”,从而解锁过去不敢设计的实验拓扑结构,推动干湿闭环螺旋上升。
  • 商业接受度分层:降本增效(人工成本)最容易算;仪器利用率与实验通量提升普遍可接受;“实验质量提高、AI提出更好假设”的价值尚未被广泛接受,但未来可能是最大的价值来源。AI for Science 的热潮“已经能够看到一些苗头”;传统湿实验者与 AI 背景者“不是那么割裂,是混在一起的”,后者对数据能否积累、循环,可能更敏感。李丰还对照自己投过的晶泰、剂泰当年做实验自动化和干湿闭环的尝试。
  • 一年展望:“原点计划”希望让物理基座嵌入更多合作方,形成共享空间;在允许的范围内共享物理技能与数据,服务 AI for Science 研发。同时向农业、精细化工、制造业等其他行业扩展。收尾自评:“长期乐观、短期务实”,长期欢迎想死磕机器人真实场景价值的研发伙伴加入。