先锋 趋势 方法 投研 作者
84.49 家央企采买进场,史上最热WRC:泡沫被挤压,具身行业进入实战阶段|14 年从业者的行家鉴别指南
返回节目精读

84.49 家央企采买进场,史上最热WRC:泡沫被挤压,具身行业进入实战阶段|14 年从业者的行家鉴别指南

摘要

  • 主持人将本届 WRC 概括为行业从表演走向实战:叶杨笙观察到人流比去年更多、现场“都走不动路了,已经赶上 WAIC”,真正动起来的机器也变多;进展少的产品今年“不好意思拿出来展示”。 定时演示可能意味着对成功率不太自信,或硬件不足以支撑长时间运行;仙工咖啡、自变量物流分拣和星尘智能的一些 demo 则持续运行。
  • 出货量惊人,但真实需求占比可能很低:节目引用的数据显示,2026 年上半年全球人形机器人出货量约 2.2 万台,中国厂商占 97%;智元 9,700 台、宇树 7,000 多台、银河通用 1,100 台,前五家合计 86%。 叶杨笙判断,排除跳舞表演后,真实落地需求占比有 10% 已经非常好;太空舱零售因 ROI、泛化性和数据价值不足不算真实需求,另有一些机器用于数据采集、科研教育,很多可能在工厂吃灰。
  • “VLA+世界模型+全栈自研”存在很大水分:叶称目前真正买千卡以上、疯狂买数据并投入预训练的创业公司可能只有一到两家;他随后强调这是不完全统计,真正有千卡投入的可能就两三家,数量远少于 PR 口径。 千卡集群及存储每年投入几个亿,可从排队上市公司的财务和路演材料中大致倒算,但材料显示并没有那么多公司在做。部分头部企业选择把钱留在账上,等范式更清晰后再投入,叶认为从务实角度看没有错。
  • 速度和 ROI 的差距仍然明显:对“机器人速度达到人类 70%—80%”的说法,叶认为可能只有物流分拣接近,大部分任务还没到;达到 50% 也可能因机器可持续工作而具备可接受的 ROI。 但叠衣服仍是机器两分钟、人十秒,差距“还在一个数量级上”,行业虽有进步,却还没有飞速进步。
  • 大脑能力高度同质化,Agent OS 是较务实的路线:大家基本 follow π0 的成果再做改进,展台上无法仅凭 demo 分辨是否使用了世界模型或自研预训练,只能听厂商讲。 叶看好将经典控制算法和模型能力原子化,由 Agent 调度完成长程任务,并处理恢复和抗干扰;世界模型的潜空间预测也天然不易展示。
  • “神经”与数据标准是底层瓶颈:神经更多指连接传感器与执行器的高速、稳定总线协议栈,机器人行业还缺少统一标准。 数据痛点包括格式、时序、标注和采集口径不统一;多传感器需要达到几十纳秒级同步,并尽量采用硬件对时。仙工计划用场景重建与资产化、人类示范、真机轨迹、人类接管数据构建数据集,再配套 benchmark、真机回流和训练评测平台。
  • 今年的进步主要来自后训练,明年看数据与 VLA:叶认为今年不是世界模型带来的进步,而是后训练、数据质量提升和工程能力增强;AI Coding 也会加速工程能力。 明年数据和 VLA 可能出现更多成果,验收指标是动作速度,以及能否在空间中持续移动作业、从开始到结束都不靠定时演示。宇树上市、融资周期和机器人行业的长期性,则意味着企业仍需准备足够资金熬过周期。

精读

1. WRC 更热,但进展少的产品不再适合展示

  • 主持人将本届 WRC 视为行业从表演走向实战的节点;叶杨笙的现场感受是,人比去年还多,“都走不动路了,已经赶上 WAIC 了”,而且真正动起来的机器变多了。进展少的产品今年可能“没有办法拿出来亮相,也不好意思拿出来展示”,很多进展中的东西自然没人会过来看。
  • 行家对“定时演示”的判断是:一方面可能“对成功率不太自信”,需要有人在旁边盯着;另一方面可能是硬件不足以支撑长时间运行。仙工的半自动咖啡机则从压粉、萃取到清洗粉饼,整个长流程与人操作接近,“一天到晚都在做咖啡”。
  • 自变量的物流分拣全天运行、节拍很快;星尘智能的多项 demo 也可能一直在运行。被问逛展后是更有信心还是更紧张,叶的回答是:“相对来说,我觉得还是挺有信心的。”

2. 星尘智能超市拣选:全场难度最高的展示之一

  • 叶印象最深的是星尘智能的超市拣选:机器人要把商品放进购物袋,抽出袋绳、用机器扣住,再用封口机封口。任务对精度要求高,过程中可能失败多次,但最终能够完成;在他看来,这是整个场馆任务最长、难度最大、技术含量最高的展示。
  • 自变量的物流分拣节拍很快;泛化抓取则已经有多家公司做出来,可以展示 VLA 的推理过程,在不少场景中已有一定可用性。
  • 机器人跑步、冲刺和天工机器人运动会属于热门话题,叶看到的感受是“可能是跑得太快,冒火花了”。加速进化的踢球互动可以让观众当守门员,但叶体验后认为很难守,机器人踢来的力也很大;乒乓球机器人则主要展示小脑运动控制,完整做下来难度很大。
  • 关于黄仁勋女儿到 WRC 的话题,叶说自己没有看到,因为“太忙了”。
  • 灵巧手方面,主持人提到今年刚成立的章鱼动力;叶观察到它把手和小臂一体化设计,整体很仿生。肌电信号也是一个趋势:肌电手环戴在腕部,再结合传感手套,可以用两重数据验证手部姿态,并反向观察肌肉放电、验证动作采集是否正确。

3. 行家鉴别指南:遥操作还是自主系统

  • 叶看展时会观察细微动作,并寻找隐藏的遥操作台。双臂机器人如果一只手动完、另一只手再动,可能有人在遥操作;如果左右手同时运动且轨迹不同,则更可能是自主规划。
  • 失败后的恢复能力也是关键:是人工重启、从头开始,还是排除出错物体后可以继续运行?这既考验模型能力,也考验长序列 attention 的处理能力。
  • 他会拿纯白、与桌面颜色接近的物体与机器人互动,并用手机闪光灯改变光线,观察系统对物体和环境变化的反应。
  • 布展期间也能看出真实水位:环境和灯光变化后,有些公司的成功率一开始会很低,需要现场补采数据、再训练。叶看到不少公司连续两三天在旁边录数据。主持人此前举智元为随时有人演示、真人互动的例子;叶随后表示,智元完全基于仿真,在仿真空间里穷尽环境可能性,因此不需要现场补采数据。
  • 其他问题还包括:“剪了几条、加速几倍,网络断了还能动吗?”以及“成功率是挑了多少次场景算出来的?”后者本质上是如何选择分母的问题。叶认为,在行业热度高、竞争激烈的情况下,数据口径存在选择性披露可以理解。

4. 采购日推动具身走向真实场景

  • 本届大会设置采购日,央企和大型企业带着采购项目进场,具身行业客户也出现在现场。主持人认为,“人机共生,产学共荣”中后半段是本届 WRC 与往届的重要区别。
  • 仙工展示了配送机器人加机械臂的酒店送外卖场景:机械臂从地上拿起外卖、按电梯,最后再把机器人身上的外卖放到地上。相比之下,传统配送机器人往往需要外卖员或前台放入外卖,再依靠梯控到达房间附近。
  • 主持人提到,上一代酒店机器人已经能够对接梯控,并追问“为什么非要用手去按电梯”。叶的答案是成本和合规:改造电梯需要额外投入,海外还会受到安全法规和更高改造成本影响,基本不允许走这条路;在海外,人怎么使用电梯,机器人就要尽量怎么使用。
  • 国内电梯属于特种设备,改造涉及报备和施工,会增加周期与成本。机械臂方案的价值还在于减少人工放入、取出外卖;在酒店式公寓或小区等工作人员较少的场景中,接受度可能更高。
  • 去年常见的是人形机器人站立展示、下半身不动;今年更多公司直接把两个双臂系统放在桌面上做 demo。叶认为,如果下半身不需要移动,让人形机器人站着做咖啡并没有必要。主持人则提出,人形机器人可能是机器智能终局的里程碑,但它的定义并不必然要求两条手臂,有些场景一条手臂也可以。

5. 出货量神话与真实需求

  • 节目引用的数据是:2026 年上半年全球人形机器人出货量约 2.2 万台,中国厂商占全球 97%;智元 9,700 台、宇树 7,000 多台、银河通用 1,100 台,前五家合计占全球 86%。叶认为,中国具身智能在全球产业中已经具有支配性地位,原因在于中国制造业和供应链基础强;他同时表示,原话中提到的“派、journalist、Diana”等国外公司展现出的模型能力确实领先,但在人形本体硬件上难以与中国竞争。
  • 真实需求占比方面,叶延续去年的判断:如果排除跳舞和表演,真实落地需求能有 10% 已经“非常非常好了”。他认为公布的订单量“要除以 10”。
  • 太空舱零售场景不被他视为真实需求:一是 ROI 算不过来,二是任务泛化性弱,环境单一、商品固定,难以持续产生有价值的数据,也无法通过铺设更多机器人摊薄成本、提升智能泛化性。
  • 除了真实需求,还有一些机器人被用于数据工厂、科研教育和研发测试;很多“可能确实是在工厂里吃灰”。但出货量本身还涉及收入确认口径:是出货就确认,还是客户签验收单后确认,未上市公司又不披露完整财报,因此外部很难准确判断。
  • 叶还指出,仙工已有足够多的工厂客户和场景,但尚未在这些客户那里看到人形机器人的实际落地。

6. 速度与 ROI:差距仍在一个数量级

  • 对星尘智能高继祥所说的“机器人速度大概是人类的 70%—80%”,叶认为要看任务类型,大部分任务还没达到,物流分拣可能接近。
  • 他认为,70%—80% 已经足以算过 ROI,因为机器可以持续工作而人需要休息;即使只有人类速度的 50%,某些场景也可以接受。
  • 对北京人形机器人创新中心熊友军关于“人形机器人 ROI 差距正在迅速缩小”的判断,叶表示自己“没有看到有明显的缩小”。例如叠衣服,机器人可能需要两分钟,人至少十秒就能完成,差距仍在一个数量级上。
  • 主持人说明熊友军强调的可能是未来趋势,叶对此表示认同;从 WIC 到 WRC,他确实感到技术相比去年有明显进步,但整体还没有达到让他觉得行业在“飞速进步”的程度。

7. 场景收敛进红海:搬运和上下料

  • 物流搬运、工业上下料、咖啡机、物品收纳、遥操作复刻和泛化抓取成为高频 demo,叶的解释是:“可能只有这些场景能做,再复杂的场景,技术还没有达到。”
  • 工厂自动化发展到今天,大部分工作已不需要人做;仍需要人的主要是搬东西和上下料。打螺丝基本已由协作臂或专用设备完成,几乎不再是具身智能的主要切入口。
  • 工业制造、汽车和 3C 电子等行业数字化、自动化程度高,也有足够预算;叶过去接触的工业客户还包括物流和半导体。他认为这些方向虽然红海,但规模接近百万级,需求本身没有问题。
  • 国内 300 多家公司竞争类似的方向,叶认为很正常:机会有限、参与者太多。参照移动机器人和协作臂的发展,最终可能剩下头部公司,以及一些有中央部委背景的公司,总数也许只有十几家。

8. 世界模型仍然难以展示

  • 叶认为世界模型 demo 不多,原因是它本身不容易展示。他引用李飞飞对世界模型的三分法:生成、仿真评测和规划。
  • 前两类偏生成式:通过自然语言生成符合物理规律、可交互的场景,用于仿真或训练。第三类规划型世界模型可能存在于隐空间中,预测未来一段时间物体或环境的变化,再辅助机器人规划。
  • 隐空间的预测如果要展示,通常需要重新扩散成可视化空间,最后呈现出来的视频与 VLA demo 可能没有明显区别。
  • “VLA 加世界模型加全栈自研”是科技公司普遍采用的表述。叶认为探索阶段出现这种说法很正常;关键模组里的嵌入式软件和驱动,为了控制机器人并与小脑运控结合,自研是一个必然趋势,头部公司也可以自行进行 VLA 和世界模型预训练。

9. 预训练投入仍然谨慎

  • 对“VLA+世界模型+全栈自研”是否有水分,叶直言“水分非常大”。他把真正做预训练定义为:购买 1,000 张卡以上、持续购买大量数据,并真正投入预训练。
  • 排除字节、蚂蚁、宁德时代等大厂后,他判断创业公司可能只有一到两家在真正做预训练;随后又强调这是不完全统计,真正有千卡投入的可能就两三家,数量比 PR 口径少很多。
  • 千卡集群、存储等基础设施的年度投入可以倒算,按等效 H100 计算可能达到几个亿。二十多家排队上市的公司已经需要提交财务和路演材料,但从这些材料看,并没有那么多公司在做千卡预训练;国内也没有足够多的卡分给这么多公司。
  • 叶认为,很多公司不是没有钱,而是范式尚未被摸清,担心现在投入是在“给别人做嫁衣”:一旦人才流动,别人就能复用已经探索出的路径。类似智驾,技术路线逐渐趋同后,竞争重点可能转向数据回流和工程能力。
  • 节目讨论了“永续公司”的说法:公司融到几十亿元后暂时不投入,每年利息也许足以覆盖数百名研发人员工资,等行业出现拐点再出手。叶用“螳螂捕蝉、黄雀在后”形容这种策略,并认为从务实角度看没有错。
  • 主持人引用王兴兴的观点:如果前期不训练自己对数据、架构和模型算法的感觉,只等范式成熟后再抄,可能没有那么有效。叶认为这有道理,但机器人还需要真机数据和场景理解;矛盾在于,不做预训练可能不知道什么是好数据,而提前采集的数据在未来范式变化后又未必有用。同时,等拐点到来时,手上是否有足够多的机器在外面,也同样重要。因此各家公司都在争抢有限的场景和客户。

10. Agent OS:当下较务实的大脑路线

  • 叶认为,大脑能力目前高度同质化,基本都在 follow 国外最前沿的成果;大家普遍认可 π0 的效果,很多公司基于 π0 的成果做自己的改进。
  • 展台上无法仅凭 demo 分辨它使用的是 VLA、VLA 加世界模型,还是自家预训练,“分辨不出来,只能听他讲”。原因是展台任务通常较有限、移动范围较小,VLA 本身就可能足够。
  • 叶提到,Google 最近发布过一种基于 Agent System 的架构,由多个专家模型和 engine 负责调度,但他没有说出模型名称。与其继续训练一个极大的模型,不如将能力原子化:一部分用经典控制算法实现,以获得更稳定、更高效的表现;另一部分用模型实现。
  • Agent OS 的作用是了解有哪些能力、调度这些能力完成长程复杂任务,并在出错时恢复、抗干扰。叶认为这是目前比较务实的方式,仙工也在做相关研究。

11. “神经”与数据标准是底层瓶颈

  • 叶所说的“神经”更多是连接传感器和执行器的高速、稳定总线协议栈。机器人拥有大量传感器和执行器后,需要高速接收、处理并传递复杂信号,同时保证抗干扰和稳定性。
  • 类比智驾,激光雷达、摄像头等传感器增多后,汽车原有的 CAN 总线或 EtherCAT 在性能、带宽上可能不足,未来可能使用以太网等方案。机器人行业目前也还没有一套统一总线或协议标准,方便传感器接入小脑和大脑;这涉及芯片层和协议软件层。
  • 数据标准的四个痛点分别是:
    • 格式:各家公司自定义数据结构,数据不能直接被别人的模型使用,需要先转换;数据量大时,转换本身就是成本不小的“脏活”。
    • 时序:多传感器和执行器数据都要打时间戳,时间同步基本需要达到几十纳秒级;传感器最好支持硬件对时,单靠软件对时精度不够,否则会造成时序误差并影响模型效果。
    • 标注:除了“这是一个杯子”,是否还要标注透明度、物理状态、速度等内容,行业尚无共识,标注结果也因此难以复用。
    • 采集口径:大脑究竟需要什么数据仍在探索;由于各家公司本体不同,各自定义的数据格式、标注和时序体系也难以归一化。

12. 损耗论与仙工的数据蓝图

  • 主持人转述王兴兴在开幕演讲中的判断,叶评价为“非常对,也非常精准”:语言模型的输入输出是固定向量空间里的数字编码,损耗较少;机器人每次输入输出都会引入偏差和损耗,触觉层面的细微误差甚至难以修正,成功率会随之下降。
  • 叶将问题归结为数据不完备:人类究竟依靠多少种模态才能做好一件事也很难说清,而机器人当前采集的模态仍然太少,主要是图像和视觉,近期才逐渐加入触觉或力信息。
  • 触觉、肌电信号和电子皮肤可能成为增量方向,带触觉或肌电的 VLA 论文正在增加;但叶暂时还没有看到真正落地的案例,采集手套和设备成本较高,实际用于场景仍有难度。
  • 仙工希望构建一套较完整的数据集:
    1. 采集环境场景,进行 3D 或 4D 高斯重建,并把杯子、柜子、门、抽屉等前景做成可交互的物理资产;单纯重建只是像素,物体无法真正被抓取或操作。
    2. 采集广视角的人类示范数据,配合异构或专业设备、长程任务和语义化标注。
    3. 收集真机运行轨迹,可来自遥操作,也可来自已有模型、经典方法或规划控制。
    4. 收集人类接管数据:机器人出错时由人干预、示教或遥操作,告诉它正确动作是什么。叶认为这类数据可能质量最高。
  • 这些数据可以用于训练 VLA 和世界模型,并进一步推出 benchmark,定义任务、成功率和成功状态的评价标准。仙工计划开放数据集、让模型参与打榜,同时把真机接入平台实时回流数据,后端负责模型训练、仿真和评测,再把模型回到机器人大脑中。
  • 仙工的数据业务希望复用其“当年把控制器做到全球第一”的底层能力,前后两端都做得更长:前端连接更多真机、持续回流数据,后端完成训练、仿真和评测,以提供价值的方式推动行业形成事实标准。

13. 后训练、资本周期与明年指标

  • 对今年的技术进步来自强化学习还是世界模型,叶的回答是“不是世界模型,是后训练带来的”。他进一步提到数据质量提升和工程能力增强;主持人追问 AI Coding,叶认可它会加速工程能力。
  • 叶认为今年从数据管线到无本体数据、世界模型都仍在探索,尚未展现特别大的成果,但行业今年投入了大量资源去寻找高质量、低成本的数据,建设管线和基础设施,因此明年在数据和 VLA 上“应该都会有很多比较惊喜的结果出来”。
  • 明年观察 WRC,他最关心两个指标:动作速度是否足够快;机器人能否在空间中移动到不同位置、持续完成不同任务,从开始到结束一直运行,而不是定时演示。
  • 关于宇树上市,叶认为对机器人行业是好事,市值越高越能建立行业标杆和信心。对于排队上市公司的收入真实性,他没有直接判断是否存在财务问题,而是说明审计可能核查:机器人放到工厂但没有使用,不能确认收入;签了验收单但实际未使用也不行;卖给代理商却未到终端客户不能算;把机器人卖给数据厂、再买回数据则可能构成“体内循环”,严格意义上存在问题。
  • 融资方面,主持人提到“投资人来加你,先晾他几天”、一个月一轮等融资饥饿效应,叶没有批评,反而说“赶紧多融点钱”。机器人和具身智能是很长的赛道,资本市场有周期,企业可能需要熬过资金不易获得的阶段。
  • 叶从约 2013 年开始接触机器人,先做 RoboCup 足球机器人,后来做移动机器人、控制器,再进入具身智能。他认为成本已大幅下降、性能和智能性大幅提升:过去一个小电机可能要 1 万元,如今人形机器人成本可能约 10 万元、甚至不到 10 万元。各家公司差距可能不超过半年,但行业整体起点仍低、提升空间很大。
  • 他最难忘的画面是仙工摇签:现场人很多,围栏一拉开,大家反而沿着围栏排起了队。