先锋 趋势 方法 投研 作者
World Model-世界模型也有Scaling Law吗?
返回节目精读

World Model-世界模型也有Scaling Law吗?

摘要

  • 世界模型可能存在 Scaling Law,但庄明浩把它定义为比大语言模型更贵、更慢、更依赖真实数据的“高摩擦版本”。 LLM 可以从互联网低成本吸收文本,物理 AI 却需要车辆、机器人、传感器、场地、安全监管和客户部署,反馈也更慢、长尾更复杂。飞轮“越来越重”,但达到一定速度后也可能变快。
  • 行业目前更像处于 GPT-2,而非 ChatGPT 时刻。 模型已经能生成世界、预测简单状态并在特定任务中控制车辆或机器人,但离开放世界里的可靠因果理解仍远;庄明浩的尺度是:方向已经清楚,资本也已重注,只是涌现阈值尚不可见。
  • 世界模型不是“更逼真的视频模型”,而是渲染、仿真与规划三种能力的合流。 理想模型既能从任意角度渲染杯子,也能模拟杯子被推倒后的轨迹,还能规划机械手安全拿起它;真正的问题是“如果我在这个世界里做一个动作,接下来会发生什么?”
  • 自动驾驶最可能首先跑通物理 AI 的 Scaling Law,因为量产车辆已经是持续采集真实世界数据的终端。 相比机器人,汽车主要在偏二维的路面上行驶,且安全需求、数据规模和商业模式更清晰;但数据壁垒意味着世界模型未必复制 LLM 的赢家通吃,而可能由自动驾驶、机器人、工业和游戏等垂直模型长期并存。
  • Momenta 的核心资产不是单个自动驾驶算法,而是“更多车—更多数据—更好模型—更多车企合作”的闭环。 截至2025年底安装车辆超过68万辆,节目所述当前量产规模已超过90万台、市占率应该超过65%,合作24家车企并覆盖全球前十大车企中的9家;跨车型、价格带、区域和驾驶风格的数据多样性,是单一车企较难复制的部分。
  • Momenta 的商业化和工程交付显示其飞轮已有启动基础,但世界模型外溢仍是待验证的远期可能。 庄明浩援引招股书称,其营收从2023年的7亿多增至2025年的20多亿,毛利率从17.5%升至71.6%;交付超过100款量产车型,完成10万台部署所需时间由早期24个月缩短至最快不到40天。“物理 AI 一定要有现金流业务作为支撑”,是其“门票理论”。
  • 真正值得跟踪的不是谁的 demo 最炫,而是谁能在安全、成本、性能和商业化之间稳定转动飞轮。 R7 以端到端大模型、强化学习和世界模型为主张,通过预训练、闭环仿真、强化学习三层推进;风险之一,是把一家自动驾驶公司的成熟业务与尚待验证的跨领域泛化能力过早混为一谈。

精读

1. 三个信号表明世界模型已成为融资与商业叙事的共同语言

  • 影视飓风为天猫618制作的实验把问题问得很直白:“在AI里抛硬币,概率是百分之五十吗?”团队进行一百多次测试,正面比例超过70%;庄明浩认为,这暴露的不是随机数问题,而是训练数据分布、后训练偏好与强化学习倾向如何进入生成世界。

  • BAI基金合伙人王天凡四月观察到,主流基金“有几个合伙人,就有几个主流融资的世界模型”;六月又称“每天收到至少一个世界模型的BP,有种回到B轮的感觉”。热度已经从科研议题扩散成创业项目的标准关键词。

  • 第三个信号来自通过港交所聆讯的 Momenta:一家已有量产收入的自动驾驶公司,开始用真实数据、强化学习和世界模型解释自身。它让世界模型不再只是 lab 的技术主张,而成为可以检查数据、收入与交付能力的商业样本。

2. 语言模型的边界与巨额资本共同推动了“下一条主线”

  • 庄明浩把过去半年语言模型的状态概括为“挡不住了”:写作、编程、总结、推理、工具调用和自主进化不断推进,模型领域融资据他估计已占美国一级市场超过60%、甚至70%。头部资产规模变大后,早期资本只能继续寻找语言之外的新机会。

  • Menlo Ventures 统计其覆盖范围内约有63家 New Lab,累计融资可能达到几百亿美元;该基金新一期早期与成长基金合计募得30亿美元,上一个周期约为13亿美元。New Lab 动辄融资数千万、数亿乃至十几亿美元,也反向迫使基金扩大规模。

  • 伊利亚、Mira、杨立昆、李飞飞等是这一轮 New Lab 中的明星创业者;这些公司和团队涉及自主进化、物理 AI、人形与具身智能、世界模型、AI for Science 及模型基础设施等议题。庄明浩反复使用“主张”一词,因为行业尚未收敛到共同架构,资本投资的仍是路径判断,而非已经验证的标准答案。

3. 世界模型要理解世界本身,而不只是人类如何描述世界

  • 李飞飞的比喻是,大语言模型像“身处黑暗中的语言大师”:能言善道、博学多闻,却缺少真实经验与根基。“The world is not made of words”——模型知道杯子会碎,可能只是因为文本如此描述,并非持续观察了光线、几何、重力、摩擦与液体流动。

  • 世界模型压缩的是时空和物理规律:杯子在桌面、水泥地或冰面上的轨迹不同;车辆变道会改变周围司机和行人的反应;机械手剥生鸡蛋与熟鸡蛋,需要理解力度、材质和形变。这些都不是单纯的语言问题。

  • 因而核心任务不是生成一段“看起来合理”的视频,而是回答:“如果我在这个世界里做一个动作,接下来会发生什么?”漂亮画面可以容忍编造,车辆制动、机器人抓取和碰撞预测却必须对动作后果负责。

4. 渲染器、仿真器与规划器正在汇成同一种基础能力

  • 李飞飞将现有路线分为三类:渲染器输出像素,为人的眼睛追求逼真;仿真器输出环境状态,要求几何、动力学、车辆轨迹和碰撞关系正确;规划器输出动作,决定机器人如何抓取、车辆如何转弯、加速或减速。

  • 庄明浩用雨夜高速避障划清边界:视频模型能做好镜头晃动、雨水反光和车灯效果,却未必知道何时刹车、是否会被追尾、向左转会不会侵入相邻车道,以及不同策略各有什么风险。“这不是渲染的问题。”

  • 理想模型应同时理解一个杯子的三种投影:任意角度渲染光影,模拟推倒后的运动,并规划机械手拿起而不摔碎。三者底层共享几何、物理、动力学和对象互动规律,因此“三线合一”比单独提升视频清晰度更接近终局。

5. 资本热度背后是真实焦虑,而不只是新的 buzzword

  • 世界模型已经像此前的“元宇宙”一样变成什么都能装的框,但庄明浩不急于判断泡沫;他更在意热度背后的问题:既然“正确预测任务+数据+模型+算力”让 LLM 出现 Scaling Law,预测下一个物理状态能否复制这条路径?

  • 节目引述 CB Insights 2026年第一季度报告称,物理 AI/世界模型方向约占11%,是分散的 AI 细分类别中最大的方向;但原文先说该方向占“项目投入”的比例,随后又说占“融资额”近11%,具体口径未进一步明确。中国的 IT 桔子报告统计了30多家相关初创公司,85%以上成立于2023年以后,累计融资数百亿元人民币。

  • DeepMind、英伟达、视频模型、自动驾驶、机器人和 AI 3D 公司从不同入口进入同一战场。庄明浩扩展了自己此前“多模态从垂类战场走向统一战场”的判断:今天这个统一战场不再只有视频模型,还加入了自动驾驶和具身智能。

6. 物理数据的成本与密度决定了 Scaling Law 不会平滑复制

  • LLM 的网页、书籍、百科和代码相对容易获取;世界模型的数据却要求车辆真的上路、机器人真的工作、工业设备真实运行。每条数据背后都有硬件、场地、人力、安全与合规成本,“跟爬一个网页,不可能是一个数量级的”。

  • 物理数据看似丰富,语义密度却可能更低。“司机看到儿童突然跑出,急刹并向左避让”一句话已压缩关键事实;真实采集却需要几秒视频、摄像头、雷达、车辆轨迹与标注,而真正有价值的事件可能只发生在一个瞬间。

  • 因此,训练对标 LLM 的世界模型所需数据可能不是多一点,而是多几个数量级。视频数量本身也不够:还要筛出高质量数据,并积累足够长的长尾分布,才能覆盖物理系统更严格的安全边界。

  • 这使 Scaling Law 从“越多越好”变成供给与闭环问题:能否持续拿到真实数据,样本是否多样,长尾是否充分,哪些样本高质量,以及结果能否反馈回训练环境。任何一环断裂,规模都未必自动转化为能力。

7. 自动驾驶最接近闭环,但涌现阈值仍无人看清

  • 相较于机器人,量产车已经每天行驶在不同道路、城市、天气和交通环境里;每辆车都是数据采集点,用户开车本身就成为内容来源。自动驾驶因此是最有机会首先验证世界模型的场景。

  • 庄明浩仍明确判断“截止到这个时间点还没有出现涌现”。现有模型可以生成世界、预测简单变化,并在特定任务里控制车辆或机器人,却还不能在开放世界中可靠理解完整因果链;数据要“大到什么程度”才跨过阈值,目前观察不到。

  • 若强行类比 GPT,他认为世界模型“大概像 GPT-2”,尚未到 GPT-3 已基本显现曙光、更未到 GPT-3.5 催生 ChatGPT 的阶段。资本密集、演示兴奋与局部商业化都已出现,但不等于通用能力已经形成。

8. 三条明星路线仍在争夺世界的基础表征

  • 杨立昆的主张是不直接生成像素,而在潜在空间预测状态变化。庄明浩概括其优势为计算效率较高、泛化较强,代价则是可解释性较差;它押注抽象表征,而非视觉结果本身。

  • DeepMind 走多模态加演进路线,在大语言模型底层架构上叠加视觉、空间感知和强化学习。Genie 3 的演示仍从视频生成与可操作性出发,庄明浩认为这是相对务实、且已经呈现一定效果的方案。

  • 李飞飞的 World Labs 则押注3D空间表征:先把世界本身生成出来,把空间与物理表征视为基座。三位前沿科学家的主张已经发生明显分野,但节目拒绝在现阶段提前宣布胜者。

9. Momenta 的数据飞轮建立在量产规模与跨车企多样性上

  • Momenta 的循环很简单:量产方案带来收入和真实驾驶数据,数据训练并优化模型,更好的模型反哺量产业务与 L4 尝试,再吸引更多车企合作。“更多车带来更多数据,更多数据带来更好的模型”,难点是先拿到让飞轮启动的车和客户。

  • 截至2025年底,其安装车辆超过68万辆;节目所述当前量产规模超过90万台,市占率应该超过65%。公司与全球24家车企合作,覆盖全球前十大车企中的9家,多家车企同时也是战略投资人。

  • 相比特斯拉或单一国产车企自研,Momenta 数据来自不同厂商、车型、价格带、地区和驾驶风格。庄明浩认为,训练分布越窄,泛化越难;跨品牌数据的多样性,可能是比单纯数据量更关键的壁垒。

  • 这仍是典型的鸡蛋问题:没有车就没有数据,没有数据就难以改善模型,没有模型又拿不到车企客户。Momenta 的阶段性优势,是已经跨过最初的商业部署门槛,而不是证明飞轮永远不会被追赶。

10. 现金流、工程交付与 R7 共同构成物理 AI 的“门票”

  • 庄明浩援引招股书称,Momenta 营收从2023年的7亿多增至2025年的20多亿,毛利率从17.5%升至71.6%;许可收入越来越多,收入结构由项目制向近似 SaaS 的软件许可转移。公司仍亏损,但亏损规模正在收窄。

  • CEO 曹旭东将其称为“门票理论”:物理 AI 必须有现金流业务支撑,因为上车测试、部署、合规、维护和车企磨合无法像 app 一样全球即时分发。若从 GPT-2 走到 GPT-3.5 需要漫长周期,没有现金流的纯研发公司可能先被融资环境淘汰。

  • 工程化同样不是论文指标。Momenta 已交付超过100款量产车型,需要适配不同车型、传感器配置、质量安全标准、成本和交付周期;第一个10万台量产曾耗时24个月,如今最快不到40天即可完成10万台交付,说明部署正在平台化。

  • 技术上,公司从2022年的深度学习模块化系统,走向2024至2025年的端到端大模型;2025年的 R6 将强化学习引入全流程,R7 则明确采用“端到端大模型+强化学习+世界模型”,奖励目标覆盖安全、舒适和效率。

11. R7 把世界模型拆成三层,但 ChatGPT 时刻仍将渐进到来

  • R7 第一层以海量真实驾驶数据预训练,把物理规律、常识和因果关系压缩进模型;第二层建立闭环仿真,让模型推演采取某个动作后世界如何变化,并在仿真中评估真实道路上罕见、难以复现的长尾场景。

  • 第三层是在高度接近真实的虚拟环境中强化学习,让模型不再只是模仿人类司机,而是通过试错寻找更安全、高效的决策。“模仿人类总会有极限”,能否设计出有效奖励并产生更优行为,决定这套架构能否真正起飞。

  • 落地顺序可能是自动驾驶最先,其次是容错率更高的游戏、虚拟世界和影视交互内容,再之后才是机器人、工业仿真、数字孪生乃至 AI for Science。机器人面对完整3D空间、柔性物体、手眼协调与材质形变,难度远高于二维道路上的车辆。

  • 世界模型也可能不会形成 LLM 式的少数赢家垄断:汽车、机器人、仓库、工业、手术机器人和游戏有不同传感器、动作空间、风险边界及商业约束。底层表征可以共享,但垂直数据壁垒会长期存在,Momenta 的机会首先在自动驾驶而非包办整个物理世界。

  • ChatGPT 时刻要求大众直接感知、产品门槛极低、通用性足够强,并带动产业链全面爆发;世界模型目前展示的仍多是酷炫视频、机器人马拉松和各类场景演示。“物理世界不允许你差不多”,所以真正的检验已不是谁的 demo 强,而是谁能长期平衡安全、成本、性能和商业化。