先锋 趋势 方法 投研 作者
Moonlake:交互式、多模态世界模型——与 Chris Manning 和 Fan-yun Sun 对谈
返回节目精读

Moonlake:交互式、多模态世界模型——与 Chris Manning 和 Fan-yun Sun 对谈

摘要

  • Moonlake 在视频生成与世界建模之间划出一条硬线:真正的世界模型必须由动作条件化、可交互,并在长时间跨度内保持一致。 Veo 3、Genie、Marble 或 Sora 生成的逼真画面,即使看起来很有说服力,也可能没有真正表示3D状态,或无法预测某个动作在几分钟后会带来什么变化。决定性测试是:“我能否与世界中的物体互动,并看到动作产生的正确后果?”

  • Moonlake 的效率论是“结构,而非规模”,但也明确承认“规模同样重要”。 互联网视频提供了观察结果,却很少记录引发这些结果的动作;语言则已经把“教授”“居高临下”等抽象概念打包成有意义的 token。Sun 认为,语义结构或许能让 Moonlake 在仅使用像素的方法所需数据量的基础上减少“5个数量级”,同时继续受益于规模扩张。

  • Manning 的逆向押注是:语言和符号是认知基础设施,而不是低带宽的信息残余。 针对 Yann LeCun 更偏视觉优先的世界观,他指出语言、数学和编程都是能够支持抽象与延展因果推理的“认知工具”。他认可 JEPA 的联合嵌入前提,但认为即使输出按自回归方式生成,transformer 的权重本身也可能承载联合表征。

  • Moonlake 通过2个模型将因果状态与视觉保真度分开:一个多模态推理系统,以及扩散渲染器 Reverie。 前者负责因果性、持久性、逻辑和游戏状态,包括几何、物理、可供性与音频触发;Reverie 则在不牺牲交互性的前提下,对这套持久表征重新赋予视觉风格。保龄球演示将架构具体化:拿起球、击倒球瓶、改变比分、重置游戏,以及复现这些后果,都比生成一段看似可信的片段更重要。

  • 游戏是商业化切入口,同时绑定着一个异常激进的渲染主张。 Sun 认为 Reverie 可能成为“下一代渲染范式”,取代光栅化器和 DLSS,并支持“世界皮肤”和可编程效果——例如收集10个苹果后,子弹可以在游戏循环中变成苹果。产品还意在形成数据飞轮,让创作者暴露出哪些能力仍需改进。

  • 具身智能是相邻市场:围绕目标生成一组定制化环境,再在其中训练和评估策略。 场景可以从救援无人机,到让吸尘机器人稳健地穿行于某间办公室不等;最终产品可能是模拟本身,也可能是证明某项策略会在哪里失效的证据。Sun 并未声称这能解决奖励投机问题——当奖励函数仍未正确设定时,他的回答是“未必”。

  • 评估仍然必须围绕具体用途展开,也难以被单一排行榜概括。 拟议的终端指标包括玩家在生成游戏中停留的时间、设计师能否在合理时间内做出自己设想的体验,以及经过模拟训练后在现实世界中的稳健性。Manning 预计用户会大规模“用脚投票”,因为漂亮画面可以掩盖糟糕的玩法,正如静态基准无法判断助手能否提供有用的购物建议。

  • 执行仍处于早期并受技术约束,但建设路线已经明确。 Moonlake 约有18人,总部位于 San Mateo,并计划迁往 San Francisco;公司承认数据受限,也承认仅靠结构化生成很难达到照片级真实感。招聘目标覆盖代码生成、计算机视觉、图形学、游戏引擎、强化学习,以及多模态潜空间对齐,试图建立贯穿文本、音频、图像和视频的自我改进循环。

精读

1. 交互式数据,而不是更漂亮的画面,打开了机会窗口

  • Fan-yun Sun 追溯 Moonlake 的起点:他在 NVIDIA Research 攻读博士期间,为强化学习和具身智能 agent 生成交互式环境。NVIDIA 和学术机构当时愿意支付大笔费用,购买用于训练和评估的人工策划世界,这暴露出的首先是供给问题,而不只是图形问题。Sun 还提到,联合创始人 Sharon 曾与 Fei-Fei Li 和 Andrej Karpathy 共事,之后又与 Ron 和 Chris Manning 工作,这让他与 Chris 建立了联系。

  • 在相关的基础模型研究中,Sun 的团队生成了合成数据,证明其“在多模态预训练中与真实世界数据同样有用”。他的结论是,具身通用智能必须学会动作带来的后果,而训练这些后果所需的交互式数据需求正在“指数级增长”。

  • Manning 的判断更广泛:计算机视觉研究的规模长期远大于语言研究,但视觉理解在物体识别之后“某种程度上停滞了”。在当代视觉语言模型中,他认为“90%的工作是语言完成的,视觉几乎不起作用”,原因在于主流系统仍然过度贴近表层像素。

  • 他自己的转向始于视觉问答:当模型无论看到什么图像,被问到桌边坐着几个人时都回答“2”,其语义落地能力的缺失暴露无遗。学生的热情与创造力,加上他在语言、视觉和生成式图像领域的工作,共同把他进一步推向了世界模型问题。

2. 世界模型必须预测几分钟后的后果,而不只是下一帧

  • Manning 的操作性定义是“动作条件化世界模型”:给定一个动作,模型必须预测世界会因此发生什么变化。下一帧预测相对容易;空间智能则要求预测几分钟后的可能后果,这又要求模型具备抽象的语义模型和持久状态。

  • 第一个规模化障碍在于,容易抓取的视频是观察性的。它记录了发生了什么,却没有标注引发转变的动作,迫使模型根据结果反推隐藏动作——Manning 认为这条路并非不可能,但极其困难,而且在任何规模上都“还没有真正被建立起来”。模拟之所以受到关注,正是因为它提供了已知动作。

  • 在训练开始之前,文本已经具备结构优势。每个 token 本身就携带意义,而“教授”“居高临下”等描述编码了从像素中恢复出来需要巨大计算量的抽象概念。Sun 表示,如果显式结构能让模型用“少5个数量级的数据”取得进展,Moonlake 就能更快、更便宜地迭代,同时不放弃规模带来的收益。

  • 人类感知提供了一个类比:人会对注意力焦点进行细致处理,同时从俯视角度以粗略语义表示场景的其他部分。这种抽象同时支撑 Moonlake 的其他要求——实时运行、长期规划和一致性——也类似于 Physical Intelligence 据报道使用文本来保存长时间跨度的记忆,而不是把一切都保留为像素。

3. 符号认知是 Moonlake 与 Yann LeCun 最根本的分歧

  • Sun 不接受“抽象违背苦涩教训”的说法。一个最大限度按字面处理的多模态系统,可以把图像、视频和音频编码成字节,再训练下一字节预测,但所需计算量将高到不可承受。因此,当前真正的问题是“今天正确的抽象层级是什么”,而不是规模是否重要。

  • Manning 与 Yann LeCun 的分歧是哲学层面的。LeCun 把视觉经验视为智能的高带宽底层,把语言视为人类低比特率的交流方式;Manning 则反驳说,黑猩猩已经拥有很强的视觉、记忆、规划和原始工具使用能力,但人类语言让知识、建造能力和远距离推理实现了“跃升”。

  • Manning 借用 Daniel Dennett 的说法,将语言称为“认知工具”,数学和编程语言也是如此。他接受 JEPA 追求一致联合嵌入的目标,但不同意自回归模型因此失去资格:尽管 token 是按顺序出现的,transformer 的内部权重完全可能构成一个关于世界的联合模型。

4. 保龄球演示把因果推理变成可见的产品行为

  • Moonlake 发布的轨迹显示,agent 在构建世界之前,会先推理几何、物理、可供性、符号逻辑、感知映射、资产和状态。因此,一个保龄球提示词远不只是图形任务:系统必须判断哪些因素对学习有用,并编码出让重复练习具有意义的游戏机制。

  • 当球击中球瓶时,球瓶必须倒下,音频必须触发,比分必须增加,计时器可能推进,重置则必须真正开始一局新游戏。比分还必须对应倒下球瓶的数量。Sun 认为,如果这些后果没有彼此连通,用户就无法学会“到底怎样才能拿到高分”。

  • swyx 的直接比较是,Google 的 Genie 演示和 World Labs 的 Marble 并没有提供这种意义上的交互式世界。测试不只是看一次预设互动后是否发生了某件事,而是看玩家能否在“50种选项”中做出选择,并推断每种选择可能带来的结果。

  • 主持人提出的 Unity 质疑值得保留:这会不会只是让模型在传统引擎上做 prompt-to-code 生成?Sun 的回答是,物理引擎、代码和软件都是为达成目标而选择的“认知工具”;另一项任务可能需要流体动力学或完全不同的表征。同一个模型在收到提示后,已经可以配置多人游戏和持久化数据库。

5. Reverie 将外观变成覆盖持久状态的可编程层

  • Moonlake 将问题拆给2个模型:多模态推理模型负责因果性、持久性、逻辑和确定性;Reverie 扩散模型负责像素分布。Reverie 接收底层生成的持久表征,在尊重世界既有交互性的前提下,将其重新风格化为照片级真实或任意审美。

  • Sun 认为,这“将成为下一代渲染范式”,有可能取代光栅化器和 DLSS。Moonlake 不是让扩散模型在缺乏空间理解的情况下凭空发明整幅场景,而是在语义状态之上运行扩散模型,提供可定制的“世界皮肤”,包括 mod 制作者所追求的照片级游戏视觉效果。

  • 更激进的设想是,渲染可以进入游戏循环,而不再只是状态的被动派生物。收集10个苹果后,玩家的子弹可能因为状态转变改变了渲染器条件,进而变成苹果。讨论还指向文本与参考图像、资产的结合,保留一层可以明确表达人的意图;正如 Sun 所说:“我们的创造力不会超过用户。”

6. 只有效用,而不是视觉润色,才是可信的评估目标

  • Sun 的评估框架从用途出发。对于游戏,直接指标可能是玩家在生成世界中停留的时间;对于具身部署,则是策略在生成世界中训练后进入目标环境的稳健性。当前基准只是这些终端指标的代理,而合适的代理指标会随用途变化。

  • Manning 认为,整个 AI 领域都面临同样的危机。问答、逻辑、数学和物体识别都可以测量,但它们无法回答这样的问题:助手能否围绕“下个月去欧洲旅行该买哪款背包”进行一场有用的对话。同样,“游戏设计师能否在合理时间内做出自己想象的东西”很有意义,却很难基准化。

  • Manning 预计最终会由“用户用脚投票”解决,就像用户根据实际效用在 GPT-5、Gemini 和 Claude 之间做选择。swyx 强调,视觉吸引力尤其具有误导性:外观简陋的游戏可以凭借概念和机制成功,而团队即使花费数百万美元追求照片级真实感,最后做出的游戏仍可能“很烂”。

  • 主持人借 Baba Is You 和 Ted Chiang 探讨了另一类世界:只改变一条规则——重力、时间或物体的逻辑——同时保持其他地方的一致性。Sun 表示,基于代码的执行比主要在常规现实上训练的视频模型更容易控制这类变化,但他也指出,代码方案可能较为狭窄、过度训练,并受限于规则表达的创造性。

7. 随着客户价值变得清晰,符号与像素的边界会移动

  • 讨论回到 Sora 1 在2024年将视频模型描述为世界模拟器的框架。Sun 接受像素一致的模拟器对游戏、营销和其他视觉工作有价值,但认为它们对因果推理和具身智能的帮助没有想象中那么大。Moonlake 押注的是:价值中“不成比例的大头”存在于不需要高分辨率像素的任务里。

  • 一位主持人提出的三体问题类比揭示了边界:符号模拟最终可能必须确定性地求解世界,而视频只需给出令人信服的近似。Sun 将其重新表述为扩散先验与符号先验之间的流动边界。Moonlake 会持续审视这条边界,把行为迁移到更经济地满足客户需求的表征上;他的倾向是,物理应当交给符号。

  • 商业化从游戏 beta 和数据飞轮开始:创作者使用系统,暴露缺失能力,并推动模型改进。3年平台愿景则更广泛——用户指定一个结果,从教会孩子谦逊到训练救援无人机,Moonlake 生成一组环境,用于创作、训练、评估和失败分析。

  • 局限也被明确列出。Sun 认为数据是约束,并表示更多数据更好;结构化生成暂时无法达到视频模型的照片级真实感;符号世界也不会天然阻止奖励投机。Manning 还认为 Sora 无法生成有说服力的机制或玩法历史,而一位主持人反驳说,AAA 游戏正在越来越像“一部2小时电影”。

8. 空间音频揭示了多模态为何必须共享同一套世界状态

  • 音频挑战不是在视频上叠一层 TTS。游戏需要与模拟事件绑定的音效、背景音乐、回声、反射和空间变化。Moonlake 从底层引擎和代码中获得部分结构,再让模型把这些工具与其他音频系统组合起来;Sun 将这种能力描述为来自可互操作的“LEGO积木”。

  • 讨论将这种方式与生成视频中的音频进行对比:后者往往在没有共享因果模型的情况下附加音乐或声景。swyx 对 Sora 2 的具体测试很简单:让一只狗远离镜头移动,再问它的声音是否会减弱。Sun 的回答是,Sora 2 没有空间音频;口型同步或叠加人声都不属于空间音频。

  • Moonlake 最终希望让音频、文本、图像和视频共享一套统一表征。Sun 的直观例子是:闭上眼睛听一辆车滑行远去,人会在脑中外推它的运动轨迹。agent 可以在生成世界中行动,收集长时间跨度的视频,再将经验编码回模型,推动公司“反思”意象所暗示的自我改进循环。

  • Sun 表示,Moonlake 这个名字部分是为了营造类似 DreamWorks 的创意气质,而月亮的倒影则象征自我改进循环。要建立这套循环,仍然需要人。Moonlake 约有18名员工,总部位于 San Mateo,并计划迁往 San Francisco;公司正在招聘覆盖代码生成、计算机视觉、图形学、游戏引擎、强化学习和多模态潜空间对齐的研究人员。更直接的招聘标准是:“如果你以前写过游戏引擎”,Moonlake 希望与你聊聊。