先锋 趋势 方法 投研 作者
世界模型与 General Intuition:Khosla 继 LLMs 和 OpenAI 后最大的一笔押注
返回节目精读

世界模型与 General Intuition:Khosla 继 LLMs 和 OpenAI 后最大的一笔押注

摘要

  • General Intuition 的核心资产,是 Medal 的38亿条游戏片段——一份“互动领域的 Common Crawl”,把视觉状态与语义动作配对,并密集记录了人类行为的峰值表现。 Medal 约1200万用户不会保存完整游戏过程,而是事后保存值得记住的瞬间,因此数据既包含极致操作,也包含负面事件。真正的护城河并不只是视频数量:Medal 同时搭建了录制器、公开分享网络、保护隐私的动作标签和分发体系。

  • GI 当前的纯视觉策略在强化学习之前就已展现出能力:“纯模仿学习”,不做微调,也不读取游戏状态。 它处理像素、实时预测动作、与人类对战,并通过4秒记忆从失误中恢复。当被问到是否获得了目标时,Pim 回答“是”;但讨论没有说明目标具体如何编码。这套策略从高光数据中继承了非凡操作。正如主持人澄清的,这不是通过 RL 发现的“Move 37”,而是复现数据集中已经存在的超人类样本,而该数据集的基线是“人类表现的峰值”。

  • Pim 对世界模型的定义,是一个由动作条件化的状态生成器,而不是预测下一帧最可能或最有趣画面的视频模型。 GI 仅从1秒上下文出发,就展示了约20秒的生成结果:穿过烟雾、应对快速镜头运动、缩放变化和短暂遮挡,同时保持位置连续。一场生成的爆炸甚至继承了现实世界的相机抖动,而底层游戏并不存在这种效果;按 Pim 的框架,这说明物理视频预训练可能迁移到游戏之外。

  • 眼下最直接的商业切入口,是向大型游戏和游戏引擎提供 API,替代人工编码的玩家控制器和行为树。 更强、按技能分级的机器人可以在凌晨3:00维持玩家流动性;当机器接受类似游戏手柄的输入时,同一套“输入帧、输出动作”的基础也可能延伸至仿真、制造业和机器人。GI 没有声称能够零样本部署:Pim 的押注是,客户可能只需要今天领域数据的1%或10%,因为预训练将成为后训练。

  • 这期节目的融资故事,同时反映出市场对数据稀缺性的判断,以及在专有数据尚未经过建模前为其估值的困难。 主持人称 OpenAI 曾为 Medal 的数据报价5亿美元,并将 GI 描述为拒绝了这笔交易;节目中种子轮金额先后被说成1.33亿美元和1.34亿美元,由 Khosla Ventures 领投,被描述为 Vinod Khosla 自 OpenAI 以来最大的一笔此类押注。Pim 给其他数据所有者的建议是:先构建模型,找出并非已经注定会出现的能力,理解买方的预期用途,并尽可能争取股权,因为合成数据可能迅速压低授权价值。

  • Pim 认为语言模型仍会是有价值的编排器,而不是简单地被淘汰。 讨论中,主持人认为文本压缩了三维经验,空间模型可能提供更好的通用化骨干,而自回归 token 生成并不适合持续变化的环境。Pim 的架构类似 SIMA 2 的“木偶大师”:由语言模型或视觉语言模型驱动大量具身策略,让文本和语音成为动作,而不是整个系统的底层载体。

  • GI 的复利循环,是把 Medal 数十亿条片段从模仿样本变成可用于 RL 的可玩环境。 Pim 将这份档案称作“人类在仿真中的情景记忆”:3小时游戏可能只被筛选成2到3分钟最值得记住的片段,其中包括被精确标注的撞车和其他负面事件。其2030年愿景——负责 AI 驱动的“原子到原子”互动的80%,并实现“仿真中多出100倍”的互动量——是一个极其激进的市场份额目标;由于物理和安全约束更少,仿真预计会先行。

精读

1. 这套策略在没有强化学习的情况下,已经像玩家一样行动

  • 在一段4个月前的演示中,这个纯视觉智能体接收画面并预测动作,还会像人类玩家一样反复查看记分板。它的4秒记忆让它在卡住后能够自行恢复,不过早期操作仍明显带有生硬的决策。

  • 当前基础模型完全以实时方式与人类玩家对战,做到“无 RL、无微调”,也不读取游戏状态。被问到是否获得了目标时,Pim 回答“是”;他同时将这套策略描述为纯像素驱动:从画面预测动作,而不是从游戏状态预测动作。

  • 最能说明问题的一段操作同时包含失败与卓越表现:智能体先犯下一个 Pim 认为人类绝不会犯的错误,随后自行脱困,又完成了一次主持人认为达到超人类水平的远距离操作。Pim 的解释是继承,而非发现:“我们的数据集基线就是人类表现的峰值。”

  • 主持人进一步划清界限:这不是通过强化学习产生的“Move 37”,而是对人类非凡样本的模仿。这也限定了结果的边界——在 GI 建成旨在超越这些能力的 RL 循环之前,模型只能复现 Medal 高光数据中已经被代表的能力。

2. 由动作条件化的生成,能在烟雾与运动中维持世界连续性

  • GI 一方面从零预训练世界模型,另一方面微调开源视频模型,以实现物理迁移。Pim 强调了玩家熟悉的鼠标灵敏度和快速移动,随后展示了留出集生成:模型只接收1秒视频上下文和记录下来的动作,之后约20秒的内容全部由模型生成。

  • 一次爆炸让生成画面中的相机发生抖动,尽管原游戏并不会这样。Pim 将其解释为模型从物理世界视频中导入了相关行为,并认为这种迁移与 GI 的动作预测模型结合后,训练范围可以“远远超出游戏”。

  • 部分可观测性是更强的空间测试:烟雾遮挡视野后,生成结果仍在同一位置出现;狙击时,即使画面缩放并暂时失去视野,模型仍保留了物体的位置关系。更小的蒸馏策略会犯更多错误,例如直接撞墙,但依旧能实时运行,因此参数规模乃至服务成本都可能调节。

3. Medal 的录制器打造了保护隐私的行为数据集

  • 节目的核心数字是38亿条片段和约1200万名 Medal 用户;主持人将其与 Twitch 约700万月活主播作比较。Pim 称,这套集合的规模可能比网上任何其他真实、带动作标签的视频数据集大1到2个数量级。

  • Medal 的胜负手,是先把采集做到极致,再尝试建立内容消费。它的录制器始终在内存中运行,用户按下按钮后,才将此前的一段内容导出到硬盘和手机,消除了开始和停止录制的摩擦,也捕捉到了自然行为。Fortnite、疫情期间的增长,以及 Discord 所谓的“连接组织”随后帮助这张社交网络加速扩张。

  • 隐私决定了标签方式:Medal 没有记录 W、A、S、D 等单个键盘输入。大约18个月里,数千人将每款游戏的控制方式映射为语义动作;这些动作之后可以转换成通用计算机输入,但无法还原到某个具体用户。

  • 主持人的质疑仍然关键:游戏乃至生活的大部分内容都很无聊,而片段是有意筛选出的异常时刻。主持人还指出,行为会受到上下文窗口长度的实质影响;Pim 表示认同,但没有进一步展开。

4. 研究论文让一家游戏公司变成了独立实验室

  • SIMA 公布的迁移结果给了 Pim 第一个强烈线索:在9款游戏上训练导航能力,留出第10款游戏进行测试后,通用智能体在该游戏上的表现大致与专门为它训练的智能体相当。Medal 恰好拥有验证这一扩展性假设所需的跨环境动作数据。

  • DIAMOND 提供了可行性证明。Pim 回忆,一套可玩的世界模型曾使用约90小时数据,在消费级4090上以约10 FPS运行;他记得的具体数字一度在87至95小时之间,随后冷邮件联系了学生团队。DIAMOND 贡献者、GAIA-2 研究负责人 Anthony Hu 以及其他研究人员最终加入 GI。

  • 团队起初认为 Medal 的数据主要适合构建 Genie 式世界模型。后来,他们发现纯模仿学习可以并行扩展到远超预期的程度,于是改变了看法,并将可玩的世界模型留到后续 RL 阶段:“如果你愿意,可以说我们基本拥有某种互联网,或者 Common Crawl”,只是对象变成了互动。

  • Pim 将自己描述为自学成才的基础设施工程师,熟悉 CUDA、转码和视频系统,但对建模感到陌生。在完成 François Fleuret 约30至40讲的深度学习课程后,他觉得自己像“刚拿到驾照的人”,而共同创办研究团队仍是“F1车手”。

5. 世界模型瞄准传统仿真无法负担的互动

  • Pim 的定义明确强调因果关系:视频模型可能会预测一帧最可能或最有趣的画面,而世界模型必须表示可能的结果,并根据当前状态和动作生成下一状态。它是“根据你采取的动作,准确生成的一个世界”。

  • 他曾尝试在 PyTorch 中构建一个简易的可微物理引擎,这暴露出仿真的3个复杂性来源:智能体数量、每个智能体的自由度,以及每个动作所揭示的信息量。仅仅说“水”而不是“火”,就足以改变人类行为,从而让结果空间急剧膨胀。

  • 这种组合爆炸促成了 GI 对难以手工仿真的互动“最大押注于视频迁移”,但这并不意味着传统引擎会消失。Pim 仍预计,只要代表性视频稀缺,传统仿真就会保有一个庞大的市场。

  • 游戏还保留了普通视频会丢失的信息。YouTube 处理流程可能需要姿态估计、逆动力学,以及估计人物视线方向;在游戏中,手动控制的镜头运动已经捕捉了这些“光学动力学”。GI 会先从手柄规模的动作空间开始,之后可能在更一般的空间中学习动作嵌入。

6. 空间模型与语言模型可能走向融合

  • SIMA 2 让 Pim 印象最深的,与其说是策略突破,不如说是编排蓝图:文本、绘图和标记都可以引导动作序列,而 Gemini 可以成为独立的“木偶大师”,协调多个 SIMA 实例。他预计 GI 最初无法通过文本控制的策略,也会走向类似架构。

  • 对于 Fei-Fei Li 基于 splat 的方法,Pim 看重的是一个可验证的底层三维表示,能够被游戏引擎重复使用。他的疑虑在于,据他的理解,该方法尚未实现互动性——而互动正是他定义中的世界模型“全部意义所在”;同时,它涉及更大的输出空间,扩展性仍不确定。他猜测团队最终会实现互动部分,但认为现在判断还为时过早。

  • Pim 表示,Yann LeCun 过去关于 LLM 是一条死路的论述曾启发他,但节目文字并不能证明 Pim 本人接受了这一绝对结论。主持人则单独提出,人类用文本压缩三维经验,文本推动了科学与文学,而自回归 token 生成并不适合持续变化的环境。

  • Pim 表示 GI 可以吸收语言模型研究,并早先预测由编排器 VLM 管理其策略。在他的框架里,文本和语音可以成为更大系统中的动作;他没有对语言优先实验室与世界模型优先实验室最终是否融合给出定论。

7. 游戏提供第一块收入楔子,仿真是扩张路径

  • GI 已经在与大型游戏开发商和游戏引擎合作,用于替代玩家控制器或确定性行为树。拟议中的 Anthropic 式 API 很简单:客户持续传入画面,GI 预测动作;合作也可能包括定制策略或蒸馏模型,但 Pim 明确表示:“我们不卖数据。”

  • 当玩家流动性不足时,例如凌晨3:00,更好的机器人可以直接提高留存。Pim 承认,用户通常不想参加全是机器人的对局;目标是让真人与按技能分级的机器人组成令人信服的混合,而 Medal 能够校准这一点,因为它知道玩家已经展示出的能力。

  • 主持人举出了 GTA V 角色扮演、Truck Simulator 和 PowerWash Simulator 作为行为丰富的例子。Pim 认同这些环境包含有目的、类似现实世界的行为,并强调部分玩家对复刻卡车驾驶场景的认真程度;他说,在某个时点,Medal 上使用方向盘进行驾驶模拟的人,比 Waymo 在道路上的汽车还多。

  • 机器人和制造业客户已经参与其中,但迁移条件较为严格:机器人必须接受类似游戏的控制方式。GI 没有承诺零样本自主运行;Pim 希望其预训练能力能让另一家公司只收集约1%或10%规模的领域数据,并把今天最困难的预训练工作转移到后训练阶段。

8. 数据交易成为授权还是自建的试金石

  • 主持人称 GI 曾拒绝 OpenAI 为 Medal 数据提出的5亿美元报价,随后又将种子轮金额说成1.33亿美元和1.34亿美元。Khosla Ventures 领投了节目所称的 Vinod Khosla 自 OpenAI 以来最大的一笔单笔种子投资。

  • Pim 形容 Khosla 的尽调方式是从第一性原理倒推:先画出2030年的公司,再倒推回今天,并在追问下为每个技术和商业假设辩护。这一过程检验宏大愿景是否连接着现实;一旦被说服,Khosla 就会“全力支持”,并打开资源网络。

  • Pim 对数据估值的结论很直接:“我认为,除非你亲自把它建模出来,否则无法给它估值。”数据所有者应测试数据是否能解锁非显而易见的能力,判断它应服务于 LLM、世界模型还是其他系统,并理解买方的目标产品,尤其要警惕授权可能“反噬养活我们的人”。

  • 他还警告,更好的标注模型和合成生成可能迅速降低所需真实数据量。在可能的情况下,他会争取大量股权,而不是一次性授权费;如果实验室拒绝解释预期用途,他通常倾向于不推进交易。

9. 可玩的记忆是从模仿走向 RL 和机器人的桥梁

  • Pim 将 Medal 称为“人类在仿真中的情景记忆”:用户可能把3小时游戏压缩成2到3分钟最值得记住、最适合分享或最偏离分布的事件。这份档案记录了人们“最好和最坏的一面”,标题与动作历史则标出了撞车和其他负面结果。

  • GI 的 RL 计划,是让数十亿条片段中的每一条都能在世界模型内被玩起来。一段已知会导致 Euro Truck Simulator 撞车的序列,可以变成一个环境,由奖励模型围绕负面事件为表现打分,把用户主动选择的失败数据转化为可反复进行的互动训练。

  • 同样的能力也能生成面向消费者的产品:用户或朋友可以进入并重放一段已保存的片段,而不只是观看。Medal 每天已经承载数百万、数百万次视频观看,这让 GI 无需另建一张消费网络,就拥有了进入世界模型娱乐和快速整合产品的路径。

  • General Intuition 这一名称,来自 AlphaFold 时代关于模仿玩家直觉的想法,即使这些玩家只是业余生物学家。Pim 的北极星,是最终在三维空间中表达科学问题,并将时空感知与语言推理结合起来,直接处理这些问题。

10. 2030年愿景让仿真远远领先于物理世界的落地

  • GI 认为,其数据护城河允许更开放地发布研究,因为竞争者很难复现训练集。Pim 提到与巴黎开放科学实验室 Kyutai 的合作,并邀请大学开展相关项目,例如利用卡车数据预测负面事件,包括印度境内的撞车。

  • 扩展目标将从数千张 GPU 增长到数万张,最终达到数十万张。Pim 将严重数据约束的缺失视为研究优势:团队每周都会得到此前没有预料到的结果,并可以开展那些缺乏带动作标签互动视频的机构无法进行的实验。

  • 对于2030年,Pim 希望 GI 成为“智能的黄金标准”,理由是任何足够长的序列在本质上都是因果的,因此需要时空推理。他将 AI 的发展划分为“bits 到 bits、atoms 到 bits、bits 到 atoms,以及 atoms 到 atoms”,并将这一框架归功于 Andrej Karpathy。

  • 他的具体目标,是负责 AI 驱动的“原子到原子”互动的80%,专门化机器人技术栈承担另外20%,并实现“仿真中可能多出100倍”的互动量。仿真应当率先发展,因为它面临更少的安全和物理约束;Pim 预计,科学环境和虚拟环境会先迎来起飞,之后智能才会成为清除机器人落地瓶颈的底层能力。