先锋 趋势 方法 投研 作者
为什么世界模型可能改变机器人、3D与创意产业
返回节目精读

为什么世界模型可能改变机器人、3D与创意产业

摘要

  • World Labs刚推出的Atlas引入了一种真正全新的基础模型原语——新视角预测,并首次在单一架构中统一3D重建与生成。 Justin Johnson的表述是:“LLM建立在预测下一个token之上……视频模型建立在预测下一帧之上。Atlas真正预测的是新的视角。” Ben Mildenhall补充称,每张输入图像都带有一个3D相机位姿;相比之下,文本提示视频模型更像“老虎机”。
  • 拍摄经济学的核心是实现50–100×的成本下降:过去每个房间需要100–300张照片的稠密重建,现在3张iPhone照片即可完成。 Matrix的子弹时间效果过去需要绿幕前环绕数百台相机,如今只需3个三脚架,无需昂贵标定;即使删掉旧素材中95%的照片,仍然可以完成重建。Ben称,这“彻底颠覆了我们对什么样的数据能够被重建的理解”。
  • 团队坚持认为扩展才刚开始——此次发布的模型受限于发布期限,而非架构、规模或数据上限。 “我们还处在最初阶段”,算力是主要瓶颈;每次扩规模都“显著变好”。Fei-Fei Li也承认,令她意外的是,新范式预训练的“第一个周期”就能奏效——她原本预计要经历数轮迭代。
  • 机器人论点的核心是数据,而非芯片:目前机器人领域最大的问题其实是数据;总有一天会变成芯片,但现在还是数据。 收购的机器人团队前身为Synapse,可以用Atlas改善痛苦的real-to-sim流程;Johnson提出,数据驱动的神经模拟器可能成为未来的基础设施。Casado随即追问,模拟器本身能否成为一个参与者——这与世界模型的普适性论点一致。
  • 已知短板——动力学——据他们称已经潜藏在模型中,并非像Marble那样的架构限制。 反直觉的训练经验是:即便想得到静态结果,“最佳方式其实是向模型展示动力学”,让模型自行过滤;这一checkpoint只是通过后训练偏向静态,输出中已经能看到波浪和行驶中的汽车。
  • 娱乐之外的商业切入口是设计迭代,因为把反馈转译成3D模型“就是95%的工作”。 建筑、施工乃至展会展台都适用;真正需要跨过的门槛是可编辑性:控制力必须“在不牺牲模型质量的前提下”实现,否则产品最终只会停留在娱乐层面。
  • 收尾论点是AI完备性:“预测下一个视角,等价于预测下一个token。” Ben Mildenhall以进化论作结:“自然赋予动物眼睛,但没有赋予树木眼睛……当你移动时,你就会看到新的视角”(“Nature gave animals eyes. But nature did not give trees eyes… when you move, you see a new vantage point.”);Martin Casado的评价是:“可能是今年最重要的模型发布。”

精读

1. Atlas的原语:预测下一个视角,而非下一帧

  • Justin Johnson在发布时总结,Atlas可以生成、重建并模拟世界:基于图像和运动轨迹的相机条件生成,从1帧到约100帧的稀疏3D重建,以及通过子弹时间视频和机器人模拟展示的仿真能力。底层原语是:“LLM建立在预测下一个token之上……视频模型建立在预测下一帧之上。Atlas真正预测的是新的视角。”只要把虚拟相机指向时空中的任意位置,Atlas就能渲染出对应画面。
  • Matrix演示的原版故事是:Neo坠落镜头需要在绿幕摄影棚周围架设数百台相机;Atlas则只用“3部放在三脚架上的iPhone”,就能重新合成一段时间冻结的飞越镜头——相机掠过空中的牛奶飞溅——无需摄影棚、绿幕或标定。
  • Mildenhall认为,Atlas与那些自称世界模型的视频模型的区别在于:Atlas中的“每张图像实际上都有对应的3D相机位姿”。因此,只要场景覆盖足够充分,重建就能以极高精度复现所观察到的空间,而不是靠文本提示反复协商生成结果,从而摆脱“每次都要重新生成”的“老虎机效应”。

2. 融合重建与生成,跨越计算机视觉半个世纪的分野

  • Fei-Fei Li从历史角度指出,重建与生成在过去半个多世纪一直是不同的会议赛道——围绕新视角合成,“我都数不清写过多少篇博士论文”——而一个“优雅地将两者结合或统一起来的模型”会“极其强大”。
  • 促成这一点的是预训练阶段的原生多模态:文本、图像、视频,以及相机位置和深度图都作为一等输入进入模型。Johnson称,这种做法“我认为此前没有人在预训练阶段做过”。
  • 在Fei-Fei的解释中,两部分缺一不可:传统重建可以通过三角测量还原可见点,但所有不可见区域都会留下空洞。即使是世界级专家拿着单反相机拍上数百张照片,也会漏掉麦克风下方和椅腿之间的空间,因此必须由生成来填补缺口,“因为你永远不可能把一切都拍到”。

3. 从Marble的Gaussian splat瓶颈到50–100×更稀疏的采集

  • World Labs成立已有2年半;去年的Marble以Gaussian splats输出,能够在手机和VR头显上渲染,但固定的输出表示构成了“瓶颈”。Atlas将不同模态拆开,以视角预测作为原语,按需生成RGB、3D或splat世界;这一表示重构经历了“汗水、鲜血和眼泪”般的取舍。
  • 团队给出的稠密与稀疏采集数据是:传统采集“需要这个房间的100到300张照片”;Fei-Fei曾看到一名首次使用者花约2小时扫描一个多房间空间。Atlas将目标降至3张,实现“50–100×的下降”;Mildenhall从旧录制中删掉95%的照片,仍然得到重建结果,并将一栋房子的2,000张照片压缩成30–40张输入,生成几乎相同的飞越镜头。
  • Mildenhall将其类比为LLM的上下文竞赛:语言模型的上下文从128个token扩展到100万个token,但没有人以同样系统化的方式把上下文推入图像和视频模型——“重建其实就是拥有超长上下文的生成”。
  • Fei-Fei最喜欢、但最容易被忽视的演示,是用3–25张斯坦福庭院的地面照片生成一段空中飞行镜头——“你看到的一切都是生成的,但遵循的是重建规律”。

4. 信念、足球Slack消息与“我们还处在最初阶段”

  • Casado问他们是否一开始就知道这条路能走通。Johnson回答“我相当有信心”;Fei-Fei说,3人都“完全相信扩展定律”,但她也保留了诚实的限定:“第一个周期就能奏效,本身简直不可思议。”公司成立时,空间智能领域还没有任何扩展定律可供参考。
  • 内部故事发生在初夏:当时团队还在使用一个较小的、前Atlas模型,Ben把著名的NeRF花园桌数据喂给模型;当天晚上,一条Slack消息显示,相机正从桌子下方飞过一只足球。“我们3人互相看了一眼,说,‘就是它了’……我们 literally 用了5秒就做出了决定。”
  • 至于扩展空间,答案是:“不,不,我们还处在最初阶段。”目前不需要改变架构,算力是主要约束;发布模型的大小由“发布期限”决定,而不是由规模或数据上限决定。

5. 应用场景:3D一致的创意工作流、设计,以及机器人的数据难题

  • Mildenhall注意到,Marble用户往往上传一张图像,截几张splat场景的截图,然后就离开了;Atlas可以直接生成这些视角,把创意工作锚定在一个3D一致的世界中,而不是与那些“给我废墟的不同角度”却总会发生漂移的模型反复拉扯。“这种一致性和稳健性,是人类以空间类别思考的关键。”
  • 他认为,娱乐之外的切入口在建筑、施工和展会展台搭建,因为把创意总监的反馈转化成3D模型“就是95%的工作,对吧?你开会、获得反馈,然后花一周时间修改。”
  • Fei-Fei谈到这支机器人团队时提到,它的前身是Synapse,过去依赖“极其痛苦”的稠密重建来完成real-to-sim-to-real流程,而Atlas正是“下一代技术”。她给出了明确判断:“目前机器人领域最大的问题其实是数据。总有一天会变成芯片,但现在还是数据。”这也包括随机化电缆弯曲方式、箱体尺寸和场景布局。
  • Johnson进一步解释,机器人策略不像代码或图像那样是静态产物,后两者可以从网上获得大量样本;机器人是处在一个“不总是按你预期做出反应”的世界中的智能体,因此训练必须让它接触所有可能出错的情况。由此,他提出数据驱动的神经模拟器;Casado随即追问:“为什么模拟器本身不能成为一个参与者?”

6. 动力学已潜藏,编辑能力是护城河,视角预测“AI完备”

  • Casado转述了一位专家最尖锐的批评:“需要更多动力学。”Fei-Fei的回应是,Marble在架构和训练上“从根本上是静态的”;Atlas的架构和数据则已经包含动力学信息,包括水面波浪和航拍画面中移动的小汽车。反直觉的经验是,只有静态数据无法扩展,因此“即便我想得到静态结果,最佳方式也确实是向模型展示动力学”,再让模型自行过滤;这一checkpoint只是经过后训练,朝静态结果偏移。
  • Mildenhall认为,下一个前沿是工业级控制:场景交互、布局、物体身份和时间,“同时不能牺牲模型质量,否则它最终只会成为娱乐产品”。
  • 收尾论点是:正如预测下一个token已经足以构成“AI完备”,新视角生成预测也同样如此。Johnson谨慎地将侦探小说的例子归于Ilya:先读完整部小说,再预测“凶手是……”谁会出现。Mildenhall则给出进化论版本:“自然赋予动物眼睛,但没有赋予树木眼睛……当你移动时,你就会看到新的视角。”预测下一个视角,等价于预测下一个token。