
Justin Johnson
前沿洞察
Justin Johnson断言:空间智能与世界模型是后LLM时代算力竞逐的终极前沿。World Labs以“预测下一视角”为新一代模型原语,将3D重建与生成底层统一,以稀疏视角将场景采集成本削减百倍,直击机器人与创意产业的数据饥渴。但商业化攻坚的死穴在于:系统能否跨越从“视觉逼真”到“物理可信”的鸿沟,在引入工业级精确控制时避免生成质量崩塌。
观点集合
为什么世界模型可能改变机器人、3D与创意产业
- 🗓️ 日期:
2026-09-04| 🎙️ 节目:The a16z Show
Atlas首次以“预测下一个视角”为基础模型原语,统一3D重建与生成。三张iPhone照片替代100–300张房间照片,团队称采集成本可降50–100倍,并瞄准机器人的数据瓶颈。扩展受算力而非架构或数据限制,但工业级编辑与控制能否不牺牲质量,仍是商业化关键。
查看访谈对话精读提要
World Labs刚推出的Atlas引入了一种真正全新的基础模型原语——新视角预测,并首次在单一架构中统一3D重建与生成。 Justin Johnson的表述是:“LLM建立在预测下一个token之上……视频模型建立在预测下一帧之上。Atlas真正预测的是新的视角。” Ben Mildenhall补充称,每张输入图像都带有一个3D相机位姿;相比之下,文本提示视频模型更像“老虎机”。
拍摄经济学的核心是实现50–100×的成本下降:过去每个房间需要100–300张照片的稠密重建,现在3张iPhone照片即可完成。 Matrix的子弹时间效果过去需要绿幕前环绕数百台相机,如今只需3个三脚架,无需昂贵标定;即使删掉旧素材中95%的照片,仍然可以完成重建。Ben称,这“彻底颠覆了我们对什么样的数据能够被重建的理解”。
团队坚持认为扩展才刚开始——此次发布的模型受限于发布期限,而非架构、规模或数据上限。 “我们还处在最初阶段”,算力是主要瓶颈;每次扩规模都“显著变好”。Fei-Fei Li也承认,令她意外的是,新范式预训练的“第一个周期”就能奏效——她原本预计要经历数轮迭代。
机器人论点的核心是数据,而非芯片:目前机器人领域最大的问题其实是数据;总有一天会变成芯片,但现在还是数据。 收购的机器人团队前身为Synapse,可以用Atlas改善痛苦的real-to-sim流程;Johnson提出,数据驱动的神经模拟器可能成为未来的基础设施。Casado随即追问,模拟器本身能否成为一个参与者——这与世界模型的普适性论点一致。
已知短板——动力学——据他们称已经潜藏在模型中,并非像Marble那样的架构限制。 反直觉的训练经验是:即便想得到静态结果,“最佳方式其实是向模型展示动力学”,让模型自行过滤;这一checkpoint只是通过后训练偏向静态,输出中已经能看到波浪和行驶中的汽车。
娱乐之外的商业切入口是设计迭代,因为把反馈转译成3D模型“就是95%的工作”。 建筑、施工乃至展会展台都适用;真正需要跨过的门槛是可编辑性:控制力必须“在不牺牲模型质量的前提下”实现,否则产品最终只会停留在娱乐层面。
收尾论点是AI完备性:“预测下一个视角,等价于预测下一个token。” Ben Mildenhall以进化论作结:“自然赋予动物眼睛,但没有赋予树木眼睛……当你移动时,你就会看到新的视角”(“Nature gave animals eyes. But nature did not give trees eyes… when you move, you see a new vantage point.”);Martin Casado的评价是:“可能是今年最重要的模型发布。”
🔗 原始收听与视频来源: 为什么世界模型可能改变机器人、3D与创意产业
LLMs之后:空间智能与世界模型——World Labs 的 Fei-Fei Li 与 Justin Johnson
- 🗓️ 日期:
2025-11-25| 🎙️ 节目:Latent Space
World Labs将可用的3D产品与长期押注结合,认为空间智能和世界模型可能成为下一代高算力基础模型前沿。Marble的Gaussian splat世界已服务创意工作流,但物理、因果实验、机器人数据和学术资源决定合理性是否能升级为可信工程能力。
查看访谈对话精读提要
World Labs押注空间智能将与语言智能互补,成为下一代基础模型前沿,而算力终于大到足以攻克这一方向。 Justin Johnson估算,自AlexNet以来,单卡性能提升约1,000倍,训练规模也从单卡扩展到数百、数千乃至数万张GPU,使单个模型可调用的算力约多出100万倍。视觉、空间与世界数据需要更多处理,这让世界模型成为下一个合理的Scaling前沿。
Marble是一枚刻意设计成两面性的楔子:现在就是有用的3D产品,同时也是通向通用世界模型的第一步。 它接受文本、单张或多张图片,生成可编辑的3D世界,并支持精确布置摄像机和导出;游戏、VFX、电影、室内设计以及潜在的机器人仿真,都是正在出现的用例。World Labs有意避免把它做成纯粹的“科学项目”,而Fei-Fei Li称Marble是更大空间智能技术栈的“第一眼”。
当前的技术选择——Gaussian splats——把生成对象变成可导航的几何体,而不是一串视频帧。 Splats可以在手机和VR设备上实时渲染,但如果要在4年前的iPhone上以高分辨率跑到30–60 fps,就必须限制密度和保真度。其他系统已经采用基于帧的生成,未来也可能给粒子附加质量或弹簧,或者使用基于token的表示;数据结构并非永久不变。
物理是当前最大的未解能力缺口,也是创意工具与可信工程软件之间的分界线。 模式拟合或许能预测看似合理的轨道,却未必能推导力向量或“F等于MA”;Fei-Fei表示,尚“没有迹象”表明潜在建模能够得到因果定律,而Justin希望物理能力能在规模扩大后涌现。对电影背景来说,合理性已经足够;但对必须屹立不倒的建筑来说,还远远不够。
商业化的扩张路径是横向的,但先后顺序仍被刻意保留为开放问题。 创意产业是Marble的滩头阵地;室内设计Beta用户已经可以重建并编辑房间,而机器人则可能利用生成世界,填补稀缺真实世界数据与不可控互联网视频之间的“重要中间地带”。Fei-Fei表示,是否直接进入具身应用,“还有待决定”。
World Labs的讨论并不意味着要抛弃transformer,而是指向多模态与更丰富的学习闭环。 Attention仍然有效;Justin指出,transformer原生建模的是集合,1D顺序来自位置嵌入,因此空间token不必以架构推倒重来为代价。真正缺失的要素,可能是提出假设、采取行动、证伪并在线更新,而不只是改变模态。
人才与研究瓶颈不只是资本问题:学术界资源不足,也太容易被前沿实验室的Scaling路径吸引。 Fei-Fei为BEHAVIOR等开放基准辩护;Justin希望学术界去追逐“疯狂的想法”,包括在集群取代单GPU之后,探索矩阵乘法之外的分布式计算原语。他对硬件的警告很具体:从Hopper到Blackwell,单位功耗性能“基本没变”,这为押注10–20年的架构研究留下了空间。
🔗 原始收听与视频来源: LLMs之后:空间智能与世界模型——World Labs 的 Fei-Fei Li 与 Justin Johnson