LLMs之后:空间智能与世界模型——World Labs 的 Fei-Fei Li 与 Justin Johnson
摘要
World Labs押注空间智能将与语言智能互补,成为下一代基础模型前沿,而算力终于大到足以攻克这一方向。 Justin Johnson估算,自AlexNet以来,单卡性能提升约1,000倍,训练规模也从单卡扩展到数百、数千乃至数万张GPU,使单个模型可调用的算力约多出100万倍。视觉、空间与世界数据需要更多处理,这让世界模型成为下一个合理的Scaling前沿。
Marble是一枚刻意设计成两面性的楔子:现在就是有用的3D产品,同时也是通向通用世界模型的第一步。 它接受文本、单张或多张图片,生成可编辑的3D世界,并支持精确布置摄像机和导出;游戏、VFX、电影、室内设计以及潜在的机器人仿真,都是正在出现的用例。World Labs有意避免把它做成纯粹的“科学项目”,而Fei-Fei Li称Marble是更大空间智能技术栈的“第一眼”。
当前的技术选择——Gaussian splats——把生成对象变成可导航的几何体,而不是一串视频帧。 Splats可以在手机和VR设备上实时渲染,但如果要在4年前的iPhone上以高分辨率跑到30–60 fps,就必须限制密度和保真度。其他系统已经采用基于帧的生成,未来也可能给粒子附加质量或弹簧,或者使用基于token的表示;数据结构并非永久不变。
物理是当前最大的未解能力缺口,也是创意工具与可信工程软件之间的分界线。 模式拟合或许能预测看似合理的轨道,却未必能推导力向量或“F等于MA”;Fei-Fei表示,尚“没有迹象”表明潜在建模能够得到因果定律,而Justin希望物理能力能在规模扩大后涌现。对电影背景来说,合理性已经足够;但对必须屹立不倒的建筑来说,还远远不够。
商业化的扩张路径是横向的,但先后顺序仍被刻意保留为开放问题。 创意产业是Marble的滩头阵地;室内设计Beta用户已经可以重建并编辑房间,而机器人则可能利用生成世界,填补稀缺真实世界数据与不可控互联网视频之间的“重要中间地带”。Fei-Fei表示,是否直接进入具身应用,“还有待决定”。
World Labs的讨论并不意味着要抛弃transformer,而是指向多模态与更丰富的学习闭环。 Attention仍然有效;Justin指出,transformer原生建模的是集合,1D顺序来自位置嵌入,因此空间token不必以架构推倒重来为代价。真正缺失的要素,可能是提出假设、采取行动、证伪并在线更新,而不只是改变模态。
人才与研究瓶颈不只是资本问题:学术界资源不足,也太容易被前沿实验室的Scaling路径吸引。 Fei-Fei为BEHAVIOR等开放基准辩护;Justin希望学术界去追逐“疯狂的想法”,包括在集群取代单GPU之后,探索矩阵乘法之外的分布式计算原语。他对硬件的警告很具体:从Hopper到Blackwell,单位功耗性能“基本没变”,这为押注10–20年的架构研究留下了空间。
精读
上游暂未提供,后续同步将继续补齐。