No Priors 第117期|对话 Stanford HAI 联席主任、World Labs 创始人 Dr. Fei-Fei Li
摘要
Fei-Fei Li 正押注 World Labs,认为空间智能是 AI 缺失的基础层。 她将空间智能定义为理解、推理、交互并生成 3D 世界的能力;没有它,“AI 将是不完整的”。World Labs 称其为已知首家攻克 3D 生成基础模型问题的公司,即便生成的是奇幻世界,输出也必须服从自洽的几何与物理规律。
近期最清晰的商业切入口,是 AI 辅助 3D 创作。 Li 预计设计师、视觉特效艺术家、游戏开发者、营销人员及其他创作者会像开发者使用 Cursor 和 Windsurf 一样,与模型协作。生成式空间模型也可能解决元宇宙、XR、AR 和 VR 普及的一大约束:除了改善硬件,“我们还在寻找内容创作”。
机器人需要的,不只是扩大视觉能力或模仿学习数据。 Li 预计训练将依赖多种数据形态的混合,包括视频、仿真与合成数据、远程操作以及具身数据;她认为仿真被低估了,但也指出许多专家和机器人公司已经在研究。触觉对于操作能力“确实被严重低估”。她也不认同只有人形机器人的未来:任务和能耗经济学应当催生多样形态——水下机器人应当像鱼,而飞机正变得越来越像机器人。
3D 模型的核心挑战始于数据,而产品化仍未解决。 不同于 NLP 和 LLM 领域的同行,Li 表示 World Labs 未必拥有丰富的互联网原生素材,而是需要越来越复杂的数据采集、处理、工程和合成能力。产品化是另一项挑战,因为 3D 是交互式体验,而非被动消费:“没有人早上醒来会说,‘我就坐在这里看 3D。’”
Li 的职业经历提供了一个具体先例:逆向押注数据,最终催生新的模型类别。 2003年前后,她在导师提出100个类别后,建立了一个101类别数据集,随后将同样的信念扩展为 ImageNet:覆盖数千个类别、1500万张标注图片——尽管当时有人告诉她,这可能让她拿不到终身教职。AlexNet 最终取得突破,验证了“那个没人相信的猜想”。
Li 给出的研究建议很简单:“无所畏惧”(Be fearless)。 她认为有生产力的野心位于“有点妄想、有点疯狂”和“理性地大胆”之间;过度理性会让人找不到足够大的问题,而彻底疯狂则可能让很多事情失控。因此,World Labs 招募来自图形学、视觉、数据、生成式 AI、基础设施、优化、工程和产品等领域的人才,而不是把空间智能当成一个同质化问题。
Li 的终局仍是以人为中心的增强,尤其是在社会缺少专业能力与照护资源的领域。 医疗行业缺少药物发现、诊断、精准医疗、可及治疗、慢性病支持和更好的老龄化方案,而不是缺少人的价值。她的核心判断是“AI 是帮助人的工具”,同时应保留爱、关系、繁荣与正义这些人类价值,不让机器夺走它们。
精读
上游暂未提供,后续同步将继续补齐。