AI基础设施的未来:从 Kubernetes 到 Agent Sandboxes——Modal CTO Akshat Bubna
摘要
Modal 的战略重构是让基础设施 UX 优先服务 Agent。 团队认为,适用于开发者体验的优势同样适用于 Agent 体验:装饰器让 Agent 可以在代码旁修改配置,并立即测试「自供给运行时」,无需解析数百份 Kubernetes 文件、生成 YAML。新的控制面是可通过 CLI 访问的日志和指标:Agent 负责调查,人类负责解读行为并做判断。
Modal 押注于 GPU 所有权之上的护城河,打造覆盖17家供应商、轻资产的「所有云之上的超级云」。 这一网络提供不同区域、GPU 类型和专业化容量,Modal 无需自建数据中心;其软件吸收底层基础设施的不可靠性,因此即使「GPU 从总线上掉下来」,工作负载也能继续运行。取舍是明确的:坚持云端模式,把差异化集中在调度、弹性、地域性和可靠性上。
Modal 最初实现产品市场匹配的是定制模型的弹性推理,而不是通用 LLM API。 Suno、Runway、机器人和计算生物学公司在其他地方训练模型,再依赖 Modal 作为跨不可预测发布、多模型和错峰区域需求的「最佳部署黑盒」。如今同一个无服务器问题,已从简单的 0 到 1,变成在一个区域内快速将算力从1,000块 GPU 弹性扩展到1,500块。
突发性是推理、批处理、训练和强化学习共同的工作负载形态。 GPU 快照保留模型和 Torch 编译后的模型状态,以缩短冷启动;训练开始前的任务可能需要数千块 GPU 做编码;而 rollout 工作负载可能要求100,000个沙箱,因为「RL 的突发性极强」。这意味着,相比单纯获取加速器,编排和容量利用率至少同样具有投资逻辑上的重要性。
Modal 正在进入模型层,因为 speculative decoding 带来的乘法级收益,是 kernel 调优无法匹敌的。 草稿模型提前预测,较大的模型批量验证 token,在保持输出质量的同时,更长的接受长度可带来相对更快 kernel 仅几个百分点、而 speculative decoding 可达「约2倍至4倍」的提速。Modal 将这项工作开源,同时通过专业能力、生产可靠性和异常弹性的自动端点实现差异化。
Agent 正在把基础设施需求的重心,从 GPU 中心型工作负载推向 GPU、CPU、存储和网络的持续协同。 一位嘉宾将这一转变概括为 GPU 与 CPU 过去约8:1的比例变成1:1;Modal 的应对包括区域协同部署、多容器沙箱、受控出网、持久化文件系统、私有网络,以及用于 RDMA 训练、约3 Tbps 的内部网络。AI 基础设施越来越成为「搬运内存、安排调度的系统问题」。
自动研究目前更接近模型引导的超参数搜索,而不是自主发现架构。 Modal 内部的「AutoInference」Agent 已能扫描配置、运行 NVIDIA Nsight profiler,并将 GPU 从 H200 切换到 B200;讨论将这一方法描述为由模型直觉引导的超参数搜索。ModalBench 同样把 Agent 的失败,尤其是可观测性方面的失败,转化为 CLI 功能、skills 和可量化的产品工作。
商业模式依赖于把算力规划同时转化为毛利和客户节省。 Modal 的算力策略团队会建模1年期与3年期预留容量、不同区域和 GPU 类型之间的可替代性,以及供应链押注;批处理层可以用更低价格,在约24小时内返回对延迟不敏感的工作负载。Erik 表示,Modal 有意避开业余用户驱动的模型 API 市场,转向需要定制架构和更深控制能力的代码级生产工作负载。
精读
上游暂未提供,后续同步将继续补齐。