先锋 趋势 方法 投研 作者
为什么内存是 AI 最大的瓶颈:Vikram Sekar|第170期
返回节目精读

为什么内存是 AI 最大的瓶颈:Vikram Sekar|第170期

摘要

  • Vikram Sekar 的核心判断是,内存而非原始算力,是 AI 最深层的系统瓶颈。 LLM 没有用满 GPU 算力,是因为内存和网络无法足够快地供给数据;因此,内存占用更低的模型架构可能同时缓解多重约束:“内存瓶颈,也就是内存带宽瓶颈,进而也是网络瓶颈。”

  • 面向消费者的智能体应当扩大推理需求,但不会沿着 Mac mini 热潮所暗示的那条永久专用处理器曲线增长。 大多数个人任务用 Sonnet 级别或开源模型就能完成,处理器和内存则可以共享,或在需要时即时启动。需求仍会增长,但 Vikram 警告说,“一切都会因为智能体而爆发,而这可能并不会真的发生。”

  • 即便今天的财务投入最终被证明过度,AI 仍然是一项具备长期韧性的技术。 Vikram 预计这项技术未来10年仍会“向右上方增长”,但他提到 Anthropic 的 S1,称其有义务投入的资本和算力资源对应金额似乎超过5000亿美元。实验室可能订购过多内存、制造供给过剩并遭遇崩溃,但这并不会推翻底层的采用逻辑。

  • 训练仍是统一集群问题,而推理正变成一片“狂野西部”。 从72块GPU、约200 kW的 Blackwell 机架走向144块GPU,意味着功耗超过400 kW,同时冷却和网络难度进一步上升;如果再把576块或1,152块GPU分散到多个机架,连接距离就会超出铜缆的能力范围。推理则缺乏同样的秩序:混合专家模型会从不同位置调用不同权重,让数据搬运变成“彻底混乱”,也为 Cerebras、Groq、Microsoft Maia、Meta MTIA 及其他专用架构留下空间。

  • 短期内,扩展规模的技术路线越来越偏向光互联,因为铜缆正在逼近物理极限。 铜缆在机架内部可以支持200Gbps,但无法跨越8个机架、约10米的距离;到了400Gbps,Vikram 认为它“已经彻底失效”。共封装光学可以在降低转换功耗的同时提供传输距离,但对于包含100,000块GPU的系统而言,可靠性、替换和大规模部署仍是问题。

  • 内存层级的优化目标应是每个 token 产生的有效工作量,而不是让所有场景都追求最高 token 吞吐。 对于上市时间至关重要的编码任务,1,000–2,000 tokens/秒和昂贵的带宽可能物有所值;而在后台读取 PDF 的智能体,则可以用更慢、更便宜的方式处理大量 token。真正的经济问题是:“每个 token 实际完成了多少有用工作?”

  • HBM 目前提供了最佳的带宽—容量平衡,但堆叠继续扩大正面临成本和扩展限制。 目前堆叠已经达到16层,Vikram 质疑继续推进到20层或24层是否仍具备经济性和技术合理性,并关注晶圆键合的 DRAM-on-logic 方案,后者有望实现“类似 SRAM 的带宽,但拥有类似 DRAM 的容量”。不过,任何效率突破都可能触发杰文斯悖论:单位任务的资源消耗下降,会刺激足够多的新需求,最终“我们的计算资源还是不够”。

精读

1. 托管式智能体把工程项目变成消费产品

  • Logan 将拐点定位在去年第四季度 Opus 4.5 之后:行业开始从 OAuth 订阅转向基于 API 的使用模式,智能体也开始把 AI 的边界从聊天和编程向外推进。早期 OpenClaw 部署展示了这一潜力——处理手机消息、通知并自主执行操作——但用户需要配置虚拟机、做出安全决策,还要有足够的技术信心,把一台电脑交给不可预测的智能体。

  • Vikram 自己的使用方式正好暴露了问题:他至今仍在家用服务器上运行 OpenClaw,但他说,“事情没那么简单。”人们购买 Mac mini,并不总是为了在本地运行模型,而是为了搭建一次性沙盒——这些机器没有邮箱或银行账户权限,智能体可以“放开了搞”,却不会“把我的生活搞砸”。

  • 云端虚拟机省去了购买硬件的步骤,却保留了配置负担。托管式产品进一步把虚拟机和智能体打包在一起:Vikram 花200美元试用 Grok bot,几分钟内就通过精致的 GUI 启动了智能体,心里想的是:“再见,200美元。”真正让智能体变得普及的,不是模型出现了根本性突破,而是价值实现所需的时间大幅缩短。

  • Instinct 让他彻底改观。Vikram 让它帮忙报名 Open Compute Project Global Summit,Instinct 随后返回二维码,并表示已经订购了一件尺码合适的 M 码 T恤:“如果有任何事情都能由它替我完成,那我就加入了。”

2. 智能体需求增长,但共享基础设施会拉平曲线

  • Vikram 的谨慎判断是——“我不知道自己是否正确”——个人助理很少需要前沿级智能。日历监控、邮件分拣和日常行政事务通常用 Sonnet 级别或开源模型就能完成;庞大的数学问题则是另一类工作负载。

  • 每个智能体也不需要永久绑定一颗处理器。云端硬件可以在用户之间轮转,智能体闲置时可以让内存退出服务,算力则在需要时即时启动。Vikram 自己的 ChatGPT 每小时检查一次重要邮件,而不是持续占用专用算力。

  • 但潜在用户面要大得多,因为“每个人都会给别人发消息”。家长可以通过普通消息跟踪学校日历、出行、足球课和日程变化,让那些从未想要编程助手的人也能用上有价值的 AI。

  • Logan 始终关注规模问题:即便是共享的低阶推理,也可能在数千万乃至数亿用户之间叠加出巨大需求。Vikram 同意算力会持续增长,扩展定律也尚未失效;他的较窄判断是,智能体的普及并不等于每个人各对应一个前沿模型和一颗永久专用的处理器。

3. 技术乐观与财务不安并存

  • Vikram 预计未来10年 AI 会“向右上方增长”。他的类比是互联网经历互联网泡沫破裂之后的走势:融资和个别公司可以失败,但真正有用的基础性技术仍会延续。

  • 他没有掩盖当前范式的不确定性。概率型 LLM 也许不是真正的“智能”,未来可能必须出现另一种路径;但他并不声称自己知道答案。他能观察到的是,AI 已经让一个人能够同时处理 Substack、播客、机构事务、会议和改期工作,而这些任务过去往往复杂到难以独自完成。

  • 预测未来6个月的能力要弱得多。去年年末,编程智能体看起来可能是最主要的使用场景;此后,人们对聊天机器人半截答案和幻觉的担忧有所消退,智能体已经进入手机,边缘 AI 又提出了下一个问题:“为什么每次都必须去云端?”

  • 在财务层面,Vikram “非常不安”。他提到 Anthropic 的 S1,称其有义务投入的资本和算力资源对应金额似乎超过5000亿美元,同时承认整个行业可能过度订购内存、进入供给过剩并最终崩溃。他的结论分成两半:对技术“保持乐观”,但不愿忽视过度部署的风险。

4. 训练需要一块巨型 GPU;推理却像急流

  • 训练仍在推动统一扩展域从72块GPU走向144、576和1,152块。72块GPU的 Blackwell 机架已经达到约200 kW;GPU 数量翻倍后,功耗可能超过400 kW,还没计入配套网络,电力输送、冷却和物理封装因此成为一等约束。

  • 分散到多个机架可以缓解单机架的密度问题,但连接距离也会从几英尺拉长到数米。覆盖约8个机架需要接近10米的传输距离,而铜缆无法以200Gbps完成这一任务。让大量 GPU 表现得像“一块巨型 GPU”的目标,最终把互联变成系统瓶颈。

  • Vikram 将训练中的数据搬运比作海浪:操作成批到达,all-reduce 把波浪送回,下一轮迭代随即开始。混合专家模型的推理则更像急流——每个请求只激活一个更大模型中的数百亿参数,连续两个请求可能需要调用存放在房间两端的权重。

  • 这种随机性解释了为什么推理领域允许更多架构实验。Google 从第4版 TPU 起就将训练和推理设计分开,而第8版似乎会同时发布两种设计;Cerebras、Groq、Microsoft Maia、Meta MTIA 和 OpenAI 的“Jalapeño”分别从不同方向攻击这一工作负载,因为“这就是狂野西部”。

5. 铜缆信号衰减,迫使 AI 转向光互联

  • 底层物理决定了传输距离。GPU 旁边的 HBM 可以提供约22TB/s,因为比特只需移动几毫米;在机架内部,信号要传输几英尺,能量随之损失,系统不得不降低速度,并引入预加重、纠错和 DSP,而这些都会消耗时间和功耗。

  • 在200Gbps下,铜缆在 Rubin 机架内部仍然可用。Vikram 的明确判断是,到了400Gbps,5米外的信号几乎无法辨识:“铜缆已经到达极限。”它同样无法连接起构建更大统一扩展域所需的相邻机架。

  • 功率密度的对比解释了为什么简单放大机架并不可行。云计算时代的机架功耗约为20 kW,AI 机架则是其10倍;如果再翻一倍,名义功耗就达到400 kW。现实中的过渡方案是让8个相邻机架作为一个整体运行,这也使光互联变得不可避免。

  • Vikram 认为,传统可插拔光模块在能耗上并不划算,这有助于解释 NVIDIA 为什么没有更早采用光学方案。共封装光学把电光转换放到 GPU 或交换机旁边,同时解决功耗和传输距离问题,但也带来更棘手的运营问题:当高度集成的光学组件发生故障时,如何在100,000块GPU的部署中完成替换?

6. 光学资源稀缺,催生“宽而慢”的架构竞赛

  • 如今常见的1.6Tbps光连接,通常由8条200Gbps通道组成。这些高速激光器使用磷化铟——能连接数据中心乃至洲际链路的“法拉利技术”——但眼下的任务其实只是与相邻机架通信。

  • 供应是关键约束。磷化铟激光器来自3英寸或4英寸的小型晶圆,Vikram 将其比作小煎饼;而这套原本服务于长途、城域和海底链路的产业,“从来没有准备好应对这种级别的需求”。

  • 另一条路线是“宽而慢”(wide and slow):使用更多低速通道。砷化镓 VCSEL 的速度可能在20–50Gbps左右;如果按50Gbps计算,32条通道就能重新构成1.6Tbps总带宽,同时依托成本更低、供应更充足的产业链。MicroLED 也提供了另一种光源,但其速度约为3–5Gbps,需要数百条通道。

  • Vikram 没有假装知道最终赢家:“我不知道正确答案。”眼下的争论,是用更少但稀缺的“法拉利”激光器,还是用更多、更便宜的通道,在带宽、制造、能耗和可靠性之间实现最佳平衡。Logan 随后将话题拓展到电力:从发电、逆变器、UPS,到储能和电容器,整个链条同样是一个巨大的约束。

7. 有效工作量,而非峰值速度,应该决定内存层级

  • 传统的层级结构——SRAM 缓存、DRAM、SSD、硬盘和磁带——已经碎片化。如今的 AI 覆盖片上 SRAM、HBM 和堆叠 DRAM、面向性能优化的单层 NAND、面向容量的 QLC NAND、介于两者之间的组合、磁盘,以及容量近乎无限但速度极慢的归档磁带。

  • Vikram 关注的核心问题不是哪个层级胜出,而是“每个 token 实际完成了多少有用工作?”如今行业像过去炫耀 FLOPS 一样炫耀1,000或2,000 tokens/秒,但在后台处理 PDF 的智能体没有理由为最高即时性付费。

  • 企业级编程可以证明高价高速方案的合理性,因为抢先上市带来的收益足以覆盖成本。后台研究则可以用更慢、更便宜的方式处理更多 token。把每类工作负载匹配到合适的内存层级,可以降低成本、改善毛利率或把节省让渡给用户,进而扩大总使用量。

  • Logan 提出更大的上下文窗口,可能从100万扩大到1,000万,甚至达到 Dario 据称提到的1亿。Vikram 的反驳是,并非所有上下文都有用。Logan 用健身举例说明这一点:智能体回答步数问题时,可以查询卡路里记录和健身追踪器数据,却不必保留用户讨论数据中心光学的工作对话。

8. DRAM 创新当下重要,但新方程可能重置内存栈

  • Vikram 最看重的层级是 DRAM,因为 HBM 目前提供了最佳的带宽和容量平衡:“眼下你离不开 HBM。”但堆叠已经达到16层,他质疑继续机械地推进到20层和24层,是否仍具备经济性或技术合理性。

  • 在逻辑芯片整个表面键合内存,能够提供远多于沿芯片边缘布线的连接。他提到 Cerebras 将整片 DRAM 晶圆键合到其晶圆级引擎上,Groq 预计也会推进相关方案;此外还有 D-Matrix 的 Raptor engine,以及采用2层或4层 DRAM 的 Qualcomm 设计,其共同承诺是“类似 SRAM 的带宽,但拥有类似 DRAM 的容量”。

  • 未上市公司版图反映出推理架构仍未定型:Vikram 提到 D-Matrix、以 TCO 为核心的 SambaNova 客户方案、颇有吸引力的 Etched 低电压引脚架构,以及 MatX、Fractile 和 Nubis 的芯片间纳米激光器。他的态度是探索性的,并不是宣称某一种设计已经胜出。

  • 未来5年最大的风险位于所有硬件供应商之上。当前硬件实现的是某一类 LLM 方程;如果研究突破能够用更少内存实现相当性能,就可能同时缓解带宽和网络压力。但杰文斯悖论仍然存在:每一次效率提升都可能带来更多使用量,最后又回到同一句话——“抱歉,我们的计算资源还是不够。”