(预告) Agentic Future中的推理、xAI:一家公司中的两家公司、Elon诉讼问答、Intel、Apple
(预告) Agentic Future中的推理、xAI:一家公司中的两家公司、Elon诉讼问答、Intel、Apple
摘要
- Ben Thompson的核心判断是,只要人类仍在环路中,快速推理就享有最强的溢价。 企业过去之所以不断购买更快的计算机,是因为员工等待的时间成本很高;如今的编码Agent仍会把结果交还给人类审核。Andrew回忆自己曾等了55秒,Ben则说“幸运的话也要35秒”,有些答案还要等上几分钟。不过,随着自主运行时间拉长、Agent变成“24小时员工”,“它们可以等算力”——延迟未必还会损害人的生产率。
- Agent系统的瓶颈正从原始执行速度转向内存容量,尤其是承载上下文和状态的KV cache。 Andrew举例说,一个真正有用的Agent应该能在一周后醒来,知道此前发生了什么、接下来该做什么;而潜在的Agent数量相较于有上限的人类需求“实际上无限”。这让从HBM到普通RAM、SSD的分层存储体系更有价值,因为“没有人在环路中”时,较慢的存储也可以接受。
- Cerebras和Groq说明,超高速推理仍有价值,但属于专用场景,而非通用架构。 Cerebras将300毫米晶圆上的光刻曝光区域跨接为“一片晶圆、一颗芯片”,在模型和上下文能够装入片上资源时,可在受带宽限制的环节实现“数个数量级”的提速;一旦内存溢出到片外,或KV cache膨胀,性能就会大幅下滑。语音和消费端交互仍是明确对速度敏感的市场,Ben当时也试探性地认为,Cerebras可能会在当周进入一个异常有利的IPO窗口。
- Ben最直接的受益者判断是:“最大的赢家是中国。” 如果Agent推理能够使用普通RAM、大容量存储和较慢芯片,同时等待内存读写,中国就能自行供应更多产业链环节,并出口低端组件。随着SK Hynix、Samsung和Micron把重点放在HBM上,这一窗口可能进一步扩大,也由此引出一个问题:普通DRAM将由谁来制造。
- 这一转变会冲击NVIDIA一体化推理模式的经济性,但不会颠覆其训练地位。 Ben将Dynamo、快慢算力混用以及以SSD为主的内存机架视为NVIDIA应对KV-cache压力的证据,但预计推理组件最终会拆分到更便宜的商品化市场。他也明确留有余地:这“未必意味着全面看空NVIDIA”,因为NVIDIA的方案“在训练领域仍然远胜其他方案”,而训练不会停止。
- 历史模板是云计算从高溢价Sun系统转向按故障设计的Intel商品化服务器集群。 Hotmail和Yahoo开启了这一模式,Google将其规模化,Amazon则通过AWS将其普及;软件容错能力让更便宜、故障更多的硬件在经济上反而更优。Ben预计推理也会沿着同样的路径从一体化走向模块化,因为“只要能完成任务,没人关心推理栈是怎么搭出来的”——对用户而言,能否工作以及成本,比用户可见的一体化更重要,Andrew也强调了成本因素。
精读
1. 人类等待时间支撑速度溢价
- Andrew Sharp梳理了AI的3次跃迁:ChatGPT证明token预测有用;o1证明在测试时投入更多token能够得到更好的答案;Opus 4.5加上Claude Code,则通过推理、工具调用和验证让Agent真正可用。他的问题是,快速编码推理是否只是一个过渡性红利。
- Ben的限定很关键:“速度永远重要”,但具体经济性取决于取舍。1980年代和1990年代,企业一再升级昂贵的计算机,因为人的成本更高;员工每等待机器一次,就意味着生产率损失。
- 今天的Agent还没有摆脱这套逻辑。它们完成一次运行后会寻求人类监督,迫使开发者重新找回思路;使用上限甚至会催生出荒谬的工作流:“好吧,我想我今天只能回家了。”在Ben看来,模型在“掉出上下文”之前能自主执行多长时间,是一个尤其有解释力的指标。
2. 快速推理是高溢价细分市场,不是通用架构
- 推理会让延迟更加难以忍受,因为投入更多token可能带来更聪明的答案。Andrew记得自己等过55秒;Ben纠正说,“幸运的话也要35秒”,而有些任务要花上几分钟——这正是Cerebras和Groq的切入口。
- Ben的架构介绍以Cerebras为核心:普通芯片受光刻掩模版尺寸限制,而Cerebras跨越不同曝光区域进行连接,让一片300毫米晶圆像一颗芯片一样运行。其片上算力和SRAM规模巨大,速度“难以置信地快”,在受带宽限制的步骤上甚至能快出“数个数量级”。
- 限制同样重要:片上内存容量有限,一旦访问片外内存,性能会“彻底崩掉”;对话变长也会扩大KV cache。Ben认为语音是长期存在的“最大”速度敏感场景,Andrew则指出消费端响应速度仍然重要。Ben只是试探性地预计Cerebras会在那一周IPO:“也许就是今天。”
3. Agent将推理变成内存层级问题
- Andrew所谓“24小时员工”的框架包含一个反转:Agent永远不睡,但因此也可以等待。Ben说得更直接:“它们可以等算力,没关系。”一旦工作独立于人类推进,较慢的执行就不再浪费昂贵的人力资产。
- 承载系统的资源不再只有模型权重,状态本身也变得关键。Andrew描述了一个有用的Agent:一周后醒来,找回正确上下文,执行任务,然后再次休眠;Ben则将这种可能没有上限的计算机需求,与人类能够提出多少需求的上限进行了对比。
- 大部分AI基础设施过去都围绕训练优化:高速GPU、大规模HBM池,以及让数万台、最终数十万台处理器持续获得数据的网络。NVIDIA这种灵活的架构同样可以服务推理,但不断增长的KV cache正给GPU集群带来压力。
- Ben提到NVIDIA的Dynamo,以及一种“里面只有内存……只有SSD”的机架,认为这代表了演进方向。寄存器和缓存速度最快,但容量极小;RAM、SSD、磁盘和磁带则依次变慢、变大。推理正从“GPU加HBM、一套方案包打天下”转向有意设计的分层架构,而之所以可以接受,是因为“做计算的是计算机”。
4. 商品化内存让中国成为最明确的受益者
- 被问及谁会成为赢家时,Ben给出了明确答案:“最大的赢家是中国。”如果普通RAM、大容量存储和相对较慢的处理器就能应对内存受限的Agent,中国就能制造更多相关产业链,自行承接超出预期的工作负载,并向海外销售组件。
- 这一供给侧机会不止影响中国国内AI。SK Hynix、Samsung和Micron都把重点放在HBM上,Ben追问:“谁来制造DRAM?”中国的低端供应可能缓解更广泛的内存短缺,而云服务商也会受益于算力和存储组合成本下降。
5. 推理走向拆分,NVIDIA仍保有训练护城河
- Ben给出的先例是互联网泡沫时期的技术栈:初创公司过去会把融资烧在一体化、可靠的Sun系统上;Hotmail和Yahoo开始尝试商品化机器,Google则搭建了庞大的Intel服务器集群,软件负责提供容错能力。随后,Amazon通过AWS让这套模式广泛可用。
- 他的预测沿着同一条路径展开:专用高端系统起初“什么都做”,但最终“系统中的每个部分都会被拆分”,进入商品化市场。Andrew将其概括为从一体化走向模块化;与Apple面向用户的一体化不同,推理栈没有用户会在意它的内部构造。Ben的观点是,只要能正常工作,没人关心它是怎么搭建的;Andrew则补充,成本也会成为关键。
- 双方的分歧更多是判断幅度不同,而非相互矛盾。Andrew问,更便宜且更耐用的替代方案是否会对NVIDIA构成利空;Ben承认这将是长期挑战,但拒绝把它解读为全面看空。NVIDIA正在快速推进推理编排和内存方案,在训练领域“仍然远胜其他方案”,而且“不可能突然就停止训练”。