第001期 - Claude Code、内存狂热、CPU回来了 | Jordan Nanos、Doug O'Laughlin、Myron Xie
第001期 - Claude Code、内存狂热、CPU回来了 | Jordan Nanos、Doug O'Laughlin、Myron Xie
摘要
- 内存周期已从1996年以来最糟糕的下行——当年“让行业三分之一破产”——剧烈反转为历史性短缺,短期内几乎看不到缓解。 Myron Xie解释了其中的机制:HBM每片晶圆产出的比特数只有传统DRAM的几分之一;每增加一颗GPU/XPU,都会把更多晶圆拉向HBM;而后疫情时代几乎没有新增晶圆投片或洁净室空间——“需求正在爆发,但我们几乎没有增加任何供给”。Doug O’Laughlin:内存和NVMe价格单日上涨约20%,环比上涨约100%,而且“至少还会紧张几年”。
- 经典的周期见顶信号——Samsung最后投降、最后增加产能——这次可能失灵。 Doug表示:“我认为他们会扩产,但仍然不够。供需缺口是有史以来最大的,而且根据我们看到的情况还在扩大。”他的“银河系大脑式判断”是:EUV瓶颈可能把原本预计约2035年出现的3D DRAM提前到约2030年,但不会早于2030年。
- CPU回来了,甚至 Intel 仍然——或者大概率将会——售罄,“这说明供给很紧”。 讨论把 Intel 定位为边际供应商;Arm“构成了前所未有的更大威胁”,而 AMD“仍在持续碾压”。Phoenix CPUs尤其值得关注,因为它可能改变 Arm 商业模式的适应方式。
- 据 Doug 抓取的每日序列,Claude Code如今生成了公开 GitHub 提交的约4.7–4.8%;Anthropic还在其300亿美元融资、3800亿美元估值的新闻稿中,链接了包含这一估算的文章。 这一占比从1月20日的约2%升至2月5日的约4%,目前仍在增长;Doug是在一条推文提醒他 Claude Code 会签署自己的提交后,才搭建了这套追踪器。
- Opus Fast 和运行于 Cerebras 的 OpenAI GPT-5.3-Codex-Spark,是定价在每年2400美元 Max 级别之上的价格弹性实验——“鱼子酱交易”。 Opus Fast按token收费约为6倍,速度约为2–2.5倍;Jordan Nanos形容 Cerebras 这笔交易是“花10倍的钱换4倍性能,或者更准确地说,花20倍的钱换10倍性能,差不多就是这样”。Jordan说 Fast 模式已经对他产生了效果:“现在我已经对 Fast tokens 上瘾了……我觉得自己回不去了。”
- 中国模型周带来了真正的突破:MiniMax 2.5“达到 Opus 性能……价格只有1/10”、GLM-5,以及最重要的 ByteDance Seedance/CDance 2 视频模型——“动画搞定了,熟透了”。 Doug称这是首次“彻底击败”Google Veo/Genie长期领先的视频模型,并提出一个阴谋论:“监控国家让所有人都拥有更好的训练数据”——中国监控占全部硬盘需求的10%。
- Jordan的存储判断是:日志、合成数据和生成视频将推动SSD/HDD需求爆发,而不是KV cache卸载;后者在生成视频中的留存比例可能“低于1%”。 他还警告,不要直接套用 Jensen 每颗GPU配16TB存储的估算;按此计算,ICMS只占硬盘出货量的不到0.7%——“这是对 ICMS 的正确结论,但不是对硬盘需求增长的正确结论。”
精读
1. Claude Code的提交占比逼近5%——相关文章还进了 Anthropic 新闻稿
- Doug讲述了事情的起点:他看到一条推文——“你们这些蠢货,提交信息全都写着是 Claude Code 提交的,你们可以把这个关掉”——于是询问 Claude Code 能否抓取 GitHub,并建立了一套每日序列,统计由 Claude Code 完成的公开提交。从1月20日核心研究图表中的约2%,到2月5日公开文章中的约4%;“现在已经几乎5%了……4.7%或4.8%”,而且仍在增长。随后,Anthropic在其300亿美元融资、3800亿美元估值的新闻稿中,链接了包含这一估算的文章。
- Doug的紧迫感,用他原话说是:“只要有人在关注,就能看出这一点……我们必须成为第一个。”付费数据会继续向机构订阅者提供,未来可能还会推出公开仪表盘。
- 谈到AI辅助写作,两人都拒绝让模型完全生成文章。Doug用 Claude Code 做提纲和删改——“这一段里最不相关的部分是什么?”——但坚持“用手指敲出人工token”;“这是我们最后的手工艺……我们手里只剩这块手工搅打的黄油了。”Myron只负责润色措辞。值得保留的一点行业内幕是,很多精彩文章其实出自 Myron 之手——“你觉得这些文章是 Dylan 写的吗?不是,兄弟。这是一个团队。”
- 一个关于agent使用的实时数据点:Doug曾在一项任务上同时运行7个agent,打开7个窗口,其中一个窗口又运行了7个子agent。
2. CPU回来了:“甚至 Intel 都卖光了”
- CPU讨论的关键证据在于边际供应商:没人会想到,全球最大、最成熟的算力装机基础会出现短缺,Intel 反而获得需求支撑。节目嘉宾表示,Intel 目前已经售罄,或者大概率即将售罄——“这说明供给很紧。”
- Doug的判断是,Arm“构成了前所未有的更大威胁”;Phoenix CPUs正在改变 Arm 商业模式可能的适应方式;与此同时,AMD“仍在持续碾压”。即使竞争者更多、市场更加碎片化,Intel仍很可能售罄。
- Jordan的结构性判断是:AI增长体现为通过API、以token形式消耗算力,而不是像云计算时代那样由财富500强企业自行部署虚拟机。根据 Microsoft Fairwater 园区的照片,CPU数据中心支撑着低成本GPU数据中心。Hock Tan接手后,VMware已经被“掏空”;至于 Pat Gelsinger 手臂上那枚 VMware 纹身,依然无济于事。
3. 内存狂热:从1996年以来最糟糕的周期,剧烈反转为最好的周期
- Myron解释了供给机制:HBM每片晶圆产出的比特数只有传统DDR DRAM的几分之一——TSV禁布区侵蚀裸片面积,HBM要达到目标性能时良率“非常糟糕”,而8层或12层堆叠在封装环节还会进一步损失良率。每增加一颗GPU/XPU,都会把晶圆拉向HBM并压缩全行业总比特数;CPU增长则进一步收紧传统DRAM。与此同时,新增晶圆投片几乎为零,因为后疫情余波过后,“实际上已经没有多少洁净室空间可以真正放进设备了。”
- Doug回顾称,这轮下行确实是1996年以来最严重的一次,内存行业还做了一件历史性的事:不是承受设备闲置成本,而是直接关掉机器——“不,不如想办法说服所有人把它关掉。”如今已经没有地方可以重新打开供给水龙头。内存和NVMe价格单日上涨约20%,环比上涨约100%,“有一点恐慌性买入,真的只有一点点。”
- NAND供给比DRAM更差,利润率也更低,因此厂商会优先把新增产能分配给DRAM——“至少几年内都会疯狂。”
4. Samsung投降是见顶信号——但这次仍然不够
- Jordan先介绍历史规律:通常当 Samsung 在 Hynix 和 Micron 之后最后增加产能时,周期就见顶了。Doug说,上一个周期里,Samsung顶住要求减产的压力,较平常多坚持了大约三个季度;最终减产标志着“周期的绝对底部”。他现在的判断是:“我认为他们会扩产,但仍然不够。”根据 SemiAnalysis 的研究,供需缺口已是有史以来最大,而且还在扩大。
- 晶圆厂上方真正的约束来自 ASML:ASML每年能交付的 EUV 设备数量有限,逻辑芯片产能同样紧张,而设备应如何在 TSMC 和内存厂商之间分配,仍是内部激烈争论的问题——“这是 ASML 战略团队要回答的问题,他们或许应该买我们的模型。”Myron认为,既然逻辑芯片需要内存、内存也需要逻辑芯片,系统就应该以完整系统的配比为目标进行优化;但“这个交换比例本身说实话非常难……我不认为有很多人知道答案。”
- Doug现场估算,并保留了他的犹疑——“我是在凭感觉估”:先进逻辑芯片每10万片晶圆投片对应的资本开支,可能是DRAM的约2–3倍;但如果DRAM的交换比例约为3倍,HBM可能就是全球最昂贵的晶圆——“我认输了。我觉得HBM最难。”
- 更具“银河系大脑”色彩的推论是:EUV挤压“可能”把原本预计约2035年出现的3D DRAM提前到约2030年——“明确说,不会早于2030年。”原因在于3D DRAM不使用EUV,能够释放整个系统层面的吞吐量。
5. 鱼子酱交易:Opus Fast 和 GPT-5.3-Codex-Spark 是定价实验
- Jordan提到仅使用SRAM的加速器:花约6倍的钱换取约2.5倍性能。Myron接着给出本期最精彩的比喻:“这就像说鸡蛋贵了一点,所以我要早餐吃鱼子酱。”SRAM的成本远高于DRAM,而逻辑芯片产能本就紧张,但“市场确实有付费意愿”。
- 市场表现是:Opus Fast的token价格约为普通版本的6倍,速度约为2–2.5倍;OpenAI GPT-5.3-Codex-Spark运行在 Cerebras 上,Jordan形容这是“花10倍的钱换4倍的性能,或者更准确地说,花20倍的钱换10倍性能……差不多就是这样”。Jordan认为,各家实验室正在突破每年2400美元 Max 级别,沿着需求曲线继续向上定价——“一定存在更高的价格层级……他们正在摸清价格弹性曲线。”他的亲身体验是:“现在我已经对 Fast tokens 上瘾了,我不觉得自己回得去,老兄……你把我从海洛因推到了芬太尼。”
- Myron的平衡判断是:目前 HBM 仍然拥有最优的成本—带宽—密度组合,而 GDDR 的每GB价格也正在逼近 HBM;非 HBM 架构“从来都有取舍”。
6. 中国模型周:“我人生中最中国的时代”
- Doug基于11月或12月读到的一篇 SCMP 文章,推测 DeepSeek V4 会在美国总统日发布。Jordan认为总统日在中国并不知名,Doug则坚持自己的发布时间理论:DeepSeek专门选择美国节假日发布——感恩节、平安夜——“就是为了狠狠地恶心美国。”他还说:“如果他们真的想在我们头上耀武扬威,就应该放在7月4日发布。”
- 这周发布的模型包括:MiniMax 2.5,“达到 Opus 性能……价格只有1/10”,激活参数约10B;GLM-5,由智谱推出的“一次不可思议的发布”;以及一家类似中国 Indeed/LinkedIn 的公司训练基础模型,在 Soy Bench 上达到约70%。此外还有 ByteDance 的视频模型,讨论中先称为 Seedance,后来又称为 CDance 2,能够生成角色保持一致、时长达1分钟的场景。Doug说:“这已经不再是乱码了。”它带来了类似 Opus 4.5 突破时的能量,“至少动画搞定了,熟透了”,并首次“彻底击败”了 Gemini 长期以来在视频领域领先的 Veo/Genie。
- Doug关于原因的阴谋论是:“监控国家让所有人都拥有更好的训练数据。”中国监控占全部硬盘需求的10%,这一规模足以让他认为,疫情封控进一步伤害了 HDD 厂商,因为这部分需求本身就很重要。
7. 存储需求来自视频和日志,而不是KV cache——还要警惕配套率
- Jordan一直在回应业内人士提出的问题:模型处理的所有内容都会写入日志,“他们不会丢掉数据”;合成数据的输出会被保存;每台摄像机都会写盘。数据源的规模是模型活跃参数或输入的10倍到数百倍。生成视频中,KV cache占比“低于1%”。
- Doug用 iPhone 存储作类比:打开你的 iPhone,约20%是应用,约70%是照片和视频。“这就是原因。”像 CDance 这样的海量视频生成,以及更重要的发送和观看,才是真正的存储驱动力。
- 关于经验法则,SemiAnalysis重建了完整BOM——每个端口、东西向流量和南北向流量——用来检验1.5倍收发器配套率,结果确实是1.5倍。“一些非常强大的经验法则,足以让你在人生中走得很远。”到目前为止,资本开支,或者至少是每GW对应的收入变现,仍是最干净的衡量标准。但市场流行的配套率捷径——Jensen在 CES 上提出的每颗GPU配16TB存储——意味着 ICMS 只占硬盘出货量的不到0.7%,这“是对 ICMS 的正确结论,但不是对硬盘需求增长的正确结论。”
- Jordan说 Jensen“很擅长在恰当的时间说出正确的话”,把市场对内存的恐慌引向“连接在他的GPU上的内存”。Doug认为,1000亿美元 OpenAI 交易“后来发生,是为了压制 AMD”;他还提到 Cerebras 发布 Spark 时宣称:“NVIDIA 仍然是我们所做一切的核心。”最后一句是:“这是 Jensen 的世界,我们都生活在其中。”