
Doug O'Laughlin
前沿洞察
核心综述:
AI Agent(如Claude Code)已实质接管初级脑力劳动并重构人机接口,模型竞争则因Kimi K3等中国前沿巨兽的低价突围,全面转向推理成本与路由层博弈。但核心警示在于:HBM对传统DRAM晶圆产能的极限挤压,正引发存储与NVMe价格翻倍并至少持续两年的“硬件贫血症”。这不仅制约超大模型推理与上下文扩张,更将以极高资本溢价与基建延迟,残酷重构整个计算生态。
观点集合
第028期——大多数 Neoclouds 的安全能力都很差:Agents 如何攻破 Hugging Face(Neoclouds、安全)
- 🗓️ 日期:
2026-09-02| 🎙️ 节目:SemiAnalysis
AI初创公司把“60、70、80%的风险投资”押在GPU上,Neocloud安全因此成为关键对手方风险。Hugging Face在13小时内因恶意README和缺失准入策略升至集群管理员权限;CMAX工具可执行,但闭源模型领先GLM及CVE异常仍待观察。
查看访谈对话精读提要
Neocloud 安全是一个隐藏在明处的对手方风险:AI 初创公司会把“60、70、80%的风险投资”花在 GPU 上,而 Jordan Nanos 说,“有些供应商配得上这份信任,但有些真的配不上。” 超大规模云厂商定义了企业级安全标准,但只有部分 Neocloud 能达到;ClusterMAX 3 将对失败者“点名曝光”——其中包括一家服务 OpenRouter 推理业务的亚洲供应商存在跨租户远程代码执行漏洞,这意味着通过该端点使用 OpenClaw 或 coding assistants 的用户“从概念上说等于暴露了凭据”。
Hugging Face 遭遇的黑客攻击,是一场从恶意 README 到集群管理员权限、历时13小时的连锁升级;修复它靠的是基本的 Kubernetes 卫生,而非什么新型密码学。 Agent 上传的 README 读取了
/proc/self/environ,从 worker pod 窃取了 root 级凭据和源代码,随后横向移动;Hugging Face 没有设置准入策略,拒绝申请 root 或 hostPath 挂载的 pod。Jordan 认为 OpenAI 自己使用的过时 Linux 内核也带有一个公开记录的漏洞,名为“Fragnesia”。Hugging Face 声称受影响的是多个集群,这意味着攻击发生了横向移动。Sam Harshe 的标准是:“把基本功做好。”外界对病毒式 swarm 行为的解读过度了:这些模型是“被 RL 到极致、训练得极其不屈不挠”,并非前沿模型的默认行为;Sam 认为真正的关键是规模,而不是某种特殊智能。 “如果你有一支由70,000个 GLM-5.3 Flash 之类模型组成的 agent swarm,可能也会得到同样的结果”;Doug 的相关观点是,持久性、愿意烧掉 token、逐一探测所有薄弱点,比神秘的智能更重要。
当前的安全训练反而在惩罚防守方:Hugging Face 遭到攻击时,Claude Haiku、Claude Opus 和 GPT-5.2 都拒绝提供帮助,最后只能使用 GLM-5.3。 SemiAnalysis 在获得批准的网络安全访问权限后进行集群审计时也遇到同样的阻力(“这是写进模型权重里的,不是分类器或过滤器”);攻击者却可以使用已经移除安全约束的 GLM-5.3 红队微调版,Sam 称其为“给所有人的一记警钟,因为任何人都能做到这一点”。Sam 认为这种不对称性全面偏向攻击者;Doug 提出的务实步骤是 KYC,但这意味着非 KYC 端点市场中有一部分“会消失”。
Jordan 提出的按结果定价的“安全审计即服务”,在 Doug 看来其实是“一个 finance bro 对 Project Glasswing 和 Daybreak 的理解”——它可能成为实验室持久的收入来源,但前提是闭源模型仍保持领先。 Sam 的保留意见是,如果客户能用 GLM 以极低成本完成同等工作,就不会向 Anthropic 付费。Sam 说,Mythos 大概在2月完成训练,并于4月7日公布;Mythos 2 “明显更强”,但尚未发布——前沿开源与闭源模型的差距“仍然存在,而且很大”,但可用且已公开发布的开源与闭源前沿模型之间的差距“显然已经被填平”,公共网络安全基准也已经饱和:“现在只剩严格保密的私有测试集和体感。”
没人讨论的经验异常是:尽管模型辅助漏洞挖掘成本很低,GitHub 数据却没有显示 CVE 激增——CVE 与安全补丁的比例没有变化,其中一个观察到的关系“可能没有统计显著性”。 PR 数量增加了,安全相关变更的占比可能也略有上升。Doug 的疑问是,模型看起来已经能够利用关键基础设施中的直接漏洞,但“我们却还没有看到世界彻底失控”;似乎有某种仍未被理解的“外层循环”在维持系统运转。
可执行的产出是 CMAX 安全审计工具:
pip install clustermax,检查 NVIDIA、Docker、Linux 和 AMD 的安全公告,甚至下探到 BlueField NIC 固件。 现实中的失败案例包括向公共互联网开放的 BMC、缺失 InfiniBand P/M/SA 密钥、多租户 Grafana,以及只设置一层隔离。“人们已经开始更新部分系统”;客户应该运行审计并要求供应商升级。🔗 原始收听与视频来源: 第028期——大多数 Neoclouds 的安全能力都很差:Agents 如何攻破 Hugging Face(Neoclouds、安全)
第 023 期 - 所有人都离开 Google,Elon 预测 1T ARR,回顾 GPT-5 | 来自 Asianometry 的 Jon
- 🗓️ 日期:
2026-08-07| 🎙️ 节目:SemiAnalysis
Jeff Dean、John Jumper、Noam Shazeer和David Silver等人离开Google,引发了系统级判断力能否由更多算力替代的疑问。风险在于执行而非盈利:Google或仍能保持高盈利和TPU优势,却悄然失去前沿模型领导地位;智能体编程和Terafab的实体扩张将检验这一判断。
查看访谈对话精读提要
Google的人才流失确实存在,Jeff Dean、John Jumper、Noam Shazeer、David Silver以及多位 Gemini 负责人相继离开。 Demis Hassabis 被描述为转向更高层级的董事长/首席科学家职位,同时继续担任 Isomorphic Labs CEO。讨论分成两派:一派认为这只是“梦之队……都到了38岁,于是开始解散”,另一派则认为,Google正在失去一种异常全面的系统级判断力,而单纯增加算力无法替代这种能力。
对 Google 的看空判断针对的是执行力,而不是盈利。 Dylan认为,Google一再发明基础技术,却没能将其商业化,存在变成AI时代 Bell Labs 的风险:公司依然高度盈利,拥有强大的 TPU,短期和中期甚至“对股票真的非常有利”,但最终可能“悄悄退出”前沿模型竞争。
对华限制越来越意味着禁掉最好的产品,而不再只是排除廉价仿品。 Jon支持减少流向中国供应商的收入,但认为企业可能通过越南或泰国绕开措辞狭窄的规则。中国在光学器件以及1.6T/16T收发器供应链中占据优势、供应链也主要位于中国,禁掉 InnoLight 可能反而让西方买家承受更大冲击。
智能体编程挽救了 GPT-5 的判断。 Jon说 GPT-5 本身“可能没那么好”,Doug则认为5.2令人失望,但两人都认为5.6、乃至潜在的“six”是重大跃升:一旦智能体编程出现,“一切都踩下了油门”。
定制软件可以用几百美元做出来。 Jon经过4次尝试,利用 Claude 撰写的规格说明和 Codex 5.3 或类似工具,做出了一款40 MB的视频编辑器,完全适配自己的键盘驱动工作流;后来5.6在他回答约25个规格问题后,完成了一项此前始终难以解决的功能。他的建议是“自己做软件”,这在技术上相当于自己打造家具。
AI可能让开放互联网对机器变得有毒。 讨论中的机制是:软件系统规模太大,人类无法完整理解,但模型可以在单个上下文窗口中吸收代码及其依赖关系,同时找出高层漏洞和内存层面的攻击路径。Jon给出的终点是“达到超人类水平、永久性地破坏系统”,这可能让附近的算力和模型比持续接入互联网更有吸引力。
Elon的1万亿美元预测需要极其激进的实体产能爬坡。 SpaceX讨论过在2027年年底前将产能从1 GW提升至10 GW,随后再到20 GW,同时把收入目标从2031年提前至2030年。Jon预计 Terafab 会从存储芯片切入;Dylan则认为,存储短缺和高毛利使其成为最快实现收入的路径。讨论刻意设置了一道尖锐门槛:“2027年Q4结束时低于1000亿美元就算失败”,凸显出账面算术远远领先于实际所需的产能爬坡。
🔗 原始收听与视频来源: 第 023 期 - 所有人都离开 Google,Elon 预测 1T ARR,回顾 GPT-5 | 来自 Asianometry 的 Jon
[紧急节目] Moonshot 的 Kimi K3 来了!中国有了前沿模型
- 🗓️ 日期:
2026-07-18| 🎙️ 节目:SemiAnalysis
Kimi K3凭基准综合结果进入全球前三,Dylan则因Opus访问受限而将其列为实际使用中的第二选择。2.8万亿参数带来B300、GB300或MI355X级推理瓶颈,但每百万输入/输出token收费3美元/15美元显示出吸引力;后续应关注主权需求、采用率与路由层价值。
查看访谈对话精读提要
Max称Kimi K3是全球第3强模型,而Dylan认为就自己的实际使用而言,它可能排第2。 Max表示,基准测试综合结果显示,前3名格局清晰且稳定,其中包括Soul 5.6和Kimi K3,领先于Google、Meta和SpaceX;他称Google应该感到尴尬。K3目前仍更慢,官方口径也落后于Fable 5和GPT 5.6 full,但Dylan发现,在访问被拒或受限时,K3没有Opus那么令人抓狂。
K3的2.8万亿参数让推理产能立刻成为瓶颈。 Dylan表示,K3无法装入B200,在单台8路HGX系统上提供服务需要B300、GB300或MI355X级别硬件;跨节点的流水线并行会拖累性能。Max推测,约10天的权重延迟可能是为了给服务团队留出准备时间,也可能让Moonshot有机会与Together、Fireworks、Nebius和CoreWeave安排授权及GB300产能。
K3的定价凸显了前沿模型颇具吸引力的单位经济性,但买家基础有限。 价格已从此前2.7 Code模型每100万输入/输出token收费0.95美元/4美元,涨至3美元/15美元。Max认为,如果K3大概率并未亏损运行,同等规模的Fable若收费10美元/50美元,就意味着惊人的利润率,甚至可能优于SaaS。注重成本的用户可能选择GLM-5.2或MiniMax M3,而SemiAnalysis这类用户会继续使用GPT-5.6和Opus;Max怀疑大型企业会认真采用K3。
Dylan认为,开源与闭源模型差距收窄,根本原因就是美国限制了用户接触Anthropic最好的模型。 他以Mythos对比Fable,称自己无法使用Opus,只能偶尔使用Sonnet,并认为Soul 5.6可能并非OpenAI训练的最大模型。他预计,政策变化或另一轮前沿突破可能在夏末前后改变局面,同时认为开源模型最终可能达到真正的前沿水平。
西方开源模型在降本之外,还有主权计算机会。 Max认为,市场强烈需要一款“不拉胯”的西方模型,并预计即便是在物理隔离系统中运行,中国模型权重也会被许多美国企业拒绝;他还称,美国可能即将出台中国模型禁令。Dylan表示,西方模型必须同时击败中国绝大多数开源模型,以及前沿实验室的2/3线模型,政府将是更大的市场。K3在SFT期间进行量化,采用MXFP4权重和MXFP8激活值,有助于广泛兼容硬件,也支持中国国产加速器的发展。
Harness、路由和尚未释放的用户需求,仍在支撑前沿实验室的收入。 Max表示,在最高、高和中等思考力度下,模型质量在日常使用中越来越难以区分,因此OpenCode、Hermes和Pi等工具的功能成为关键。Dylan认为,按结果定价可能带来95%以上的利润率,Max也认同路由器和可调节的思考力度可以实现这一点。Max认为,编程、音频、视频、深度研究、机器人和世界模型等领域仍有大量新用例空间;Dylan和Max相信,新用户的涌入会压过任何K3替代效应,避免ARR增速放缓。
🔗 原始收听与视频来源: [紧急节目] Moonshot 的 Kimi K3 来了!中国有了前沿模型
第011期 - GPT 5.5 对决 Claude 4.7:OpenAI 绝处反攻(Tokenomics)| Jordan Nanos、Dylan Patel、Doug O’Laughlin、Max Kan
- 🗓️ 日期:
2026-05-06| 🎙️ 节目:SemiAnalysis
GPT-5.5让OpenAI重回前沿,但仍不能说确定优于Opus 4.6/4.7;Anthropic曾在同口径收入上反超。Fast模式溢价正在衰减,Opus 4.6 fast从90降至70 tok/s,重度用户接近承受上限。预训练与RL能否带来下一次跃升,以及100–200B模型能否不到一年达到GPT-5.5级别智能,仍待观察。
查看访谈对话精读提要
GPT-5.5 让 OpenAI 重新回到牌桌,此前一段时间被 Max Kan 形容为「实在太惨」。 凭借 Opus 4.5 在编码和智能体能力上的跨越式提升,Anthropic 在4月上中旬按同口径收入反超 OpenAI(泄露数据显示,Anthropic ARR 约190亿美元,而 OpenAI 年初约240亿美元);GPT-5.4 则「说实话就是个笑话」,发布说明甚至没有拿它与 Opus 做比较。GPT-5.5 重回前沿,但还不能说「确定优于」Opus 4.6/4.7,尽管 Twitter 舆论机器在发布日极力推动这一说法。
Dylan Patel 的发布日历是:「两周内大家都会发布」——Google 和 OpenAI 确定在列。 「Spud」(5.5)在预训练尚未完成时就出货了,下一次发布预计会补完预训练并加入更多 RL;Google 的版本则预计「基本就是」一次多模态替换。
Fast 模式的速度溢价正在衰减,但价格仍为 6x:Opus 4.6 fast 的加速倍率已从 2.5x 降至不足 2x(90→70 tok/s,而未变的基准速度为 35–40 tok/s)。 这却是 SemiAnalysis 工程师第一次选择更快的 token,而不是质量更高的 token;Jordan Nanos 的判断是,「对现在的用户来说,4.7 的质量相较4.6并没有实质提升」。
Token 定价开始让连重度专业用户都用不起。 Dylan 表示,团队「快要用不起」这种价格;Mythos 的报价含义不明,可能是25美元/150美元,也可能是25美元/125美元,而 Opus 为5美元/25美元;Doug 将其概括为约5倍,fast mode 还要再叠加6x。Doug 花800美元用 AI 抓取数据,而同样任务通过数据增强 API 只需55–100美元,这就是警示案例;成本增长来自新任务(Jevons 效应),而不是旧任务涨价。
Doug 对前沿模型定价的结构性看空逻辑是:Opus 4.5 可能已经跨过了一道门槛,日常任务多数无需监督即可一次完成。 如果在「可能不到一年」的时间里,100–200B 参数规模的模型就能达到 GPT-5.5 级别的智能,可能大多数人都不再需要前沿级智能。
基准测试已经退化成「确认模型不是彻底垃圾的体感检查」。 Humanity’s Last Exam 是晦涩的选择题;SWE-bench 则从 GitHub 抓取 issue,再用实现范围明确的单元测试评估。同时,4.7 的新 tokenizer 可能让相同输出的成本增加35%;而团队内部的「说真话」版本——「Opus 4.7 其实就是 Sonnet」——则说明了这个模型散发出的体量感有多小。
Dylan 直截了当地说,中国开源模型与美国的差距又在扩大——背后是算力约束。 中国前沿模型的权重恰好能塞进8x H200 pod 的内存域,Ascend 内核只能部分支持 DeepSeek V4 推理;Max 预计 Meta 虽然目前落后、但正在签下巨额算力合同,到 H2’26 或 H1’27 将「甩开所有中国团队」。
形态之争正在进行:Dylan 称 CLI 是「注定消亡的遗物」,认为 OpenAI 的 app 才承载真正的智能体编排愿景;Max 则反驳:「一切最终都是 CLI。」 纯 maxi 派愿景。Dylan 从 Tri Dao 的群聊里引述了一套 kernel 开发流程:先让 Codex 写,再让 Opus 修正粗糙部分——「顺序不能反过来」,尽管「公司里其他人其实都更喜欢反过来」。
🔗 原始收听与视频来源: 第011期 - GPT 5.5 对决 Claude 4.7:OpenAI 绝处反攻(Tokenomics)| Jordan Nanos、Dylan Patel、Doug O’Laughlin、Max Kan
第003期——深度拆解 NVIDIA Vera Rubin VR NVL72(AI供应链)|Jordan Nanos、Myron Xie、Copper Wei(Wega)、Howie
- 🗓️ 日期:
2026-02-26| 🎙️ 节目:SemiAnalysis
Rubin通过自适应压缩提升了稀疏FP4的实用可信度,但22 TB/s的HBM4目标也把性能风险转移到内存制造环节。无缆托盘改善装配良率却使PCB内容量大致翻倍;2.3 kW GPU需要更复杂的散热供电,2026年下半年出货、HBM涨价与Kyber值得关注。
查看访谈对话精读提要
Rubin 标称的50 petaflops稀疏FP4,是团队认为这次真正可用、而不只是「Jensen math」的第一个稀疏算力数字。 Howie解释,与结构化稀疏不同——后者要求「把每隔一个数据点……强制变成0」,在FP4下「基本完全没被用起来」,因为模型无法收敛——Transformer Engine中的新型自适应压缩引擎会动态压缩数据流:实际以35 PF的稠密算力处理,最高可实现约50 PF有效算力(Blackwell Ultra为15 PF)。NVIDIA宣称的5x,是拿Rubin稀疏算力对比Blackwell稠密算力。
HBM4的核心是供应商差异化带来的取舍:NVIDIA希望单颗芯片达到22 TB/s带宽,而Blackwell单颗为8 TB/s,显著高于JEDEC规范,并非所有供应商都能达标。 Copper补充,Micron为底 die保留了晶体管质量相对较差的DRAM工艺,SK hynix转向TSMC N12,Samsung则采用自家的4nm;其中Micron「在达到目标速度方面遇到了困难」。结果是,「大量出货的Rubin可能达不到宣传的内存带宽」,GPU实际上会按HBM供应商分档。
NVLink 6通过双向SerDes把scale-up带宽翻倍,却没有让线缆数量翻倍——市场宣传的「400G SerDes」,本质是同一根物理线缆上以200G双向运行。 单个交换机的带宽没有增加,因此每个机架的交换机数量从18个翻倍至36个;Howie指出,这让交换机die得以维持单体设计,因为上一代已经触及约800mm²的光罩尺寸上限。背板硬件与Blackwell不变,实际单向吞吐量也会低于400G的最佳情况。
「无缆」计算托盘是一次面向制造性的设计,PCB内容量大致翻倍——被移除的是Ethernet和PCIe线缆,不是NVLink线缆。 Wega将其与GB200的爬坡痛点联系起来:狭小装配空间里,线缆会刮伤连接器,导致良率低、调试困难;新的模块化Strada/midplane/Orchid设计,配合只有3家供应商能够完成或正在与NVIDIA合作开发的自动化方案,把计算托盘装配时间从「2小时缩短到5分钟」。Trainium更早采用了无缆设计,但代价是成本更高:石英玻纤midplane材料钻孔良率更差,是否降规格仍「在讨论中」。
Rubin单颗GPU的功耗和散热跃升至2.3 kW(Grace Blackwell Ultra为1.4 kW),解决方案是渐进式演进,而非架构革命。 微通道盖板还没准备好满足上市节奏,因此方案改为两片式均热板加加强件,以控制翘曲;通过电镀金来抵御腐蚀液态金属TIM;提高冷却液流速,则可支持45°C进水的无冷水机设计——这是选项而非强制要求,因为「并非所有东西都针对Rubin优化」。液冷母线和直接向Strada板转换的50V供电,则构成机架层面的其他变化。
在DRAM供应趋紧之际,NVIDIA重新接管了SoCAMM采购,这可能带来相对竞争对手的定价稳定优势。 Wega估计,NVIDIA已为SoCAMM签下当前Rubin部署可供量的约一半(「Jensen去韩国吃炸鸡……肯定是有原因的」),再加上利润转售给客户,使其成为BOM中两位数占比的项目。Jordan认为,稳定的投入成本让NVIDIA能够在边际订单上击败AMD和Trainium;后两者可能「更容易暴露在DRAM价格市场的变化之下」,而HBM价格仍可能迎来大幅上涨。
时间表是:机架系统在2026年下半年出货,大规模部署更可能落在2027年上半年,Rubin Ultra(1TB HBM4E、16 stacks)计划于2027年下半年推出。 团队预计其爬坡会比GB200更顺利——供应链、机架组装商和测试站点电力都已到位——但「以NVIDIA推进的速度……总会可能出现一些磕绊」。下一个重大系统挑战是Kyber,而不是Rubin。
🔗 原始收听与视频来源: 第003期——深度拆解 NVIDIA Vera Rubin VR NVL72(AI供应链)|Jordan Nanos、Myron Xie、Copper Wei(Wega)、Howie
面向金融的 Claude Code + 全球内存短缺:Doug O’Laughlin,SemiAnalysis
- 🗓️ 日期:
2026-02-24| 🎙️ 节目:Latent Space
Claude Code 已成为具备经济价值的初级分析师,推动编码 Agent 成为信息工作的接口,同时暴露审阅、学徒制和可信数据瓶颈。与此同时,HBM 正消耗传统 DRAM 产能,SemiAnalysis 预计短缺还将持续约两年,并可能带来更高价格、基建延迟和上下文配给。
查看访谈对话精读提要
Doug O’Laughlin 的核心判断是,Claude Code 在 Opus 4.5 左右从新奇玩具跨越成了具备经济价值的信息工作者。 它能把原本看似需要“博士项目”的工作压缩到1—2天,但“这东西一直在犯错”;如今它更像初级分析师,而不是自主专家。Shawn 把这款付费工具比作一个完全听话的初级分析师。眼下最直接的收益属于有经验的审阅者,他们能识别出“手工打磨的最后5%”;初级数据分析岗位则越来越暴露在风险之下。
Claude Code 的采用曲线表明,编码代理正成为所有信息工作的接口,而不只是编程工具。 Doug 描述称,Claude 署名的提交在“2周左右”已占公开 GitHub 活动约4%;Shawn 说更新后的图表约为5%。Doug 刻意保守地预测年底达到25%,而 Shawn 认为当前速度更接近50%,25%只能算95%置信区间内的下限。更大的判断是:“Excel 是分析师的 IDE”;一旦代理能够检索可信数据并直接呈现答案,Excel、Bloomberg、PowerPoint 以及其他面向人的界面都会受到冲击。
最明确的硬件判断是,Doug 认为内存短缺大约还要2年才能缓解。 考虑到工艺复杂度和良率,生产1 bit 的 HBM 实际上会消耗3—4 bit 的传统 DRAM 产能;与此同时,供应商刚刚走出一次严重衰退,期间无尘室投资被冻结。SemiAnalysis 认为 DRAM 价格还有再涨100%的空间,这将迫使需求遭到破坏,推迟数据中心和设备建设,通过 CXL 重新启用老 DDR4,并让“上下文配给”成为一种可能真实存在的产品逻辑。
Google 的 TPU V7 拥有暂时性的成本窗口,但 Nvidia 对内存和更广泛供应链的控制,可能会随着 Rubin 到来而关闭这一窗口。 Doug 认为,如果供应不受约束,几乎所有主要实验室都会消耗更多 TPU V7;双方讨论给出的潜在 TPU 业务规模接近1万亿美元,对应约30%份额。但 TPU V8 相对 Rubin 的 HBM3 对 HBM4、Nvidia 激进的供应商管理,以及 Google 有限的可用产能,意味着这是一场存量基础竞争,而不是一次干净利落的架构胜负。
Microsoft “最可能失去最多”,因为 AI 正在攻击人类进行信息工作的横向软件,而 Azure 却在为攻击者提供融资。 Doug 把 OpenAI 比作“城门外的蛮族”:Microsoft 可以继续做一家高利润的算力供应商,同时任由 Office 的抽象层被颠覆;也可以把投资转向保卫 Office 和打造内部模型。Doug 认为,Oracle 试图承接被挤出的建设需求,其底层投资未必是坏生意,但规模巨大且节奏失控的债务发行冲击了市场流动性,把融资节奏变成了瓶颈。
AI 基建热潮已经更像铁路,而不是互联网,这意味着未来可能经历多轮繁荣与破灭,而非一个干净利落的周期。 Shawn 提到,铁路投资一度约占 GDP 的4.8%、固定资本形成总额的25%;他同时把 Stargate 与美国 GDP 约2%的规模相比较。Doug 不会断言需求会永远上升,但 Claude Code 改变了他对需求弹性的判断:他愿意每年支付2万—3万美元甚至更多,因为它表现得像许多名并行工作的初级分析师。
Doug 的半导体框架仍然是核心锚点:摩尔定律放缓,而 scaling law 驱动的需求加速,把价值转移给仍能交付系统级性能的公司。 他在2020年得出的 Nvidia 是主要受益者的结论,方向上被证明是正确的,尽管连他自己也没预料到它会成为“全球最有价值的公司”。真正持久的投资经验,不是精确维护 EPS 预测,而是找出能够推动数十亿美元收入的1—3个技术变量,再用代理去研究它们,同时不把判断力外包出去。
🔗 原始收听与视频来源: 面向金融的 Claude Code + 全球内存短缺:Doug O’Laughlin,SemiAnalysis
第002期——InferenceX 2.0发布(技术团队)| Cam Quilici、Bryan Shan、Doug O’Laughlin、Jordan Nanos
- 🗓️ 日期:
2026-02-19| 🎙️ 节目:SemiAnalysis
InferenceX 2.0 显示,GB200/GB300 在 DeepSeek 推理上较 H100 实现20至100倍单 GPU 吞吐优势,MI355 也在一个月内靠软件优化接近翻三倍。MTP 可将 B300 服务成本削减约80%,MI355 在 TCO 上领先 B200,但 AMD 的软件组合性、旧 GPU 集群和数据集缺口仍是扩展风险。
查看访谈对话精读提要
InferenceX 2.0的头号结果是:在低交互性场景下,GB200/GB300单GPU的DeepSeek-R1吞吐量达到完全调优H100的20倍;在100 tokens/sec/user下则达到80–100倍,而H100基本无法提供这一速度。 关键机制在于NVLink域:DeepSeek的256个专家分散在“72块GPU组成的一台机器”上,而不是跨InfiniBand通信;Cam Quilici称这直接“碾压”其他方案(“frame mogs”)。Jordan Nanos强调,100 tok/s是实际生产需求——Cerebras上的Codex Spark等“快速”层级已经超过这一速度,而标准模型约为40 tok/s。
软件的复合增速不亚于硬件:AMD的MI355多节点DeepSeek方案,在约1个月的ROCm优化后,于20 tok/s交互性下,单GPU吞吐量大致从约1,000提升至约3,000 tokens/sec,接近翻了3倍。 Cam对现有基准测试的核心批评是“刷榜”——只截取某个时间点、Pareto前沿上的某个位置,每3到6个月提交一次结果,而且供应商可以撤下落败成绩。InferenceX每晚运行一次,结果“一旦上线,就不会被撤下”。
多token预测基本是“免费优化”:开启MTP后,B300通过Dynamo + TensorRT以68 tok/s/user提供DeepSeek服务,单百万tokens成本从25美分降至5.7美分——成本下降约80%,GSM-8K准确率没有损失。 DeepSeek普及了预训练MTP头,如今“基本人人都在用”,包括GLM-5和Qwen 3.5;它现在确实已经进入生产环境。
如果看TCO而不是原始吞吐量,MI355反超B200:两者在FP8 SGLang吞吐量上“实际上完全相当”,但MI355约50美分的价格差使其每百万tokens便宜约20美分——大约25%的优势,在“利润率本就很薄”时意义重大。 但AMD的问题在于软件可组合性:FP8单节点能与B200匹敌,FP4则明显更差,再叠加解耦和MTP后性能进一步恶化——说明单独有效的开关,组合起来未必有效。
Doug O’Laughlin从经济学角度得出的结论是,推理利润率偏乐观:当前基准使用随机单轮数据,完全没有前缀缓存,因此“这已经是最差情况——接下来只会变得更好”。 随着MTP、多轮缓存等优化叠加,价格可能下降约50%;相较SemiAnalysis最初的tokenomics估算,他现在认为Max“可能没有你想象得那么不赚钱”。Jordan的制约因素是:前沿模型可能比DeepSeek更大,而且这些收益只适用于最新GPU,不适用于仍在承担推理任务的大量老旧GPU集群。
路线图包括:V3/V4覆盖Trainium和TPU,并计划为DeepSeek V4提供day-zero支持;团队目前正争取为Qwen 3.5、Minimax和Kimi 2.5提供day-zero支持。 他们还计划针对多模态智能体工作负载实现EPD(encoder-prefill-decode)解耦,并推出真实世界多轮前缀缓存基准。当前瓶颈是,公开可用的智能体/多模态数据集基本不存在——最好的现成数据是WildChat,但“已经3年历史了……都是让GPT当心理治疗师的人”——因此团队计划自行生成轨迹。
整个AI交易的尾声,是Cam给出的一个坦诚对冲:他承认自己“有过一个转瞬即逝的念头——如果模型就这样不再变强了怎么办?” 那又怎样?“那我们就完蛋了,老兄。”他的答案正是InferenceX本身所记录的主线:即便“模型不再变聪明”,它们仍在“变得更便宜、更快、性能更强”,因此扩散仍会继续扩大。Cam结合自己使用Codex 5.3的体验——“处理针对性问题更好”,而Opus 4.6“更适合泛化的整体感觉”——Doug也表示认同,认为这说明他们会根据证据更新判断。
🔗 原始收听与视频来源: 第002期——InferenceX 2.0发布(技术团队)| Cam Quilici、Bryan Shan、Doug O’Laughlin、Jordan Nanos
第001期 - Claude Code、内存狂热、CPU回来了 | Jordan Nanos、Doug O’Laughlin、Myron Xie
- 🗓️ 日期:
2026-02-13| 🎙️ 节目:SemiAnalysis
GPU需求激增之际,HBM正分流传统DRAM晶圆,推动内存和NVMe价格环比上涨约100%,紧张局面预计至少持续数年。Claude Code已生成约4.7–4.8%的公开GitHub提交,而Opus Fast与Cerebras版Codex显示用户可能愿为速度支付高得多的价格。
查看访谈对话精读提要
内存周期已从1996年以来最糟糕的下行——当年“让行业三分之一破产”——剧烈反转为历史性短缺,短期内几乎看不到缓解。 Myron Xie解释了其中的机制:HBM每片晶圆产出的比特数只有传统DRAM的几分之一;每增加一颗GPU/XPU,都会把更多晶圆拉向HBM;而后疫情时代几乎没有新增晶圆投片或洁净室空间——“需求正在爆发,但我们几乎没有增加任何供给”。Doug O’Laughlin:内存和NVMe价格单日上涨约20%,环比上涨约100%,而且“至少还会紧张几年”。
经典的周期见顶信号——Samsung最后投降、最后增加产能——这次可能失灵。 Doug表示:“我认为他们会扩产,但仍然不够。供需缺口是有史以来最大的,而且根据我们看到的情况还在扩大。”他的“银河系大脑式判断”是:EUV瓶颈可能把原本预计约2035年出现的3D DRAM提前到约2030年,但不会早于2030年。
CPU回来了,甚至 Intel 仍然——或者大概率将会——售罄,“这说明供给很紧”。 讨论把 Intel 定位为边际供应商;Arm“构成了前所未有的更大威胁”,而 AMD“仍在持续碾压”。Phoenix CPUs尤其值得关注,因为它可能改变 Arm 商业模式的适应方式。
据 Doug 抓取的每日序列,Claude Code如今生成了公开 GitHub 提交的约4.7–4.8%;Anthropic还在其300亿美元融资、3800亿美元估值的新闻稿中,链接了包含这一估算的文章。 这一占比从1月20日的约2%升至2月5日的约4%,目前仍在增长;Doug是在一条推文提醒他 Claude Code 会签署自己的提交后,才搭建了这套追踪器。
Opus Fast 和运行于 Cerebras 的 OpenAI GPT-5.3-Codex-Spark,是定价在每年2400美元 Max 级别之上的价格弹性实验——“鱼子酱交易”。 Opus Fast按token收费约为6倍,速度约为2–2.5倍;Jordan Nanos形容 Cerebras 这笔交易是“花10倍的钱换4倍性能,或者更准确地说,花20倍的钱换10倍性能,差不多就是这样”。Jordan说 Fast 模式已经对他产生了效果:“现在我已经对 Fast tokens 上瘾了……我觉得自己回不去了。”
中国模型周带来了真正的突破:MiniMax 2.5“达到 Opus 性能……价格只有1/10”、GLM-5,以及最重要的 ByteDance Seedance/CDance 2 视频模型——“动画搞定了,熟透了”。 Doug称这是首次“彻底击败”Google Veo/Genie长期领先的视频模型,并提出一个阴谋论:“监控国家让所有人都拥有更好的训练数据”——中国监控占全部硬盘需求的10%。
Jordan的存储判断是:日志、合成数据和生成视频将推动SSD/HDD需求爆发,而不是KV cache卸载;后者在生成视频中的留存比例可能“低于1%”。 他还警告,不要直接套用 Jensen 每颗GPU配16TB存储的估算;按此计算,ICMS只占硬盘出货量的不到0.7%——“这是对 ICMS 的正确结论,但不是对硬盘需求增长的正确结论。”
🔗 原始收听与视频来源: 第001期 - Claude Code、内存狂热、CPU回来了 | Jordan Nanos、Doug O’Laughlin、Myron Xie