先锋 趋势 方法 投研 作者
20VC对谈Positron联创Sohmers:反数据中心是中国心理战
返回节目精读

20VC对谈Positron联创Sohmers:反数据中心是中国心理战

摘要

  • Sohmers 对硬件的核心判断是:推理正变成内存问题,而训练仍受算力约束。 2014年至2024年,GPU FLOPS 大约提升120倍,内存带宽却只提升17倍;Positron 的基准情景是,把原本需要500 MW NVIDIA 设备的工作负载压缩到100 MW。运营商仍会把设施功率吃满,因为效率提升意味着“每焦耳产生更多 token、更多智能”,而不是需求下降。

  • 缓存 token 是模型供应商隐藏的利润引擎。 Sohmers 估算,处理缓存 token 的成本约为重新计算的千分之一,因此读取缓存是一个“利润高得离谱”的产品,这也解释了 Anthropic 据报达到80个百分点的 API 毛利率。他认为,OpenAI 和 Anthropic 如果停止训练,可能“一夜之间变得极其赚钱”;真正烧钱的是前沿模型投入,而非推理经济学。

  • 西方单方面放缓只会集中 AI 权力,却未必能可靠地拖慢中国。 Sohmers 把限制谁可以进行矩阵乘法称为现代版“通往农奴制之路”:大部分 token 可能来自大型供应商,但限制底层能力会把它们变成“新的领主和国王”。Harry 的反驳击中了要害——“除非全球 AI 社区一起放缓,否则你不可能让前沿发展慢下来”;Sohmers 也同意,出口管制无法永久保持领先。

  • Sohmers 认为,反数据中心政治几乎完全是“中国心理战”,因为虚假的资源指控可能削弱西方建设能力,而中国仍在持续扩张。 他称,一家 In-N-Out 的用水量超过美国最大的数据中心,并提到闭环冷却;同时他认为,新设施会配套建设足以覆盖自身、甚至有余量的发电能力。他指出,真正的约束是审批、电网结构和经济性,而不是土地绝对不足或发电技术不存在。

  • 大多数规划中的超大规模算力容量最终仍会建成,但被否决的项目会换司法辖区。 美国仍拥有大片偏远联邦土地,具备地热、太阳能以及潜在核能资源;因此,Sohmers 并不担心出现生存级别的容量短缺。Pantala 等海上抽水蓄能设施,以及更长期的太空数据中心,也提供了额外选项——不过他承认,在当前阶段,地面建设仍更便宜、更容易。

  • 小模型和端侧模型可能增加,而不是蚕食前沿模型需求。 Sohmers 估计,目前约80-85%的 token 来自前4家模型公司,最终或许只有5%会在本地运行;持续读取邮件、日历和消息的本地 agent,可以自主把复杂任务升级给云端模型。“真正的瓶颈其实是人做出某种决策”,因此,可信的本地编排可能释放数量级更多的前沿模型 token。

  • KV 缓存具有经济上的必要性,因为高价值 agent 工作负载几乎都是重复性的,但它也把推理变成了存储管理问题。 据称,SemiAnalysis 的 Agent X 追踪数据显示,约96%的 token 都是缓存 token;与此同时,量化后的1.8万亿参数 GPT-4 大约占用900 GB,假设中的10万亿参数 Claude Fable 约占5 TB,单个长上下文用户会话可能接近100 GB。用户数达到50人时,上下文占用的空间就可能超过模型本身。

  • Token 价格下跌掩盖了智能经济价值上升的速度。 Harry 引用的指数在5年内从每百万 token 60美元降至不足1美元,但 Sohmers 估算,如今的 token 可能有高达100倍的实用价值,单位智能的价值则接近提升1,000倍。他称 GPT-6 Astra 已达到 AGI,理由是它能把原本需要2-3周的芯片设计任务压缩到大约50小时;未来的前沿 agent 因此可能以年薪100万美元的虚拟员工形式出售,而不再单纯按 token 计费。

精读

1. 推理将 AI 的瓶颈从算术运算推向内存

  • Positron 覆盖芯片、底层软件、完整系统以及面向生成式 AI 推理的机架级部署。Harry 介绍称,公司刚以50亿美元估值完成8.75亿美元 C 轮融资。

  • Sohmers 的区分是因果层面的:训练已经有了现成语料,因此输入可以高度并行化,“用大量算力直接碾过去”。推理则必须自回归地逐个生成 token,不可能提前知道第5个词是什么,并且每输出一个 token,都要重新读取模型权重。

  • 内存墙早于生成式 AI 就已存在。Sohmers 称,2014年至2024年间,NVIDIA 单颗 GPU 的 FLOPS 大约提升120倍,但内存带宽只提升17倍,导致所有受内存限制的工作负载越来越落后于可用算力。

  • SRAM 单元的缩小速度远慢于通用晶体管的集成,而 AlexNet、ResNet 等架构曾奖励更多算力。Transformer 改变了激励机制,但 Sohmers 认为,直到 GPT-3 扩展到1750亿参数、ChatGPT 于2022年末出现后,市场才真正意识到这一变化。

2. 缓存经济学解释了 API 供应商的利润率

  • Sohmers 一个被低估的 token 经济学判断是:“你卖缓存输入和输出 token,赚走了所有的钱。”供应商先收取建立缓存的费用,再以更低价格提供读取服务,而读取的实际处理成本可能只有新计算的千分之一左右。

  • Anthropic 据报达到80个百分点的 API 毛利率并不让他意外,不过他也说:“无论哪个行业,能做到80个百分点的利润率都让我印象深刻。”竞争最终应会压低这一水平;即使这意味着 Positron 的客户留存利润减少,他仍欢迎这种变化,因为它对整个生态更健康。

  • 在 Sohmers 看来,OpenAI 和 Anthropic 结构性亏损的流行说法“荒谬至极”:只要停止前沿训练,两家公司就可能“一夜之间变得极其赚钱”。Harry 指出,放缓发展会削减它们最大的成本;Sohmers 打趣称,这对“IPO 之前”或许很有用,但明确表示他不认为这是真实意图。

3. 放缓前沿发展可能通向技术农奴制

  • Sohmers 严肃看待安全问题——他希望人类“活着走向群星,再走得更远”——但他更相信 AI 的正面潜力。暂停发展可能反过来证明更广泛的卢德主义主张合理,即彻底阻止这项技术,而不是有针对性地降低灾难性风险。

  • 他个人最担心的“P doom”是能力集中。如果只有少数公司或政府可以合法部署先进计算能力,这些机构就会变成“新的领主和国王,其他所有人重新沦为农奴”;监管矩阵乘法,等于从根基上攻击古典自由主义所强调的自由。

  • Harry 的犬儒式解读是,既有企业可以借此获得战略掩护:合规负担会压制 Meta,放缓发展能改善 IPO 经济性,也会给 Elon Musk 追赶的时间。Sohmers 基本同意这一判断,但 Dario Amodei 和 Anthropic 除外;他认为,两者是真心相信 AI 的潜力,也真心相信 AI 存在风险。

  • Sohmers 更尖锐的警告是,主动邀请监管的高管默认自己会继续掌权。Dario 可能以为自己会成为监管者,但最终也可能发现,“它最后只会变成一个让所有进展停滞的官僚体系”,现有能力被官员接管并浪费掉。

4. 西方暂停无法约束中国

  • Harry 的核心反对意见——“除非全球 AI 社区一起放缓,否则你不可能让前沿发展慢下来”——立即得到 Sohmers 的认同。他认为,西方领导人高估了自身领先优势的持久性,就像军队可能仍在围绕“上一场战争”优化,而廉价无人机已经重塑了冲突形态。

  • 一个由 CCP 控制的超级智能,同样可能在国内强加 Sohmers 所担心的技术农奴制,只是对部分人而言后果会更糟。中国当前受益于开放技术扩散,但 Sohmers 预计,“一旦他们站上第一位,梯子就会被收走”。

  • 他不相信 CCP 会允许大约10亿名非党员中国人平等受益。当前的开源策略,因此不能被误认为是对广泛分布能力的长期承诺。

  • Sohmers 支持自由贸易和开放交流,但对享受自由体系好处、同时自身仍然封闭的极权政体例外处理。在他的框架下,出口能强化这些政体的能力,并不属于互惠的自由贸易。

5. 反数据中心政治可能转移产能,而不是消灭产能

  • Sohmers 称,左右两派共同反对数据中心“几乎完全是中国心理战”。Harry 给出了最有力的反例:社区居民看到的是更高的电费和水费,以及“建在自家后院、很难看的数据中心”,即便这些设施也会带动地区经济。

  • 在审美问题上,Sohmers 建议把最大型的数据中心打造为公共纪念碑——未来世代应当把它们视为技术时代的“Great Pyramids”。在资源问题上,他称许多说法“明显不实”:一家 In-N-Out 据称比美国最大的数据中心用水更多,而高尔夫球场的用水量则高出几个数量级。

  • 与此同时,中国正在增加吉瓦级发电能力、建设巨型设施,还可以推平民宅或实施轮流停电。Sohmers 珍视西方允许公众反对的自由,但认为,当公共批评建立在错误信息之上,而中国可以强行推进建设时,西方就处于战略劣势。

  • Harry 认为,欧洲几乎连“一架纸飞机”都批不下来,美国也正朝同一方向发展。Sohmers 的反驳依据是地理条件:他承认不知道确切数字,但估计超过90%的联邦土地是西部无人沙漠,其中包括适合建设地热、太阳能以及潜在核能发电设施的内华达州土地,且远离人口聚集区。

6. 能源无处不在,但资本和市场设计首先构成约束

  • Sohmers 预计,大型供应商规划中的产能大部分都会落地,但不一定建在最初提议的地方。社区可以阻止单个设施,但项目可以迁移;运营商也在加大对当地的教育投入,因为此前低估了政治阻力。尽管近期地面建设仍更便宜、更容易,他表示绝不会押注 Elon 失败,也不排除长期建设太空数据中心。

  • 他对电力市场有一个明确判断:数据中心不能抽走已经分配给居民的电力。他称,新项目会带来覆盖自身消耗“并且有余量”的发电能力,但电网规则可能阻止多余电力接入;现有公用事业公司也会抵制那些可能压低消费者电价的新增供给。

  • Positron 的基准情景,是把原本需要500 MW NVIDIA 设备的工作负载压缩到100 MW。但这不会带来更小的设施:运营商仍会部署能够获得的最大功率,换取“更多 token、每焦耳更多智能”。

  • 从火到核能,跨越几个世纪的所有进步都“受能源约束”。在更近的时间尺度上,Sohmers 认为更紧的约束是经济性:世界愿意承担多少债务来为发电和基础设施融资?他对主权债务的担忧,连接到政府印钞能力,以及市场对美国国债和债券市场风险的感知上升。他并不担心 AI 产业链公司达不到收入目标;谈到企业债务时,他表示,相比美国政府,他更信任 Oracle 的商业模式和执行能力。

7. KV 缓存通过构建庞大内存层级节省算力

  • 1个 token 大约相当于半个至四分之三个英文单词;序列则是 prompt 和生成 token 按顺序累积的结果。早期 Transformer 会反复重新计算此前的 token,而 KV 缓存保存注意力机制中的 key 和 value 矩阵,从而避免重复工作。

  • 这种权衡很有吸引力,因为注意力计算量会随序列长度二次增长,而存储 K 和 V 数据只会线性增长。代价是,每个用户都需要一个独立且不断扩大的缓存,运营方还必须决定每个会话值得占用昂贵内存多长时间。

  • 量化会先把 FP32 压缩为 FP16 或 BF16,再进一步压缩到 FP8 和 FP4。直接把16位转换成4位可以节省75%的空间,但可能让基准测试表现下降20-30%;更先进的共享偏置和乘数方案,可以把每个数值压缩到约4.5比特,同时将损失控制在约1%以内。

  • SemiAnalysis 对 Agent X 编程会话的追踪据称显示,约96%的 token 都是缓存 token。因此,运营方会把活跃会话保留在加速器内存中,把最近会话放入通常大4-10倍的主机内存,再把更早的上下文放到本地或联网 NVMe,最终转移到更慢的存储介质。

8. 边缘智能应带来更多前沿模型消耗

  • Sohmers 仍预计,前沿模型参数规模会从1万亿继续增长到5万亿、10万亿、50万亿甚至100万亿。他承认这“多少有点凭感觉”:之所以称之为 scaling law,是因为人们观察到了能力提升,而不是因为数学上已经证明它会持续改善。

  • 对于 Positron 内部的高价值工作,他会“非常愿意多支付10倍,换取10倍产出”。更小的专有模型在隐私、本地部署和成本方面更合理,但大多数企业没有资源自行推动能力前沿。

  • 他的市场判断高度集中:约80-85%的 token 来自前4家模型公司,另外5-10%来自接下来的3-4家公司。他可以接受本地部署系统最终占到5%,但 Positron 的设计目标仍是高吞吐量市场。

  • 看似来自手机和笔记本的替代,实际上是编排方式的变化。本地模型可以持续监控邮件、日历和消息,自主判断哪些任务需要更聪明的云端模型,从而移除“人发出 prompt”这一瓶颈,并产生远超零星人工调用的前沿模型请求。

9. GPT-6 Astra 通过真实工程工作让 AGI 变得具体

  • Sohmers 说,他使用 GPT-6 Astra 的最初24小时,带来的魔力感与2022年11月使用 GPT-3.5 时一样;当时 ChatGPT 在 NeurIPS 低调发布后,他花了4、5个小时不断输入 prompt。Harry 则反驳说,Astra“感觉和以前差不多”,迫使他拿出具体案例。

  • 在软件开发中,Astra 解决了其他模型反复兜圈却未能解决的难题,找到了 bug 和性能优化点,还识别出 Positron 代码库中此前未被探索的区域。Sohmers 称这是一次阶跃式改进,但还没有达到“令人难以置信”的程度。

  • 计算机操作能力带来的冲击更大:GPT-5.6 基本不可能完成 Blender 动画,而 Astra 可以高保真地完成;他还让 Astra 仅凭2张图片设计自己的家居内饰。正是这种广度,让 Sohmers 直截了当地说:“GPT-6 Astra,我确实认为它就是 AGI。”

  • Positron 的决定性测试,是让 Astra 从规格说明开始,完成一个 Kecak 加密模块的 Verilog 编写,以及使用 TSMC N3 PDKs 的完整 RTL-to-GDS 流程。Astra 在略超过50小时内实现了1 GHz 以上的时序目标,把 Sohmers 估计一名刚接手的工程师需要2-3周完成的工作压缩了下来。

10. 上下文质量和智能价值比标价更重要

  • Positron 下一代产品的目标,是提供 NVIDIA 最高内存 SKU 的8倍内存。但要把传统注意力机制从100万 token 扩展到1,000万 token,仍然“非常、非常难”;有用的 agent 需要足够上下文覆盖整个代码库,而不只是增加参数量。

  • 中国实验室通过算法应对硬件约束。DeepSeek V3 的多头潜在注意力机制以增加 FLOPS 为代价缩小 KV 缓存;带门控的 DeltaNet 衍生架构则可以把注意力耗时削减约75%。Sohmers 提醒,“天下没有免费的午餐”,并称——依据传闻以及他所谓的可靠信息和判断——美国主要实验室尚未采用 MLA。

  • 宣传中的上下文长度不等于可用的记忆能力。Sohmers 称,在长上下文“干草堆里找针”测试中,GPT-5.6 找到隐藏值的成功率只有约70%,而 GPT-6 Astra 超过95%,这说明有效上下文仍有很大提升空间。

  • Harry 引用的 token 指数从每百万 token 60美元降至不足1美元,但 Sohmers 称,旧式 token 如今已经一文不值:当前 token 保守估计也有100倍价值,使单位智能的价值可能提升1,000倍。定价模式可能转向按有用结果收费,或采用假设中的年度包价——他随口举例为100万美元——让用户无限使用一名虚拟 agent 员工;更深层的对齐任务,则是围绕监管、能源和经济,让人类激励机制彼此一致。