美国主导完整 AI 技术栈的计划:Sriram Krishnan 解读
摘要
DeepSeek 是这届政府的“起跑枪”:Krishnan 表示,即便那些声称训练成本只有几百万美元的标题,排除了消融实验以及最终训练前已经发生的其他成本,美国的 AI 领先优势仍“非常、非常小”。 他仍肯定 DeepSeek 在更弱硬件上完成的 KB caching、MLA 和推理工作,并称 DeepSeek 与 Qwen 是当今最好的开源模型。战略上的含义是,这是一场势均力敌的竞赛,美国的领先并非理所当然。
Krishnan 提议以全栈推理份额作为胜负记分牌:由 NVIDIA/AMD GPU、OpenAI/Grok/Gemini 模型与应用组成的“America Inc.”,应尽可能拿下全球推理量。 他提出统计所有运行在美国硬件和模型上的 token 占比;Google 刚刚披露过“每月或每季度1000万亿个 token”,但他明确表示记不清究竟是哪一个。
算力建设是核心工业挑战:美国电力需求几十年来仅增长1%-2%,如今发电、电网、公用事业、许可和数据中心建设已经纠缠成一团“意大利面”。 应对方式是“建起来,宝贝,建起来”——简化联邦土地审批、减少监管摩擦、推动核电建设,同时补足电工、技术员和国内供应链产能。
开源被定义为战略武器,也是应对中国软实力的答案,而不只是开发者偏好。 Krishnan 认为 SB 1047 可能终结美国的开源模型;Guo 指出,西方公司已经在使用 DeepSeek 和 Qwen;Gil 认为闭源模型 incumbents 可能有动力推动反开源叙事,而 Krishnan 则将监管俘获视为其中一种机制。Krishnan 承认网络和生物安全风险,但表示,如果中国模型出现在“每一台机器人、每一部相机、每一辆汽车、每一台设备”中,后果将是灾难性的。
第三根支柱是出口一体化的美国技术栈,让盟友统一采用美国芯片、模型和应用,从而扭转 Krishnan 所描述的、限制性极强的200页拜登《扩散规则》。 他提到海湾地区的 American AI Acceleration Partnership,并将机器人技术置于未来18-24个月的时间窗口,预计未来6-12个月政策关注度将上升,因为初创公司已经在使用蒸馏版 DeepSeek 和 Qwen。
AI政策同时也是文化政策,因为模型正越来越多地介入历史、事实和日常问题。 “联邦政府不得使用‘觉醒式 AI’”行政令要求采购的模型“追求真相”,且不得带有未披露的人工意识形态偏见;Krishnan 将这项规定与自己 Twitter 时代的看法联系起来:算法可以把经过筛选的输入转化为国家叙事。
执行层面对应大约90项机构行动,以及围绕基础设施、出口和意识形态偏见签署的3项即时行政令,Krishnan 坚称:“没有B计划。” 他拒绝“技术官僚主义”这一标签,表示美国工人仍处于核心位置,同时承认存在一个 AI“事件视界”,越过它之后,合理预测可能失效——因此目标是为多种可能的 AI 未来做好布局,而不是押注单一预测。
精读
1. DeepSeek 打破美国拥有舒适领先优势的幻觉
作为白宫 AI 高级政策顾问和该计划的主要起草人之一,Krishnan 将自己的政策转向追溯到英国围绕 AI 的讨论:他由此得出结论,英国高层官员并不了解开源和初创公司。特朗普总统撤销拜登的 AI 行政令后,几名相关人士获得6个月时间,起草出最终的28页行动计划。
DeepSeek 在他入职白宫前的那个周末出现,随后触发了一场紧急领导层简报:它是否真的更快、更便宜?中国是否只花了几百万美元就训练出了一个前沿模型?Gil 的修正是,新闻标题描述的只是最终一次运行,而不是为达到这一结果可能已经花费的数亿美元;Krishnan 也同意,媒体把论文没有提出的说法强加到了论文头上。
剩下的信号依然强得惊人:DeepSeek 在更弱硬件上完成了新颖的效率优化,在 Krishnan 看来,它与 Qwen 一起领跑开源模型。这使它成为一场竞赛的“起跑枪”;获胜者可以在生产力、药物发现、材料和基础设施领域持续叠加优势,再将这套飞轮效应转化为无人机、自动武器和军事规模。
2. 全球推理份额既是经济记分牌,也是文化记分牌
Krishnan 提出的指标是:全球推理产生的 token 中,有多大比例运行在美国硬件和美国模型上。他将这套产品组合称为“America Inc.”:GPU 层由 NVIDIA 和 AMD 构成,模型层包括 OpenAI、Grok 和 Gemini,之后是广泛的应用生态。
这个规模已经很难准确界定。Google 曾宣布“每月或每季度1000万亿个 token,我忘了是哪一个”;Krishnan 的重点不在分母,而在于尽可能提高美国对全球每月或许达到1000万亿个 token 的份额。
Gil 补充的一点值得保留:模型就像电影和社交媒体一样输出文化,同时也正在成为人们信任的历史和事实来源。对天安门广场相关内容的删减展示了一种失败模式,但他也指出,美国模型内部同样存在政治倾向。
Krishnan 将这种力量与 Twitter 的信息管道作了比较:从精选账号流向趋势、Moments、记者,再变成“网上的人都在讨论这件事”(People on the internet are talking about this)这样的报道。因此,新的《联邦政府不得使用“觉醒式 AI”》行政令要求采购的模型“追求真相”,除非披露其来源,否则不得带有人工意识形态偏见。
3. “建起来,宝贝,建起来”面对的是一个未经增长考验的能源系统
该计划的3根支柱类似科技公司的战略:建设算力基础设施,消除模型和应用创新的障碍,然后让全世界采用美国技术和标准。为数据中心提供联邦土地审批是其中一个直接目标。
对于所需产能和第一处瓶颈,Krishnan 的坦诚回答是:“这很复杂。” 数十年来约1%-2%的电力需求增速,使发电、公用事业和电网都未经过增长压力测试;州层面的激励政策,以及水资源、排放和施工领域相互重叠的规则,则制造了一团“纠缠的意大利面”。
当被问及哪些能源将为这轮建设提供动力时,他拒绝量化能源结构,重新回到许可审批问题上。他特别指出,核电曾受到“气候游说集团和末日论者”的阻挠,同时强调,这轮建设需要国内制造业、建筑工人、电工和技术员,而不只是工程师。
4. 开放权重是战略武器,但风险真实存在且仍有争议
Krishnan 认为,加州 SB 1047“会终结美国的开源”。他更广泛的担忧是,一个州的规则可能成为在那里运营的每家公司事实上的全国性法律,因此 AI 监管应在全国层面处理,而不是形成拼凑式监管。
Gil 将开源视为对抗集中控制的解药:互联网和加密货币都依赖开放协议,而如果把 AI 开发限制在3或4家公司之内,权力就会集中到少数企业手中,随后又可能被政府控制。硅谷的优势在于“任何人,任何一天”都可以开始。
Guo 更直接的战略判断是,开放模型一定会出现,而西方公司已经在使用 DeepSeek 和 Qwen。Gil 补充说,模型内部仍然不透明:今天生成的代码理论上可能包含一个条件触发的载荷,数年后在关键基础设施中激活。
谈到 p(doom) 时,Krishnan 承认有必要监测网络和生物安全风险。Gil 认为,闭源模型公司可能有动力推动反开源叙事;Krishnan 则将监管俘获视为其中一种机制。他以 Linus 定律反驳安全担忧:数千名学生和研究人员反复检验一个500GB的 Hugging Face 模型,可能比一家实验室规模有限的安全团队更容易发现问题。
5. 出口政策和机器人技术将技术栈带入物理世界
Krishnan 认为,200页的拜登《扩散规则》让 GPU 出口变得异常困难,即便面对热情支持美国的盟友也是如此。第三根支柱要扭转这一姿态:通过海湾地区的 American AI Acceleration Partnership 等安排出口美国 GPU,再利用已部署的硬件基础带动美国模型和标准落地。
未来18-24个月,机器人技术将变得“超级关键”,政策关注将在未来6-12个月内明显升温。由于初创公司已经在使用蒸馏版 DeepSeek 和 Qwen,应对方案不仅是培育更强的美国机器人公司,也包括打造有竞争力的美国开源模型,将美国的产品和标准推向机器人、无人机、车辆及其他设备。
6. 政府押注技术素养可以加快执行
Gil 统计称,可能有大约90项机构行动;Krishnan 则指出,已经签署了3项行政令,分别覆盖基础设施、出口和意识形态偏见。他的执行原则非常明确:“去做,去做,去做。没时间浪费。我们正在把它做成。没有B计划。”
这套执行方式据称具备的优势,是政府内部拥有技术理解能力。Krishnan 举例称,David Sacks 会在政策会议上解释推理、高带宽内存,以及从预训练转向后训练的变化;政府官员也能够直接致电产业界联系人。
Guo 以挑衅方式追问,这是否等同于技术官僚主义。Krishnan 否认这一标签,并将美国工人置于计划中心;与此同时,他承认 AI 存在多条合理的时间线,以及一个“事件视界”,越过它之后,关于 AI 可能如何演进的合理讨论或许会失效。无论哪种情景,目标都是保留美国获取科学和生产力收益的能力:“很简单,我们要赢。”