E246|何谓蒸馏?聊聊硅谷如何看中国开放模型逼近前沿
E246|何谓蒸馏?聊聊硅谷如何看中国开放模型逼近前沿
摘要
- 开源已经追平最强闭源。 铁震复盘:DeepSeek V1 之后一年其实是"狼来了的故事"——闭源月更、开源季更,Opus 4.6、4.7、4.8 远远领先;转折先是一款名称存疑的 GM 5.2 模型(他已用它"完全取代了 Opus 4.8 的一些功能"),再是 Kimi K3——“不是跟 Opus 评级的问题,它基本上已经追上了 Fable,甚至在某些场景上要比 Fable 做的还好”。“闭源模型瞬间就发现自己没有一个护城河了”,而 MiniMax、千问的 2-3T 模型和智谱还在路上。
- 蒸馏指控技术上站不住。 闭源模型不暴露 logits 也不暴露思维链,经典蒸馏根本做不到;Fable 5 七月初上线、K3 十五天后发布,“连模型发布的准备都来不及,何谈收集到足够多的语料”。Kis 把主张拆成三层:违反服务条款、系统化 API 抓取、窃取权重——证据倾向"可能存在未授权的大规模数据抓取",但不等于核心能力来自蒸馏;蒸馏只能到及格线,“K3 已经远远超过及格线”,只盯蒸馏是"只见树木不见森林"。
- 开源便宜是结构性的,不是补贴出来的:闭源 API 内含模型溢价,Fireworks、Together AI 只收硬件加推理服务的钱;K3 比 K2 大一倍多但 scaling efficiency 扩大 2.5 倍(KDA 等 linear attention 技术,“主要都是由华人 researcher 主导”);传言 Fable 本体 8-10T,K3 不到 3T 打出同等效果。 叠加 infra 优化,“未来三年同样的智能成本又下降一千倍”。
- K3 license 是开源货币化的新模板:Model-as-a-Service 厂商十二个月收入超两千万美元须与月之暗面另签协议,配 Vendor Verification 认证。 铁震的判断——“赚钱的开源模型才是好的开源模型”(Stability 之死为鉴),且云厂应欢迎交钱换官方认证;若走通"这就是无本万利,你只要把模型做好,大家都直接给你上供"。Kis 提醒执行端"有很多很多的灰色地带"。
- 闭源估值体系承压,恰逢 IPO 之年。" 今年 OpenAI 和 Anthropic 都要上市"——垄断智能曾"比垄断任何商品威力要恐怖的多"、天然值万亿市值,但智能变成流通商品后,margin、scaling law 无限投钱的故事"这个饼就没有那么容易画得圆"。价格战苗头已现:neocloud 拿开源模型互相卷价,ChatGPT 开始发券,Anthropic 封号"没有那么疯狂"了,“最后都会反映到他们的财报上”。
- 阵营已按商业结构分裂:七月二十四日《开放权重和美国AI领导力》公开信从 25 家发酵到约 75 家,是黄仁勋加入 X 后第一条推文,Anthropic 拒签、Dario 另发文。 卖铲子的(NVIDIA,CUDA 护城河本就是开源生态筑成)、有分发的(Meta、阿里)都能拥抱开源,纯卖 API 的 OpenAI、Anthropic 利益"完全不会对齐"。Agent 应用层同步遭挤压——VC 朋友的反直觉标准:“估值越高,我们反而会越愿意投”。
- 安全叙事被反转:K3 在网络攻防测试 Exploit Bench 只得百分之三十几(frontier models 在 75 以上);Hugging Face 被 OpenAI 测试智能体攻击后,闭源模型拒绝帮它分析攻击语料,只有开源模型可用——“为什么我们能够让他们又做运动员又做裁判?” 监管应过滤训练语料而非用户行为,而闭源随时可被政策断供,“不管怎么看,没有开源反而是这个时代最不安全的事情”。
精读
1. K3 震动硅谷:狼来了的故事终于成真
- Kis 把时间轴拉开:年初人人喊着赶快上 AI,很快 Uber 等公司开始晒账单——“一个月花了一年的预算”;随后智谱 Z.ai 与中国模型引发新讨论(包括 Cursor 用了中国模型),而 K3 作为开源模型达到了"在很多人看来很新的一个高度",讨论已从要不要用,变成"在使用的情况下具体应该怎么样的做调整"。
- 铁震的复盘更冷峻:DeepSeek V1 曾让纳斯达克大跌、全行业反思,“结果过了一年,大家发现是一个狼来了的故事”——闭源月更、开源季更,Opus 4.6、4.7、4.8 远远领先;一款名称存疑的 GM 5.2 模型出来时他已重度使用、取代了 Opus 4.8 的部分功能,但市场不慌:“只要闭源领先超过一个时代,那没有太多可以担心的。”
- 直到 K3:“它不是跟 Opus 评级的问题,基本上已经追上了 Fable,甚至在某些场景上要比 Fable 做的还好”——“闭源模型瞬间就发现自己没有一个护城河了”,AI 估值泡沫、生态运转模式全被重新提问。
- 由此引爆两个争议:接近 Fable 能力的模型开放权重安不安全;以及"你一定是在蒸馏我的模型"——毕竟 Fable 5 与 K3 只隔约十五天。后面还有 MiniMax、千问的 2T-3T 模型和智谱的动作,“这个行业变化非常快”。
2. Coding 引爆账单:从 token maxing 到 token optimization
- Kis 的成本观察:cost 只有上了很大量才显著,而引爆点是 coding——去年九月前后 Anthropic 大规模推动后,RAG 时代的 token 消耗完全无法与之相比。TinyFish “才五十多个人,一个月整个消费大概是六位数左右的美金”,而全行业从"赶快去用"到"花了太多钱了"的转向"几乎就是在一个月之内发生的"——“整个 AI 行业有点像是天上一日,人间一年。”
- 且问题不止成本,还有所有权:“突然有一天美国商务部说这个不可以用了,那就一夜之间都不可以用了,之前做的部署可能什么都没有了。“埃森哲的内部调研是另一记清醒剂:员工用模型做得最多的事是生成 PDF——“这个东西你不需要用最新模型去做的。”
3. 开源推理便宜是结构性的
- 铁震拆出三个原因。其一,闭源 API 定价里含着为模型本身付的 premium;而 Fireworks、Together AI 只有硬件成本加推理服务利润,“并没有为模型额外的付钱”。其二,中国开源一直在卷 scaling efficiency:K3 技术报告显示,模型比 K2 大了一倍还多,scaling efficiency 反而扩大了 2.5 倍,靠 KDA 等架构演进实现"更大且更 efficient”。
- linear attention(KDA、RWKV 等)这个"目前最火的能让大模型更便宜的技术领域,主要都是由华人 researcher 主导的”——“因为他出生在一个算力受限的国家,天然第一天就很关注训练和推理是不是都可以变得非常高效。”
- 其三是尺寸:网传 Fable 本体 8 到 10T,K3 不到 3T——“三 T 的模型可以跟十 T 左右的模型达到同样的效果”,推理成本天差地别。但架构演进带来大量工程适配的苦活,“还是要给中国工程专家们打 call”。
4. 蒸馏科普:一个被用烂的中性词
- 铁震正本清源:技术意义的蒸馏是让小模型学大模型每个 token 的 logits 概率分布;闭源模型只给你采样出的词,“你是没有办法反推回来它的分布的”——经典意义的蒸馏对闭源模型根本做不到。现在大家说的"蒸馏",其实是拿闭源模型生成的文本去训练。
- 而这件事本身"非常 controversial":“闭源模型可以拿所有人类的数据去学习,学完的东西不能被别人用来做下一个模型,这不是很可笑吗?相当于闭源模型练了一个宝典,把所有语料都扔掉,不告诉你在哪学的,也不允许开源模型拿他的输出去训练。“好比读了一本书写了创作,却禁止所有人读——版权法能否保护模型输出,悬而未决。
- 对照之下开源极其开放:R1 发布时直接宣布支持所有人蒸馏,官方放出数据集、开放 logits;Kimi 的 license 也没限制输出被用于竞争模型。
- 至于开源模型自称"我是 Claude”——那是数据污染不是蒸馏:Opus 4.7 拿掉 system prompt 用中文问"你是谁”,“他会说自己是千问”。各模型输出已大量存在于互联网,预训练学出身份错乱,只能靠 system prompt 和微调缓解,“这个问题肯定没有办法完全得到解决”。
5. 为什么 K3 蒸不了 Fable 5
- 时间线不允许:蒸馏是训练过程,经典训练要三个月;Fable 5 七月初(“一号还是二号”)上线,K3 十五天后发布——“你十多天连模型发布的准备都来不及,何谈收集到足够多的语料然后蒸馏。”
- 更根本的是方向不对称:闭源不暴露 logits、不暴露思维链,只给最终结果——“如果说我们看到一个人做事情的结果,就能学会他内心怎么想的话,那我们人类社会互相学习也太容易了。“反过来"闭源模型蒸馏开源模型是非常非常容易的”,因为开源把一切都暴露了。
6. 指控背后:商业战略与"自我强化的预言”
- 铁震判断,抛出蒸馏概念的"不见得是技术圈的人",更多是商业目的、给市场"预先的植入"——开源没那么好,都是蒸出来的。而闭源厂借蒸馏之名关掉几万个账号,“本质上就说明他们实际上在看所有用户的数据”。
- 他的比方值得记住:“整个这个事情有点像是国家安全的自我强化的预言——你总要有一个靶子照着打,说不定能搂草打兔子。”
- Kis 把混在一起的主张拆成三层:违反模型服务条款、规模化系统化调用对方 API 提取训练信号、直接窃取权重和商业机密。证据多围绕前两层(大规模自动化请求可被检测系统抓到);而"K3 靠蒸馏 Fable 5 拿到的"这类指控"证据非常薄弱"。他的结论:“可能会存在一些没有授权的大规模数据抓取行为,但并不代表能得出 Kimi 三的核心能力来自于蒸馏,尤其是蒸馏 Fable——这两个是不同的事情。”
7. 蒸馏够到及格线,够不到上限
- 铁震纠正两个误解:蒸馏是标准技术,“所有的公司,包括 OpenAI 啊、Google 啊,大家其实都在用大模型蒸馏各种小模型”;而把模型能力完全归结于蒸馏更是错的——“如果这么简单的话,那所有人就随便就训练出来一个模型了”,强化学习、数据工程、架构创新才是复杂问题所在。
- 蒸馏能省算力、省数据标注、加快迭代,但对齐仍是很大的挑战,“可以让你很快的去达到一个及格线,而 Kimi 三其实已经远远超过及格线了”——“从本质上它无法实现超越或者是达到一个上限。”
- 铁震补刀:中国开源的成功"可能有十个理由"——模型架构、infra、中文数据等等;美国前沿 lab 若只关注蒸馏一点,“有点只见树木不见森林,可能会完全忽略掉中国模型在其他方面的先进性”。
8. K3 license:赚钱的开源模型才是好的开源模型
- 条款本身:卖模型的公司(Model as a Service)及其关联方连续十二个月总收入超过两千万美元,将 K3 及衍生模型用于商业服务前须与月之暗面另签协议;嵌入具体产品的终端应用、内部使用、月之暗面官方产品与合作伙伴不在此列。
- 铁震的第一性判断:“赚钱的开源模型才是好的开源模型”——文生图翘楚 Stable Diffusion 因 Stability 赚不到钱"渐渐销声匿迹";千问开源做得好但商业化不行。“能够赚钱的开源模型才是可持续的开源模型,才能让我们一直享受下一代。”
- 先例上,Llama(音)的 license 也有类似限制但执行模糊,Kimi 把可操作性写清楚"是一个 license 法律或商务层面的进步",精神上延续开源软件时代防云厂 free-ride 的传统——MongoDB、Elastic 当年的双 license 设计,都是对着白嫖的云巨头去的。
9. 反常识:云厂应该欢迎 Kimi 来收钱
- 铁震的"反常识观点":交钱等于官方认证——Kimi 有一套 Vendor Verification 流程,过了才能证明"你卖出来的 token 是好的 token"(准确性、性能有保障);连认证都没过,“大家可能也不愿意去采买你的 token”。
- 更深一层,推理厂和云厂"整个 business 都建立在能拿到不限量的开源模型上",最怕开源断供:“如果有一天大家都不开源了,那些拿了很多融资专门做推理的厂,它的整个 business logic 就不成立了。“给模型厂分成是给自己续命。
- Kis 直言执行是最难的:两千万美金营收靠自觉申报,AI native 公司"你也不知道它赚多少钱”,跨境执法怎么办——“有很多很多的灰色地带。”
- 铁震仍有信心收得上来:跑 3T 模型要几百几千张 NVIDIA 卡、要品牌背书,API 售卖大多公开,“大的量你是藏不住的”。若这条路走通,“这就是无本万利——你只要把模型做好,大家都直接给你上供,你连自己买卡都不太需要,尤其中国企业买卡还面临挑战。个人情感上我也希望 Kimi 这条路径能够走通。”
10. 闭源估值体系承压:IPO 之年撞上智能平民化
- 第一波冲击落在估值:“今年 OpenAI 和 Anthropic 都要上市。“开源追平之前,闭源模型被视为稀缺、可垄断的资产——铁震引一个段子:骇客松中途 ChatGPT 服务器断线,全场停工,“大家的智能被断供了”。“垄断智能比垄断任何商品威力要恐怖的多的多的多,所以它天然就值得万亿的市值。”
- 但当"非常聪明的模型变成了一个流通的商品,甚至被平民化,变成社会的基础服务”,问题就变成:还有多少企业愿意在开源遍地开花时付钱买闭源?margin 能做到什么样?scaling law 还能无限投钱吗?“这个饼就没有那么容易画得圆。”
- 价格战苗头已现:neocloud 天然有开源模型可卖,互相卷价、甚至用资本开支摊薄 token 成本;曾经"很高傲、说封你号就封你号"的 ChatGPT 开始"国内外卖送券"发重置券,Anthropic 封号也"没有那么疯狂"了——“最后都会反映到他们的财报上面。“这也解释了他们为何想在法律和市场层面给开源设障。
11. 公开信与三种阵营
- 背景事件:七月二十四日《开放权重和美国AI领导力》公开信,25 家公司机构起签、数日发酵至约 75 家;这是黄仁勋加入 X 后发的第一篇推文;Anthropic 始终未签,Dario Amodei 当天另发文章解释立场。
- Kis 的结构图:开源与纯 API 闭源的商业逻辑"从根本上就是对立的”。卖铲子的 NVIDIA “肯定是每个人都能自由搭建一个最好——他并不在乎谁能挖到金子”;有分发和基础设施的另当别论——阿里靠云服务变现开源,Meta 靠 app 矩阵(他注意到 WhatsApp 刚新增"二九九一个月"的收费版);而 OpenAI、Anthropic 两头都没有,利益"完全不会对齐”。
- 铁震补充 NVIDIA 的开源基因:CUDA 护城河"相当一部分实际上都是围绕在 CUDA 周围的这些开源生态造成的”——从贾扬清(音)的 Caffe 到 TensorFlow、PyTorch 全搭在 NVIDIA 硬件上;AMD 想进场得一家家谈集成。上游下游越丰富、同层竞争者越少,卖铲人越舒服。
12. “Anthropic 有点走向邪路"与开源思想实验
- 铁震的用户怨气很具体:Fable 一旦触发敏感检测器"有可能会瞬间给你降至到 Opus 4.8”,非 Anthropic 员工根本无法测试 Fable 的极限能力,连简单推理都可能被 filter 拦下。模型安全团队有几百人,但"至少现在的产品形态对用户造成的烦恼是远远多于潜在的安全考量的——一个让用户如此不爽的公司,突然发现大家都想支持开源,也不是一个非常难以预料的事情。”
- 主持人抛出思想实验:Kimi K1 本来就是闭源的,开源是为了分发和名声——如果 Kimi 有 OpenAI 的分发能力和 API 收入,还会开源吗?铁震先坦白"呃,我不知道",再给出 Linux 类比:从反抗闭源 Unix 起家,如今几乎所有设备都在跑 Linux,它依旧开源——“只要找到开源生态可以持续运转并且能赚大钱的商业模式,那没有理由他们不开源。”
- Kis 补一层现实主义:这件事"某种程度上也不一定受实验室自己控制了,因为它已经从商业竞争开始变成了一种地缘政治的博弈——在这个框架下,business logic 其实变得是第二级了"。
13. Thinking Machines 与"智能应该被拥有"
- Thinking Machines 在 K3 发布前一周放出开放权重模型(参考了 DeepSeek 架构;可能是 Mira Murati,来自 OpenAI)。铁震的解读:为了让 Tinker 后训练服务用得起来,基础模型结构必须开放,“从这个角度是非常合理的”;同时美国学界也在反思——开源鼻祖本是 Llama,“从 DeepSeek 出现之后,美国参与开源的比例大幅下降”。“开源界最担心的就是没有人发模型、变成一潭死水……不管这些开源模型是哪个国家的。”
- 铁震强调打法完全不同:Thinking Machines 帮企业微调、deploy 自己的模型,吃的是美国庞大的 To B 生意;背后是企业心态转变——“intelligence should be owned,而不应该是 rent。”
- 落地端的实话:除政府等敏感 vertical,“大多数的美国公司并不是非常在乎这个模型是不是中国的”,在乎的是有没有能力调教自己的模型。市场"极其混乱又不透明",于是中间商繁荣:Cognition 不被广大开发者使用照样赚很多钱,OpenAI、Anthropic 都设了专门的 deployment 部门,而 OpenRouter 们估值 ARR 翻倍增长,“核心利用了中国为主的开源模型这一大批”。
14. Agent 生态:应用层危险,infra 还有千倍空间
- Kis 转述 VC 朋友的反直觉筛选:“这个估值越高,我们反而会越愿意投——估值很低的 agent 我反而可能不愿意投了,因为你这一层很容易就会被吃掉。“harness、vertical 工程调优正在成为新护城河,但"这个模型很快就可以吃进去”;放到五年尺度,“我并不是很认为说以后会有很多的 agent application 的 companies 了”——反而当智能变成水和电一样的 commodity,agent infra 的逻辑要重新想。
- 铁震看到的 infra 机会:agent workload 与传统推理不同——超长输入、很短输出、KV cache 重用率极高;控制住 harness 层(如可能是 Claude Code)就能"完全掌控 KV Cache 的生存周期”,降本提效空间巨大。
- 成本展望是全场最硬的数字:单位智能的美元成本"过去几年可能下降了一千倍",硬件还能抠十倍、下一代硬件或 ASIC 再十倍、软件层再十倍——“未来的三年同样的智能成本又下降了一千倍。AI 应该是一个服务型行业,支撑实体的发展,而不是一个抽血机。”
15. K3 开源安全吗:数据不支持恐慌
- Kis 先摆数据:K3 在网络攻防测试 Exploit Bench 得分"百分之三十几,远远低于整个 frontier models 七十五以上"——可能是能力所限,也可能是"没有把最强的攻击性网络能力开放出来"。“Kimi 三本身,目前没有看到任何可证据的已知的安全问题。“而所谓不安全是相对于为人设计的上一代互联网架构而言——“这个判断为什么要交给一家商业公司来做决定?”
- 铁震的案例最有画面感:Hugging Face 被 OpenAI 一个测试智能体攻击——“这个智能体足够聪明,他说我直接去抄答案比我自己去摸索要好得多,要不我就顺便把别人的网站给黑了。“HF 想用闭源模型分析攻击过程,闭源模型回答"你做的这个事儿好像挺不安全的,我不能帮你分析网络安全的语料”——最后只能靠开源模型协助溯源。“我觉得这个才是一个真正的技术平权。”
- 由此引出核心质问:“为什么我们能够让他们又做运动员又做裁判?一方面他可以评价别人做的事情安不安全,另一方面他可以自己有意或者无意的放自己的 agent 出去攻击别人。“Kis 甚至联想到 AI 短剧里的伞公司——打着治愈人类一切疾病的旗号设计病毒:“我没有办法相信某一两家公司对自己的监管是足够到位的。”
16. 监管该管什么:“没有开源反而是这个时代最不安全的事情”
- 铁震的政策主张:智能与攻击能力"有一定的相关性,但绝对不是决定性的”——“你可以有一个人像爱因斯坦一样聪明,但是爱因斯坦不知道怎么去黑 NASA 的网站;一个十八岁的高中生,可能就有能力。“监管更应审查训练语料、把生物安全和网络攻击语料删掉,而不是过滤用户行为。
- 铁震补上闭源的反向风险:日本某最大公司之一的 number two 私下说,Fable 被禁用的冲击不在禁用本身,“而是对大家来说,原来这个东西是不安全的”——部署完随时可能因新政策封号、服务变更;开源"说白了就是你把整个东西都下载到你自己的硬盘上”,没有这个风险。
- 作恶的成本算术也反着来:想用 K3 干坏事得先搞两台 B300 机器,“一年光租金就有上百万”,还要补齐与闭源的能力差距——“比他直接用闭源模型然后尝试去攻破那个 filter 要难得多。“后门疑虑同样反向成立:闭源"连这个模型在什么时候会输出什么样的东西都完全不了解”,沙箱里严格控制输入输出的开源反而更可控。
- 收尾留了抓手与判断:足够强的开源模型需要复杂推理环境,“谁拥有算力"就是监管的抓手;“现在这个时候去聊开源模型一定是不安全的,还是为时过早”——“不管怎么看,没有开源反而是这个时代最不安全的事情。”