先锋 趋势 方法 投研 作者
119. Kimi Linear、Minimax M2?和杨松琳考古算法变种史,并预演未来架构改进方案
返回节目精读

119. Kimi Linear、Minimax M2?和杨松琳考古算法变种史,并预演未来架构改进方案

摘要

  • 数据撞墙让算法重新值钱,而中国在架构创新上领先。 杨松琳的判断很直接:“国内算法创新肯定是更强的”,尤其是架构——生态位使然:国内卡少、对 efficiency 要求更高,“硅谷有些公司基本上就是卡太多了,懒得搞”,“反正三驾马车你总得有一辆跑得快一点”。但他也只是凭感觉认为美国对优化器的投入明显更大,国内在跟进,Kimi 是"最早吃 Mew 螃蟹"的。
  • 注意力机制是下一个架构级突破口,中国公司已分头押注:节目开场将近几年架构最大突破归为 DeepSeek 的 MoE;杨松琳则认为 MoE 已成为全球"显学",“Transformer 就两个模块”,FFN 已经雕完,“attention 我觉得大家也是可以来雕一下的,why not”。
  • Kimi Linear/KDA 的核心是细粒度衰减 + 3:1 混合比例。 动因是 DeepSeek R1、Kimi 1.5 后几万 token 长思维链让全平方注意力 decoding “太贵了”;KDA 在他的 Gated DeltaNet 基础上把 Mamba-2 式粗粒度门控换成每维度独立衰减率,在 multi-hop、coding、math 上提升"比较可观"。3:1(线性:全局)已是"不共识的 Hybrid Linear 里面的一个共识"——字节的 from-scratch 实验和 Qwen3-Next 都收敛于此。
  • 纯线性注意力已被判死:“现在共识就是说纯 linear attention 是不 work 的”——RNN 状态恒定,长文本理论上就存不下。 混合架构唯一已知短板是长文本多跳推理,但他认为这个 gap “有可能被直接缩小甚至反超”,“混合线性注意力只是一个开始”。
  • MiniMax M2 退回 full attention 可能是评测不全的代价:M1 的 Lightning Attention “给人的感觉就像是两年前的工作”,当时评测只主要看 MMLU 类指标、没测多跳推理,agent/coding 场景掉点大才退回。 她说"历史螺旋上升",M3 说不定又回混合;最扎的一句——被问是否参与 MiniMax:“如果我参与了,他们应该不会用这个方案,我会觉得这个方案在开倒车。”
  • 终局设想是稀疏与线性融合,不是非此即彼:linear 的真正对手是 sliding window attention(GPT-3 和 OpenAI 的 OSS 开源模型据他说应该都用全局+滑窗),他心中理想架构是"把混合注意力里面的全局的注意力换成 sparse attention"——sparse 管 retrieval、线性省 KV cache。 瓶颈是 sparse “选不准”,这正是 DeepSeek 用蒸馏 indexer 的原因。Transformer 的天花板也在此:“先看看能不能把全局这个注意力把它干掉吧。”
  • 硬件是终审法官:硬件正与 Transformer 协同演化(Tensor Core、Blackwell),FA4 矩阵乘快到 softmax 的 exp 都成了瓶颈;算法必须矩阵乘友好——“你这算法是金子做的还是银子做的,能让硬件公司来天天帮你优化呀?” 硬件亲和上 DeepSeek 对 Kimi 是"Absolutely"级胜出,DSA 的 FP8 indexer 可能是下一代架构的 candidate。
  • 落地瓶颈在 infra 配套,正循环刚启动:半年前他在 MiniMax 圆桌上就说领域瓶颈是"infra 配套没跟上";FLA 的 Triton kernel 只是"凑合用",如今 Qwen3-Next、Kimi Linear 开源正在推动 SGLang 等推理引擎补上 hybrid 支持。 给年轻研究者的话:“做架构必须要算力,没有算力就没法做架构”——先找个 lab 实习。

精读

1. 数据撞墙后,算法重新值钱——而中国在架构上领先

  • 小珺的开场框架:数据、算力、算法是驱动 AI 的三驾马车,数据撞墙迫使各家"重新雕模型架构,以期 scaling law 的魔法继续"。杨松琳认同:“你要在有限的数据里面去压缩更多的智能”——数据还能一直 scale 时谈 data efficiency 没大用,“大家闭着眼睛加数据就行了……只需要买卡”;撞墙后"最终还是要回到算法这种本质的东西上面来"。他记得 OpenAI 的 CTO 也说过,在这个节点上算法研究的重要性会被重新抬高。
  • 中美对比:“我觉得国内算法创新肯定是更强的,主要是 in terms of 架构的话,那肯定是国内更强”——国内没那么多卡,对 efficiency 要求更高,更有动力试高效变种;“硅谷有些公司基本上就是卡太多了,他们就懒得搞”。小珺接梗:“脑子长得不怎么样无所谓,反正我先算力堆上去”;杨:“反正三驾马车你总得有一辆跑得快一点。“但他感觉美国对优化器的投入明显比国内大,国内在逐渐跟进——Kimi 是"最早吃 Mew 这个螃蟹的”。
  • 反例给出边界:数据还很少的领域没必要雕架构——robotics “只要加数据它就能够显著的效果提升,那就没有必要去做模型新算法的创新……先把数据这个问题搞定,再回来看 efficiency 也不迟”。

2. 下一个架构级突破在 attention——MoE 的剧本会重演

  • 架构优化的本质:“给定你相同的 flop,你怎么去更好的利用这些 flop,取得更低的损失函数。“近几年突破最大的方案是 MoE——2023 年传 GPT-4 用 MoE 时"很多地方不太敢跟”,后来有一个工作把 MoE 做通了,大家又回来重新做 MoE;现在 MoE 变成"显学”,每家都做 fine-grained MoE。FFN 已雕成细粒度 MoE,“Transformer 就两个模块……attention 我觉得大家也是可以来雕一下的,就是 why not”。
  • 两个模块 scale 的对象不同:FFN 降 flops 是为了堆更大参数量;attention scale 的是 context window——长文本下把 attention 的 flops 打下来,长生成、agent 处理大量 workflow 都会 “benefit from 更大的 context window”。
  • 小珺要的大脑类比:attention 相当于 working memory 工作记忆——遇到新 scenario,在 context window 里动态处理信息;FFN 像海马体,“基本上会被看成是一个键值对的关联网络”,把 world knowledge 存下来。
  • Transformer 的天花板:先解决 efficiency——“先看看能不能就是把全局这个注意力把它干掉吧”,它是 context window 继续 scale up 的主要瓶颈,“早晚都要把它弄掉”;解决之后"RAG 这一套技术都不需要了,直接放到 context 里面做 in-context RAG”。第二是他所说的"抗天牛能力",甚至"把 pre-training 变成直接从 RL 开始,让模型从零开始学,不给它喂 pre-train data"。

3. Linear attention 入门:去掉 softmax 写成 RNN,兴衰跟着 context wall 走

  • 嘉宾是谁:MIT 在读博士,研究线性注意力;因 Flash Linear Attention(FLA)开源库和几篇有影响力的工作被称"Linear Attention 之母"——业界大量用 FLA 做线性注意力探索。路径:斯坦福 Hazy Research 的博客引他入序列建模,从改进微软亚研院一项原音名称不清、听作 RetNet 的工作效率起步,一路把门控机制和 Delta Rule 合成统一的 RNN 更新规则,同时保证硬件高效训练。
  • 机制一句话:softmax attention 里 QK^T 生成 L×L 矩阵,平方复杂度;linear attention 去掉 softmax 这个非线性算子,等式变换后写成类 RNN 递推——每步 O(1)、整段 O(L)。它属于 pre-train 技术栈里的基础架构研究;当下最火的是 hybrid:少数层保留 softmax,大部分层换线性。
  • 他总结的历史规律:“每一次大家关心 linear attention,那肯定是因为大家碰到了一些 context wall。” 2020 年那波:BERT 训练长度 512、8192 已算长文本,attention 矩阵要实例化在 global memory、读写开销巨大还会 OOM;Flash Attention 诞生打破这堵墙——“既然我们能用 exact 的方式直接算 softmax attention,那就没必要找近似的 attention 去逼近它嘛”,linear 研究随之遇冷。附带判词:当年那批 kernel method to approximate softmax attention,“在今天来看,我觉得这是一个非常错误的方向”。
  • 这轮复活的驱动:长文本 decoding 需求爆发——大参数模型吐大量 token 的花销"让人们不由自主的又重新来审视这一套的技术"。学界在 Flash Attention 后也意识到硬件效率是被接受的关键,这正是他做 FLA(Triton kernels)的初衷。“每当 softmax 它的效率变成一个瓶颈的时候,大家就会回来看 linear attention。”

4. Kimi Linear 与 KDA:长思维链把 decoding 成本顶上墙

  • 缘起在年初:DeepSeek R1 和 Kimi 1.5 刚发,RL 产出几万 token 长思维链做 test-time scaling,全平方注意力架构 decoding “就太贵了”——每层存大量 KV cache,decode L 个 token 时间复杂度也是平方。在长 CoT 加 agentic AI 的背景下,混合注意力"能够把 inference 的 cost 把它打低很多";目标是对比 full attention “performance 要不掉点,inference 速度快很多倍”。
  • 工程主力是 FLA 另一位核心作者张宇(博士毕业后加入 Kimi)。Kimi 内部有个 “scaling ladder” 闯关机制——一个规模下表现好才能到下一个规模继续和 full attention 比。张宇先试了一堆混法,发现混 Gated DeltaNet 最好,但有些地方仍不如 softmax;换上细粒度 decay 后"他发现这个提升还挺大的"。
  • KDA(Kimi Delta Attention)的命名有梗——对标 DeepSeek Sparse Attention 的对仗。技术上基于他去年的 Gated DeltaNet:把 Mamba-2 式"一个 attention head 下所有维度共享一个衰减率"的粗粒度门控,换成每个维度独立的衰减率——每个维度的隐藏状态有自己的更新频率,“从直觉上来看,它就是能够更好的利用这个 RNN 有限的 hidden state”。当年 Gated DeltaNet 用粗粒度是"被迫的":算法和 kernel 优化都还没到位。
  • 他的贡献自述:看到一篇论文(音"康吧",likely Comba)能把 Gated DeltaNet 的求逆减少一次,“我又紧接着推了一个能适用于 KDA 的算法"告诉张宇,张宇写 kernel 实现后发现 scalability 更好——“这应该可能就是我对这个工作的唯一的贡献了……credit 基本都在他那里,不在我这里”,海量 ablation 都是张宇做的。另一处未定之数是位置编码:“在这种混合架构里面大家都在砍 RoPE,但是看大家砍多少”——Kimi 砍了 100%(全 NoPE),Qwen3-Next 砍 75%(partial RoPE 25%),RoPE 在 hybrid 里"可能会比较阻碍这种长度外推”,此处尚无共识。

5. 考古变种史:从输入无关衰减到 Delta Rule,先进技术曾被埋没

  • 最早的 linear attention(2020)“非常的不 work”,短文本都跑不好。第一个大改进是衰减:一个加入输入无关 decay 的代表性工作(原音名称不清)让线性注意力在语言建模上 scale 出效果;随后演化为输入相关 decay(他的 Gated Linear Attention、Mamba/Mamba-2)——模型按 token 动态决定遗忘率,“觉得前面的内容没有必要忘"就设 1 完全保留,“觉得前面这些信息已经没有用了"就设 0 彻底清空。
  • 第二个大改进是 Delta Rule:传统更新是 Hebbian rule,简单把 key-value 外积加进 hidden state;Delta Rule 先用 key 从 memory 取出 old value,与 input value 用可学习系数 beta 做线性组合,再"把旧的 value 和 key 的外积从 memory 里面减去,把新的外积加进去”——加法是记忆,减法是有针对性的删除,比整片 decay 精准得多。DeltaNet、Gated DeltaNet、原音听作 RWKV-7 的工作都用它。
  • 被埋没的历史是这期的暗线:DeltaNet 2021 年就由 LSTM 之父提出,“后面几年根本没有人 take it seriously,就是没有什么 follow-up work”;细粒度 decay 最早可考古到 2016 年、至少 2022 年已有相关工作,但一个 2023 年的工作反而用了更粗粒度的——“之前的技术不能更好的传承下来”。他的自评不轻:“如果没有我来 follow 的话,这一套技术路线可能就会掩藏在文献海里面。”

6. 纯线性已死,3:1 混合成"不共识中的共识”

  • 现状判定:“现在共识就是说纯 linear attention 是不 work 的”——RNN 状态数恒定,context 增长后"早晚会存不下",从理论上就做不了长文本 task;混合架构因保留全局注意力层"下限是有保证的",Kimi Linear 和 Qwen3-Next 在 RULER 等长文本任务上没掉点。但混合算不算共识他不敢说——“不同的地方还是在尝试不同的方案”。
  • 3:1(线性:全局)的收敛过程:MiniMax 之前用 7:1,“softmax attention 层数不够,长文本的保证可能没有那么好”;字节发过 paper 做大量 pre-train from scratch 实验,结论也是 3:1 最好、Gated DeltaNet 优于其他 candidate;Qwen3-Next 同样 3:1 加 Gated DeltaNet。“3:1 应该就是一个在这个不共识的 Hybrid Linear 里面的一个共识了。”
  • 为什么混合未必比全局差:训完会发现"绝大多数的 attention 层它可能就是没有用的……只有一些关键的层的 attention 是有用的",网络本身的冗余度给了换线性层的机会——hybrid “很有可能是一个全面更好的替代方案”。
  • 他认为目前的一个主要短板是长文本 multi-hop 多跳推理——这类任务"比较吃 token 和 token 之间的关系"、吃 softmax 层数。但 KDA 把粗 decay 换细 decay 后,在 multi-hop reasoning、coding、math 上提升"还是比较可观的";他判断这个 gap “有可能被直接缩小甚至反超”,“混合线性注意力只是一个开始”。

7. MiniMax M2 退回 full attention:评测可能不全的代价

  • 复盘(他点赞 MiniMax 团队"非常 open"地分享了经验):M1 监控的指标上 Lightning Attention 表现好又更高效就上了,但评测 pipeline 可能没测多跳推理,“主要只看那些比方说 MMLU 之类的能力”;后来要做 agent task 和 coding,发现 multi-hop 场景"掉点会非常的大",于是 M2 既不混合也不 sparse,“干脆把它退回了 full attention”。他的技术评价不留情面:Lightning Attention “其实是一个比较弱的线性注意力……给人的感觉就像是两年前的一个 linear attention”,技术还停留在两年前的版本。
  • 他对路线反复的态度:“像历史的话就会螺旋上升嘛,一套技术方案肯定是要经过很多很多验证才能最后定下来”——M1 “验证不充分就比较草率的上了”,退回来很正常;MiniMax 说还在继续探索混合架构,“说不定他们下一版 M3 又变成混合注意力架构了”。
  • 最扎的一句——小珺问他是否参与了 MiniMax:“没有……如果我参与了,他们应该不会用这个方案,我会觉得这个方案在开倒车。"(他的参与图谱:Kimi Linear 论文作者之一,与 Qwen3-Next 训练团队"挺熟”、帮忙做学术讨论,MiniMax 无涉。)

8. Sparse 对 Linear:不是对手,终局是融合

  • 两条路线解的是同一个问题——长文本 decoding 的效率。DSA:据他的判断,每层应该都是 sparse、没有 full attention 层,但 KV cache 一点不省,靠从训好的 full-attention teacher 蒸馏 indexer 选 top-k token;混合线性:绝大多数层类 RNN,大幅省 KV cache、decoding 可开更大 batch size。长度上去后各有各的墙:“混合注意力还是会被全局注意力的效率绊住;全 sparse 的瓶颈可能在 KV cache 的管理上面。”
  • 他的终局设想(之前写过知乎回答"这两种方案为什么我们不能把它结合到一起呢"):“最好的结合就是把混合注意力它里面的全局的注意力把它换成 sparse attention”——全局复杂度没了,剩下的层用线性把 KV cache size 打下来,“这就是我目前心中比较理想的一个高效的架构”。前提与瓶颈:“理论上只要 sparse attention 它能选的准,是完全可以取代 full attention 这个层的——但它现在问题可能是选不准”;根因是学习难度:从头训"梯度不太准……学会选 block 还是挺难的,有各种稀疏梯度的问题",这正是 DeepSeek 用蒸馏的原因。工业界据他所知还没人同时结合两者,学界已有探索。
  • 真正的竞争关系被摆正:“线性 attention 的竞争对手可能更多的是 sliding window attention”——GPT-3 技术报告就写明用全局混 sliding window,OpenAI 最近的 OSS 开源模型据他说应该仍是这套。公平比较的方法论:控制 state size——滑窗的 KV cache 上限是 bounded 的,拉到和 RNN 状态数同一量级即可;“decoding 基本上是一个 memory bound 的过程”,state 差不多大,效率就差不多。
  • Apple-to-apple 的缺位:小珺称 Kimi Linear 论文开头写了它是第一个验证性能超越 full attention 的混合线性架构,但只对齐比较了 full attention、没比 sparse——“可能还是资源有限吧……没有这么多卡来同时跑不同方案的对比”;硅谷闭源,“你也不知道他们有没有跑”。“要是有一个地方能做慈善来 apple to apple 比一下,让大家能更好的知道就更好了。“他自己也不知道哪个更好。

9. 硬件是终审法官:一切向矩阵乘法收敛

  • 呼应小珺博客里"Transformer 是这一代硬件的天选架构"的说法:“肯定是天选嘛”——FFN 是大矩阵乘;attention 虽比 RNN 复杂度高一级,但硬件亲和好得多,“大家会宁愿去用理论复杂度更高的 Transformer,也不会来用理论复杂度更低的 LSTM”。同构的历史:“如果没有 Flash Attention,那 softmax attention 也走不到今天”——他给 DeltaNet 设计的并行算法之于 Delta Rule,正是同样的关系。
  • 协同演化的锁定效应:硬件正变成"Transformer 更喜欢的模样”——Tensor Core、TMA、Blackwell 上专为矩阵乘设的独立 memory;FA4 矩阵乘快到 softmax 的 exponential 都成了瓶颈,要用近似方法算 exp,“这也挺好笑的”。所以"你就必须要设计一些能有矩阵乘法的算法,要不然你这个硬件效率肯定是跟不上的”——线性注意力的 chunk 并行恰好"基本上都是一些矩阵乘";训练时不如 FA4 在 Blackwell 上高效"其实也无所谓,有很多地方只 care inference 效率"。
  • 他的原则宣言:算法要 mathematically grounded,同时满足硬件的 universal principle(memory hierarchy、矩阵乘更优)——不必专门针对 H100 调,但不满足通用原则的算法"在 scalability is all you need 的场景下基本上就是没有什么实际价值的,就成自娱自乐"。指望硬件厂商迁就算法更是妄想:“你这算法你是金子做的还是银子做的,能让硬件公司来天天帮你优化呀?”
  • 排名毫不含糊——硬件亲和谁做得更好?“DeepSeek,Absolutely。“DSA 的 indexer 用 FP8 算 attention logit、不需要 softmax、去掉昂贵的 exponential,“基本上就是一大堆矩阵乘,非常的快”,有可能成为下一代架构的 candidate;“DeepSeek 是一个非常非常注重硬件和算法协同设计的公司,infra 在他们算法迭代过程中话语权会比较高”。Kimi 则"没有 DeepSeek 那么追求”——据他所知,Kimi Linear 目前应该还在用张宇写的 Triton kernel 训,“凑合用”,验证有用后再补 CUDA kernel 也来得及。

10. 研究方法论与生态:考古、开源与正循环

  • 他的 research philosophy 是这期最个人化的部分:读博前"申请完之后有半年可以自由的时光”,全部用来调研架构 paper,最老读到 2017 年——“我可以说这个领域里面值得看的文章我基本上都读过一遍……我管这个叫做考古”(一年前的叫老 paper,五年前的"肯定叫做古代的 paper 了")。方法是在文献海里找 machine learning 上 make sense 且能设计并行算法的工作;Gated DeltaNet 的来历就是"打不过就加入"——DeltaNet 打不过 Mamba-2,就把 Mamba-2 的 gating 拿过来 A 加 B。她读博"挺顺的,没啥挫折",因为"更大的 challenge 就是你不知道你要做什么东西……当你很清楚你要做什么的时候,你其实是不会遇到什么挫折的"。
  • infra 是落地的真瓶颈:半年前 MiniMax 圆桌上主持人俊贤问领域瓶颈,他答"infra 的配套没有跟上",令对方意外——但事实如此:“算法层面近两年的发展已经可以大规模的来试了。“FLA 只提供 Triton kernel、“基本上就是可以凑合用,但效率肯定不是最优的”;如今 Qwen3-Next 和 Kimi Linear 开源,推动此前不支持 hybrid 推理的 SG 等引擎补上 support——“建模厂商发 promising 的开源结果 → 推理引擎有动力支持 → infra 生态做起来 → 更多公司敢用”,“是一个正向循环”。
  • 关于"雕"的文化:小珺注意到他总说"把架构玩一下、雕一下”,并引原音听作杨志令(音)“不要在事上雕花"之说;他的回答:“现在没办法,算力不够,数据也有限了,所以只能雕。但是我觉得雕架构还是挺有用的——像 M1 这个方案雕出来之后,基本上已经成为一个共识了”,“雕"不是贬义,“是把一个模块打磨到更好”。顺带一个 aside:DeepSeek 的 OCR 论文(洗书籍/PDF 数据做 pre-train,兼做 context compression)“是一个有意思的脑洞,但我不确定这个方案怎么样”。
  • 给想入行的年轻研究者的建议只有一条,且现实到近乎冷峻:“现在的话,找个公司去实习……因为我觉得做架构必须要算力,没有算力就没法做架构,所以还是先找个 lab 去实习吧。”