先锋 趋势 方法 投研 作者
返回先锋
Nested Learning
开发者 1 场深度对话收录

Nested Learning

观点集合

Nested Learning:Ali Behrouz 探索持续学习之路与 AI 架构的幻象

  • 🗓️ 日期2026-06-03 | 🎙️ 节目:The Cognitive Revolution

Ali Behrouz将持续学习视为打造持久型AI协作者的缺失能力,Nested Learning则以多重更新频率和知识迁移路径取代单一训练时钟。HOPE同时学会此前未见的Manchu和MTOB,显示其记忆管理可能超越perplexity提升;持久个性化也带来隐私、对齐、评估和版本管理风险。

查看访谈对话精读提要
  • 这一期将持续学习——而非静态预训练的又一次增量改进——视为当下模型与持久型 AI 协作者之间缺失的能力。 Behrouz 认为,当前存在两个相互关联的缺口:一方面,现有 LLM 无法在不引发灾难性遗忘的情况下,将新知识高效吸收进数十亿个参数;另一方面,token 空间中的记忆最终会超过上下文限制。目标是让模型能够“适应环境与上下文”,同时把经验压缩成越来越通用的抽象。

  • Nested Learning 用以不同频率更新的模块取代单一训练时钟,可能把扩展路径从堆叠更多层,转向嵌套更多学习时间尺度。 快速模块适应近期的高分辨率上下文,慢速模块保存持久知识并提取更高层次的模式,前提是两者之间存在有效的知识迁移。其架构论点是,“更新频率”和“层级之间的知识迁移”会成为新的扩展维度。

  • HOPE 以多个 MLP 记忆模块落地这一框架;在更完整的形态中,它还引入了一个会随上下文演化更新规则的自修改 Titans 模块。 HOPE Attention 保留 attention,但将单一固定 MLP 记忆替换为多个 MLP;按 Behrouz 的回忆,在报告配置中,这些 MLP 大致按照 128、512 和 2,048 token 的节奏更新。完整 HOPE 则用一种能够自行生成 value 的序列式关联记忆取代 attention,让“模型本身”根据每个 token 修改自己的学习方式。

  • 最能说明问题的结果并不是 perplexity 的边际提升,而是 HOPE 能够在上下文中同时学会两种此前未见过的语言。 传统 transformer 在获得某种陌生语言的语法和词典后,可以完成翻译;但当 Manchu 和 MTOB 同时出现时,模型“几乎崩溃”,而加入 HOPE 层级后,表现逐步恢复并接近单语言基线。这初步说明 HOPE 具备 qualitatively different 的记忆管理能力,而不只是更强的 next-token predictor。

  • Behrouz 认为,架构与优化器高度相关,因为两者都是在压缩不同上下文的关联记忆。 架构从 token 中学习,优化器从梯度中学习,而 momentum 本身就是压缩梯度历史的一种记忆。M3 将同样的多频率思路应用于优化,在报告设置中跑赢 Adam 和 Muon,但 Behrouz 强调,优化器排名取决于具体任务。

  • 《Language Models Need Sleep》增加了一个离线巩固阶段,将近期知识从快速记忆提炼到更慢的记忆中,同时避免模型无边界增长。 接收层会先获得临时参数,为巩固过程腾出空间;完成后,这些参数被移除并回收。压缩压力迫使慢速记忆表达更宽泛的规则,而不是复制样本。在“做梦”阶段,模型根据自身近期知识生成合成文本,并训练其后续内容,将记忆迁移与自我改进结合起来。

  • 持久学习的上行空间是极致个性化,但同一机制也带来尚未解决的隐私、对齐、评估和产品版本管理风险。 对于如何完全控制模型漂移,Behrouz 的诚实回答是:“我没有非常具体的想法”;模型可能把用户的一切都内化,对抗性输入可能变成持久信念,而运营方也不可能在每次更新后重新跑一套完整安全测试。他认为知识迁移可能成为一个控制点,输入依赖的学习率也可能过滤掉令人意外但无关的数据。

  • 持续学习可能进一步强化赢家通吃的平台格局,但 Behrouz 预计,差异化智能体会形成一种抵消力量。 一个普遍部署的模型可能把经验不断复利,形成难以击败的优势;但主持人推测,个性化学习者也可能走向专业化,并遗忘不再使用的能力。Behrouz 更谨慎的判断是,拥有不同长处和短板的多样化系统,可能“比世界上只有一种单一形式的智能更好”。

  • Nested Learning“不是持续学习的解决方案”,而是寻找解决方案的工具。

  • 🔗 原始收听与视频来源: Nested Learning:Ali Behrouz 探索持续学习之路与 AI 架构的幻象

收听完整访谈 →