
Ali Behrouz
前沿洞察
Ali Behrouz的核心洞见在于:通往AGI的质变并非单靠堆叠算力,而是重构架构层面的记忆与持续学习。他主张以Nested Learning打破单一训练时钟,用Titans的动态权重替代昂贵的长文本Token检索,以此构筑具备持久上下文的协作智能体。但他严正警示:灾难性遗忘、通用负载验证匮乏以及个性化伴生的对齐失控,正让盲目的AGI乐观面临架构性坍塌风险。
观点集合
Nested Learning:Ali Behrouz 探索持续学习之路与 AI 架构的幻象
- 🗓️ 日期:
2026-06-03| 🎙️ 节目:The Cognitive Revolution
Ali Behrouz将持续学习视为打造持久型AI协作者的缺失能力,Nested Learning则以多重更新频率和知识迁移路径取代单一训练时钟。HOPE同时学会此前未见的Manchu和MTOB,显示其记忆管理可能超越perplexity提升;持久个性化也带来隐私、对齐、评估和版本管理风险。
查看访谈对话精读提要
这一期将持续学习——而非静态预训练的又一次增量改进——视为当下模型与持久型 AI 协作者之间缺失的能力。 Behrouz 认为,当前存在两个相互关联的缺口:一方面,现有 LLM 无法在不引发灾难性遗忘的情况下,将新知识高效吸收进数十亿个参数;另一方面,token 空间中的记忆最终会超过上下文限制。目标是让模型能够“适应环境与上下文”,同时把经验压缩成越来越通用的抽象。
Nested Learning 用以不同频率更新的模块取代单一训练时钟,可能把扩展路径从堆叠更多层,转向嵌套更多学习时间尺度。 快速模块适应近期的高分辨率上下文,慢速模块保存持久知识并提取更高层次的模式,前提是两者之间存在有效的知识迁移。其架构论点是,“更新频率”和“层级之间的知识迁移”会成为新的扩展维度。
HOPE 以多个 MLP 记忆模块落地这一框架;在更完整的形态中,它还引入了一个会随上下文演化更新规则的自修改 Titans 模块。 HOPE Attention 保留 attention,但将单一固定 MLP 记忆替换为多个 MLP;按 Behrouz 的回忆,在报告配置中,这些 MLP 大致按照 128、512 和 2,048 token 的节奏更新。完整 HOPE 则用一种能够自行生成 value 的序列式关联记忆取代 attention,让“模型本身”根据每个 token 修改自己的学习方式。
最能说明问题的结果并不是 perplexity 的边际提升,而是 HOPE 能够在上下文中同时学会两种此前未见过的语言。 传统 transformer 在获得某种陌生语言的语法和词典后,可以完成翻译;但当 Manchu 和 MTOB 同时出现时,模型“几乎崩溃”,而加入 HOPE 层级后,表现逐步恢复并接近单语言基线。这初步说明 HOPE 具备 qualitatively different 的记忆管理能力,而不只是更强的 next-token predictor。
Behrouz 认为,架构与优化器高度相关,因为两者都是在压缩不同上下文的关联记忆。 架构从 token 中学习,优化器从梯度中学习,而 momentum 本身就是压缩梯度历史的一种记忆。M3 将同样的多频率思路应用于优化,在报告设置中跑赢 Adam 和 Muon,但 Behrouz 强调,优化器排名取决于具体任务。
《Language Models Need Sleep》增加了一个离线巩固阶段,将近期知识从快速记忆提炼到更慢的记忆中,同时避免模型无边界增长。 接收层会先获得临时参数,为巩固过程腾出空间;完成后,这些参数被移除并回收。压缩压力迫使慢速记忆表达更宽泛的规则,而不是复制样本。在“做梦”阶段,模型根据自身近期知识生成合成文本,并训练其后续内容,将记忆迁移与自我改进结合起来。
持久学习的上行空间是极致个性化,但同一机制也带来尚未解决的隐私、对齐、评估和产品版本管理风险。 对于如何完全控制模型漂移,Behrouz 的诚实回答是:“我没有非常具体的想法”;模型可能把用户的一切都内化,对抗性输入可能变成持久信念,而运营方也不可能在每次更新后重新跑一套完整安全测试。他认为知识迁移可能成为一个控制点,输入依赖的学习率也可能过滤掉令人意外但无关的数据。
持续学习可能进一步强化赢家通吃的平台格局,但 Behrouz 预计,差异化智能体会形成一种抵消力量。 一个普遍部署的模型可能把经验不断复利,形成难以击败的优势;但主持人推测,个性化学习者也可能走向专业化,并遗忘不再使用的能力。Behrouz 更谨慎的判断是,拥有不同长处和短板的多样化系统,可能“比世界上只有一种单一形式的智能更好”。
Nested Learning“不是持续学习的解决方案”,而是寻找解决方案的工具。
🔗 原始收听与视频来源: Nested Learning:Ali Behrouz 探索持续学习之路与 AI 架构的幻象
AMA 第1部分:Claude Code 是 AGI 吗?我们身处泡沫之中吗?以及实时玩家分析
- 🗓️ 日期:
2025-12-18| 🎙️ 节目:The Cognitive Revolution
Claude Opus 4.5通过快速构建个性化应用,可能已经接近软件AGI,但数据库错误与能力不均衡仍让完整AGI悬而未决。高风险工作中的持久优势在于上下文管理和多模型判断;Google的分发与基础设施、Anthropic的模型质量,以及OpenAI的金融承诺共同塑造前沿竞争。
查看访谈对话精读提要
对 Nathan Labenz 而言,AI 最具确定性的证明已不再是基准测试,而是它与儿子的肿瘤科医生并肩工作时的表现。 Ernie 的侵袭性 B 细胞癌在第2轮化疗前已被判定为缓解;在 AI 建议下进行的微小残留病灶检测显示,每100万个细胞中少于1个带有癌症特征,相比确诊时估计最高可能达到的1/10。这个结果支持的是“谨慎乐观”,不是治愈:癌症仍可能复发,6轮化疗还剩3轮,Ernie 的体重也已从51磅降至41磅。
Claude Opus 4.5 可能已经符合“软件 AGI”的定义,但 Nathan 没有看到完整 AGI 在圣诞节前后到来的证据。 他在大约3至5个工作日内做出了3款个性化应用,分别用于规划无麸质旅行、模拟会议互动,以及回测自然语言交易策略;GDPval 也显示,模型在相当大多数软件工程任务上胜过专业人士。但模型仍曾误建2个数据库,需要5或6次提示才能恢复,而且相比此前的前沿模型,体感是渐进式而非类别式提升:节日期间的热潮可能是围绕 Dean Ball “4.5 is AGI”推文形成的一次“级联”。
对于高后果工作,Nathan 的实际优势正从模型访问权转向上下文管理和多模型判断。 他的3条规则是买最好的模型,提供“尽可能多的上下文”,并获取多方意见;他会定期比较 Claude Opus 4.5、GPT-5.2 Pro 和 Gemini 3。他的初步排序是:Claude 排第一,是金发姑娘模型;GPT-5.2 Pro 更慢、更穷尽;原生 Gemini 3 很有价值,但观点异常强烈——作为专家小组中的一票很强,作为唯一声音则可能有风险。
即使围绕它形成的资本结构最终变成泡沫,这项技术本身也是真实的。 Nathan 认为,肿瘤学上的竞争力,加上24/7可用性和对完整病例的记忆,足以终结社会只是“沉迷于自家 AI 供应”的说法。融资结构仍可能崩裂:专业 GPU 运营商的缓冲垫比 Microsoft 更薄,OpenAI 的义务可能超过收入,而铁路类比仍然成立——最终有用的基础设施,可以与违约、过度建设,以及投资者“最后接下一堆烂摊子”同时存在。
Nathan 对杂乱文档的测试表明,美中模型差距正在基准测试看不到的地方扩大。 Claude Opus 4.5 在被明确要求不得推断后,忠实读取了劣化的政府表格;Gemini 3 几乎同样强,但有时会用看似合理的答案替代未勾选的选项,而他测试的中国模型——Qwen Vision、GLM 4.6、Kimi 和 DeepSeek——“完全不在一个水平”,有时只能还原表格约20%的内容。他认为,背后的机制是客户反馈与推理规模飞轮,而不只是训练算力:更小的收入、团队和部署规模,意味着更少资源去发现并修补这些特异性故障。
如果必须选一个最终的前沿赢家,Nathan 仍选 Google DeepMind;Anthropic 拥有最好的单一模型,而 OpenAI 正试图通过规模制造金融缓冲。 Google 拥有约1000亿美元收入、按 Nathan 估算每周超过10亿美元利润、第7代 TPU、分发能力、数据中心能力,以及最广泛的研究组合。Anthropic 的模型质量、人才留存、安全披露和“灵魂”研究最突出;OpenAI 仍处于前沿,但其显然的策略是通过把数万亿美元潜在建设规模和多张资产负债表绑定到自身存亡上,变成“大到不能倒”。
xAI 在资源和强化学习输入方面是一个真正的竞争者,但其治理折价十分严重。 SpaceX、Tesla 和 Neuralink 能持续提供复杂工程问题,这些问题可能成为异常有价值的 RL 环境,而 Elon Musk 也能调动足够资本来承受模型失误。但薄弱的安全报告、MechaHitler 事件后48小时内发布 Grok 4,以及对女性公开发布照片进行性化编辑,让 Nathan 称 xAI 是目前唯一一家值得“公开羞辱和污名化”的前沿公司;Meta 目前掉队,Microsoft 则可能是在节省体力,而不是无力竞争。
🔗 原始收听与视频来源: AMA 第1部分:Claude Code 是 AGI 吗?我们身处泡沫之中吗?以及实时玩家分析
Titans:LLM 的神经长期记忆,与作者 Ali Behrouz 对谈
- 🗓️ 日期:
2025-05-15| 🎙️ 节目:The Cognitive Revolution
Titans将AI记忆变成推理时通过梯度下降更新的MLP,把key-value关联压缩进固定大小参数,而非保留每个token。它以精确的短期attention结合会衰减的长期记忆,在200万至1000万tokens上表现突出,但合成测试、灾难性遗忘和通用工作负载证据不足仍是关键风险。
查看访谈对话精读提要
Erik Torenberg 的投资判断是:持续演化的记忆,而非原始世界知识,可能是今天的 copilot 与“即插即用的知识工作者”之间最后一个重大突破口。 企业上下文散落在 Slack、邮件、文档、GitHub、会议和任务系统中,Tyler Cowen 所说的“稀缺的就是上下文”在 AI 时代成为字面事实。Torenberg 估算,拥有百年历史的企业训练专属模型可能要花数百万至数千万美元,小企业则约需数万美元至十几万美元;如果能摊薄到大量 AI 员工身上,成本可能并不高。
Titans 将记忆的载体从向量或矩阵中的一组数字,改成了一个能在推理过程中学习的神经网络。 RAG 存储的是可搜索记录,Mamba 风格的循环系统更新的是数值状态,而 Titans 使用一个 MLP,在运行时通过梯度下降更新权重。Ali Behrouz 认为,这项工作的意义不在于交付一个最终模型,而在于打开一条新的设计轴:“没有哪种架构是终点。”
记忆 MLP 学习一张从 attention key 到对应 value 的关联映射,让未来的查询无需保留每个 token,也能取回历史负载的近似值。 Attention 通过把查询与所有已存储 key 显式比较,提供非参数化解法;Titans 则把这些关系压缩进固定大小的参数中。代价是无法精确召回,但换来了更高效率,以及更接近人类、会逐渐淡化的长期记忆。
Titans 让记忆管理高度依赖输入:预测误差产生“惊讶度”,动量将一次重要更新延伸到周边事件,衰减则为新信息腾出空间。 Behrouz 的直觉是,“所有令人惊讶的事情,大概都值得记住”,但惊讶之后的解释性 token 即使本身并不出人意料,也可能十分重要。记忆衰减、当前更新以及此前的惊讶是否延续,都由依赖 token 的学习控制量决定。
Behrouz 不接受用循环记忆取代 attention 的前提;Titans 明确是精确短期 attention 与压缩长期记忆的混合体。 团队测试了 Memory as Context、Memory as Gate 和 Memory as Layer,其中更有原则性的 context 与 gating 设计通常优于简单交错 layer。在 Nathan Labenz 的粗略统计中,传统 layer 方案在约 30 组规模与任务比较中只赢了约 2 组。
最受关注的 benchmark 是长上下文表现,但 Behrouz 反复提醒,现有测试是合成任务,不能证明通用工作负载也会取得同等幅度的提升。 据报道,小型 Titans 模型可扩展到 200万 tokens,甚至在 1000万 tokens 上达到约 70% 的准确率,而 GPT-4 的 benchmark 表现迅速下滑。在报告的对比中,Titans 的实现已经快于 Mamba,不过一些较新的线性模型仍然更快,而且 Titans 尚未进行定制 kernel 优化。
Titans 为长期运行的 agent 打开了一条可信路径,但它本身并没有解决终身学习或企业知识获取问题。 将现有的 Llama 或 R1 风格模型改造成 Titans 看起来可行,但尚未得到验证;持续更新有限的记忆也可能造成灾难性遗忘。Behrouz 下一步要测试的是更广泛的问题:神经记忆能否像 transformer 一样跨越决策、强化学习和其他模态发挥作用,而不只是用于语言建模。
🔗 原始收听与视频来源: Titans:LLM 的神经长期记忆,与作者 Ali Behrouz 对谈