我们到底在扩展什么?
我们到底在扩展什么?
摘要
- Dwarkesh指出的核心矛盾是:不可能一边坚持极短时间线,一边看多基于可验证奖励的RL扩展。 整条RL环境公司供应链都在把浏览器和Excel技能预先烘焙进模型——“这些模型要么很快就能自主在工作中学习,让所有预烘焙都失去意义;要么不能,这就意味着AGI并不迫在眉睫。”
- 机器人是最好的试金石:这本质上是“算法问题”,而不是硬件或数据问题。 人类只需很少训练就能远程操控现有硬件,因此真正具备类人学习能力的模型基本就能解决机器人问题。可实验室却必须在1000个家庭里练习100万次,说明这样的学习者并不存在。
- 收入缺口就是能力缺口。 知识工作者每年创造数十万亿美元收入,而实验室的收入仍差着几个数量级,因为“模型离人类知识工作者的能力还远得很”。把问题归咎于扩散滞后只是“自我安慰”——真正运行在服务器上的人类会比招聘真人扩散得更快:几分钟内就能读完你的Slack和云盘,还不存在人类招聘的劣币驱逐良币问题。
- 值得交易的标志性判断是:模型的惊艳程度,正以短时间线派所预测的速度提升;但实用性,只以长时间线派所预测的速度提升。 (“Models keep getting more impressive at the rate that the short-timelines people predict, but more useful at the rate that the long-timelines people predict.”)
- RL扩展没有预训练那样的正当性。 人们试图把干净的预训练损失曲线所带来的光环“洗”到RLVR看多逻辑上,但后者背后没有公开趋势。Toby Board(听辨如此)拼出了O系列数据:“要让RL带来相当于单个GPT级别的提升,RL总计算量可能需要扩大约100万倍。”
- 眼下不会出现失控式起飞。 未来的主要驱动力不是软件奇点,而是AGI顶端的持续学习;它会像GBT3之后解决上下文学习那样逐步实现,可能还要“再花5到10年打磨”。突破会迅速被复制,三巨头大约每个月轮换一次榜首,而且没有任何飞轮真正削弱过竞争。
- 对远期的判断是:到2030年,各家实验室会在持续学习上取得实质进展,赚到数千亿美元收入,但仍未实现知识工作的自动化。 不过,他仍预计“未来10年至20年内会出现真正类脑的智能,这相当疯狂。”
精读
1. 极短时间线与RL预烘焙不可能同时成立
- Dwarkesh开篇提出的谜题是:整条RL环境公司供应链都在搭建训练环境,教模型浏览网页和使用Excel;Baron Millig(听辨如此)博客文章还提到,已有“数十亿美元”支付给博士、医学博士及其他专家——但如果类人学习者已经近在眼前,所有这些预烘焙都注定失败。“这些模型要么很快就能自主在工作中学习……要么不能,这就意味着AGI并不迫在眉睫。”
- 机器人的证据在于:这根本上是“算法问题”,而不是硬件或数据问题——人类经过极少训练就能远程操控现有硬件,但实验室却必须进入1000个家庭,“练习100万次如何拿起盘子”。
- “自动化研究员”的反驳方案是:先用拼凑式RL造出超人类AI研究员,再复制100万个这样的“自动化Ilia”,让它们解决从经验中学习的问题;但他最尖锐的回应是:“我们每卖一份都在亏钱,但可以靠规模把钱赚回来。”实验室自身的行为也透露出线索:自动化Ilia并不需要PowerPoint顾问式技能,因此它们的行动“暗示了一种世界观——这些模型在泛化能力和在岗学习上还会持续表现糟糕”。
2. 巨噬细胞问题:工作依赖无法预烘焙的上下文
- 这场论证的核心来自一次晚餐轶事:一位长时间线派生物学家说,自己要判断切片上的一个点“到底是巨噬细胞,还是只是看起来像巨噬细胞”;AI研究员则反驳说,图像分类正是“教科书深度学习的核心地带”。Dwarkesh的判断是:为每个实验室特有的微任务搭建一套定制训练流水线,净产出并不划算;真正需要的是能从语义反馈中学习、像人一样泛化的AI。
- 每个工作者每天都要处理“100件需要判断力、情境意识,以及在工作中学到的技能和上下文的事情”,而且日复一日各不相同——不可能只靠预先烘焙一组固定技能,就自动化哪怕一份工作。
3. 扩散滞后是自我安慰,收入缺口衡量能力
- 如果模型真是运行在服务器上的人类,“它们会极快扩散”:几分钟内读完你的Slack和云盘,从其他AI员工身上提炼技能,同时跳过人类招聘中的劣币市场问题。因此AI劳动力理应比人更容易扩散;它尚未如此扩散,只能说明“这些模型就是缺能力”。
- 更诚实的标尺是:到了AGI阶段,买方每年会在token上花费数万亿美元,对应知识工作者每年数十万亿美元的工资总额。实验室的实际收入仍差着几个数量级,这本身就是信号。
- 对于不断移动的目标线,他也承认其中一部分有合理性:“如果你在2020年给我看Gemini 3,我会确信它能自动化一半知识工作。”每解决一个“足够大的瓶颈”——理解、少样本学习、推理——就会发现“智能和劳动远比我此前意识到的复杂得多”。他的2030年预测是:持续学习取得进展,收入达到数千亿美元,但仍无法实现全面自动化。
4. 可验证奖励RL缺乏公开的规模化趋势
- 预训练曾给出一条跨越多个数量级的干净损失曲线,“几乎像物理定律一样可预测”;虽然它只是幂律,增长强度远不如指数增长。如今人们试图把这条趋势的光环“洗”到RLVR上,但RLVR并没有公开可知的规模化趋势。
- 当研究者真正把数据点串起来时——Toby Board(听辨如此)横向整理了O系列基准测试——结论反而偏空:要让RL带来相当于单个GPT级别的提升,“RL总计算量可能需要扩大约100万倍”。
5. 持续学习会逐步到来,不会一锤定音
- 未来增长的主线不是软件奇点,也不是软硬件叠加的奇点,而是AGI顶端的持续学习——人类主要就是“从经验中变得有能力”。Baron Miller(听辨如此)描绘的路径是:专业化代理——Karpathi(听辨如此)所谓的“认知核心”加上特定工作的技能——先执行真实工作,再通过批量蒸馏“把所有学习成果带回蜂群模型”。
- 解决这个问题会像解决上下文学习一样漫长:GBT3在2020年已经证明上下文学习可以非常强大,GPT3论文的标题也是“Language Models are Few-Shot Learners”,但GPD3发布时,上下文学习仍谈不上“已经解决”。实验室明年会推出某种名为持续学习的东西,并将其算作进展,但达到人类水平的在岗学习可能还要再花5—10年。
- 因此不会出现失控式增长。正如Satya(可能是他)在播客中所说,如果某种能力突然被彻底解决,“那可能就是比赛结束、胜负已定”——但事情大概不会这样发展。初步突破很快会被逆向拆解并复制;此前的飞轮——聊天参与度、合成数据——“几乎没能削弱竞争不断加剧”的趋势,三巨头仍大约每个月轮换一次榜首。
- 他坚持认为市场低估的上行空间,不是当前范式的简单延续,而是“服务器上数十亿个类人智能”,它们能够复制并合并所有学习成果;这预计会在“未来10年至20年内”出现,“相当疯狂”。