先锋 趋势 方法 投研 作者
返回先锋
Sebastian Raschka
创业者 2 场深度对话收录

Sebastian Raschka

AI 领航者

前沿洞察

AI竞争重心正从盲目扩大模型规模,转向推理时算力、RLVR与系统级协同,代码则是首要商业闭环。开源扩大了中国势能,使专有数据、底层算力栈与分发界面成为真正护城河。同时,基准作弊与数据污染致使公开评测体系失效,推高验证成本;前沿API已沦为防范蒸馏与地缘博弈的战略关口,可靠性与成本仍是落地核心阻碍。

观点集合

[直播] Anthropic 蒸馏与模型作弊:SWE-Bench 已死 | Nathan Lambert & Sebastian Raschka

  • 🗓️ 日期2026-02-26 | 🎙️ 节目:Latent Space

Anthropic对蒸馏的警告,使前沿API访问成为能力控制与地缘竞争节点,但请求发生时很难区分评测和训练。蒸馏价值取决于教师与学生模型的兼容性;公开基准污染和SWE-bench Verified中59%的剩余任务无法按原题解决,正推高私有评测成本。

查看访谈对话精读提要
  • Anthropic 对蒸馏的警告,已将前沿 API 访问变成地缘政治与能力控制问题。 Nathan Lambert 认为,受 GPU 约束的中国实验室“显然应该这么做”:购买 Claude 输出,比在内部生成可比质量的合成数据更容易;而 Anthropic 将分布式采集称为“攻击”。服务条款主要赋予供应商终止访问的权利,但如果重新加强执行,供应商可能会把最强模型留在产品内,或限制高端 API 的访问。

  • 执行难点在于认识论:API 运行期间,评测与蒸馏看起来完全一样。 Sebastian Raschka 用了基本相同的循环来跑 MATH-500、一个包含12,000个样本的数学数据集,以及通过 OpenRouter 调用 DeepSeek V3.2 的书籍实验;只有在事后保存输出并用于训练,行为才会显出差别。请求量、重复程度和主题分布,可能在数万或数十万次请求时暴露采集行为,但合法基准测试会把问题运行3到5次,生产环境的聊天机器人也会产生巨大流量,由此形成令人不适的隐私权衡。

  • Anthropic 的证据高度依赖时间窗口,尤其是 MiniMax 与 DeepSeek 流量之间的差距。 swyx 注意到,Opus 4.6 发布后,MiniMax 几乎将一半流量切换过去,这与 MiniMax 2.5 正在训练的判断一致;DeepSeek 约150,000次交互,可能对应另一段训练窗口。如果不知道请求发生在4周还是6个月内,Nathan 认为 Anthropic 强调 DeepSeek 部分也是一种传播策略:它是“美国人唯一知道的中国 AI 名字”。

  • 蒸馏数据并非天然有价值,教师模型必须适配学生模型。 Nathan 表示,Qwen-dense 模型往往比更强的前沿系统更适合教会 Qwen 类开源模型,而 GPT-OSS 也是一个出人意料的好教师模型:“你有了这些数据,不代表它真的会让你的模型变得更好。” 实验室需要先证明 Claude 数据能够产生有效信号,再决定是否付费提取1,000亿个 token,尤其是在大模型生成速度约为每秒40个 token 的情况下。

  • API 可能不如围绕 API 构建的产品构成有效护城河。 Nathan 称 API 市场“竞争惨烈”,并认为如果 Anthropic 真担心蒸馏,可能会把最强模型直接放进 Claude Code,而不向市场广泛提供;Sebastian 则反驳称,聊天机器人、OpenClaw 工作负载,以及超出订阅额度的用户,都会创造规模可观的非补贴 token 生意。swyx 认为 Anthropic 有“Apple 的感觉”,同时称 OpenAI 的领导层由于理想主义和原则,不太可能把模型锁在产品背后——尽管据报道,最近3个 GPT-5 Codex 变体都曾获得2到4周的产品独占窗口。

  • SWE-bench Verified 已无法区分前沿编码模型,因为饱和度与任务缺陷共同淹没了有效信号。 分数集中在80多分,而重复运行的噪声约为0.5到1分,因此发布版本之间微小的提升“显然是胡扯”。OpenAI 后续审计发现,剩余顽固任务中有59%按原题无法解决;其中一个任务暗中要求精确使用字符串 get_annotation,使记忆原答案成为唯一可靠路径。

  • 下一轮评测的成本会实质性上升,隐私性也会更强。 GPT-5 使用了更晚版本 Django 的知识,而 Gemini Flash 和 Opus 仅凭任务 ID 就能复原题目与解法,这说明公开 GitHub 基准会污染模型,即使不存在蓄意作弊。SWE-bench Pro 增加了更新的任务、私有/公开拆分、更多仓库和语言,但嘉宾预计前沿评测的成本将达到数百万美元,之后可能上升至“数千万乃至数亿美元”,具备规模优势的实验室和数据供应商将因此受益。

  • 🔗 原始收听与视频来源: [直播] Anthropic 蒸馏与模型作弊:SWE-Bench 已死 | Nathan Lambert & Sebastian Raschka

收听完整访谈 →


2026年AI现状:LLM、编程、Scaling Laws、中国、Agents、GPU与AGI|Lex Fridman Podcast #490

  • 🗓️ 日期2026-02-01 | 🎙️ 节目:Lex Fridman Podcast

AI价值正从更大的基础模型转向预训练、RLVR、推理时算力与服务的组合,编程是近期最清晰的变现切口。开放权重扩大了中国影响力,而持久护城河来自专有数据、CUDA级基础设施、可信界面与分发能力;商业化仍受可靠性、法律和算力成本制约。

查看访谈对话精读提要
  • 2026年的AI竞赛不是赢家通吃:思想可以在实验室之间自由流动,但算力预算、硬件获取、组织文化和分发能力决定谁能捕获价值。 Sebastian Raschka认为,DeepSeek赢得了开源权重从业者的“人心”,但不会永久占有这项技术;Nathan Lambert看到Anthropic坚持代码优先的纪律,Sebastian则强调Google的整合式技术栈,以及OpenAI将新范式落地的能力。中国不断扩大的竞争版图——DeepSeek、Qwen、Kimi、MiniMax和Z.ai——让持续追赶超越比持久的技术霸权更可能发生。

  • Scaling laws依然有效,但其经济性越来越偏向由预训练、后训练和推理时算力组成的组合,而不是简单地打造最大的基础模型。 Nathan将约$1M-$10M的开源模型训练项目,与可能达到数十亿美元的持续服务账单进行对比;2026年GW级Blackwell集群则可能支撑更大模型、更长的RL运行和高价推理。他提出了一个颇具挑衅性的商业化标志:继$200套餐之后,如果边际智能足够有价值,“今年我们会看到$2,000的订阅”。

  • 编程是近期最清晰的变现切口,因为经过RLVR训练的模型能够推理、调用工具,并根据可验证结果反复迭代。 Claude Code的优势似乎不只是Claude Opus 4.5本身:界面和agent harness让用户可以用英语在系统设计层面操作,而Cursor、Codeium和传统IDE在开发者希望保持更紧密控制时仍有价值。趋势正走向“软件工业化”,但生产环境复杂度、规格定义和安全关键系统仍会让人类留在回路中。

  • 开放权重正在成为战略基础设施;即使美国企业不会购买中国API,中国供应商也能通过宽松发布赢得全球影响力。 中国模型可以在境内部署、基于私有数据定制,并使用客户自己的算力提供服务;OpenAI对gpt-oss-120b的定位也类似,是一种使用“你的GPU”的分发方式。Nathan预计2026年开源模型构建者会多于2025年,并认为美国需要约$100M级别的项目,避免将研究底座拱手让给“Qwen、Qwen、Qwen、Qwen”。

  • 真正持久的护城河在模型权重之下和之上:专有数据、服务基础设施、可信界面、工具集成和硬件生态。 Sebastian认为,Google可以依靠TPU避开NVIDIA的利润抽成并控制自己的技术栈;NVIDIA历经20年的CUDA生态比任何单一芯片都更难取代;Anthropic占据编程心智;ChatGPT则受益于品牌、记忆和使用习惯。美国闭源模型目前仍好到足以让嘉宾付费,而中国开源模型则在成本、授权和可定制性上竞争。

  • 数据质量和可验证的后训练如今比架构创新更重要,因为前沿模型依然能明显看出是GPT-2的后代。 Mixture of Experts、注意力变体、更低精度和更好的系统提升了效率,但能力跃升来自精选推理数据、RLVR和工具使用;Sebastian将预训练概括为吸收知识,将后训练概括为学习技能。真正棘手的负担是法律来源、基准污染和偏好平均化:RLHF可以让模型普遍讨喜,却会磨平用户看重的“声音”和锋利度。

  • AGI时间表不如具体能力门槛有决策价值:可靠的计算机操作、自主交付功能、科学专业化能力,以及可衡量的经济影响。 Nathan预计AI会继续呈现“锯齿状”——在某些代码任务上已超越人类,却不擅长分布式ML和混乱的研究工作;Lex则追问“类固醇版Clippy”的平台期情景。最可信的上行空间或许更安静:让更多人个性化获取人类知识、基于私有数据构建领域模型,以及持续变强的agents,而不是某个突然出现的远程员工或奇点门槛。

  • 🔗 原始收听与视频来源: 2026年AI现状:LLM、编程、Scaling Laws、中国、Agents、GPU与AGI|Lex Fridman Podcast #490

收听完整访谈 →