先锋 趋势 方法 投研 作者
推理已成为新的训练——Philip Kiely 与 Ali Taha,Basten
返回节目精读

推理已成为新的训练——Philip Kiely 与 Ali Taha,Basten

摘要

  • 推理仍是一个处于早期、价差极大的优化市场。 swyx 将当前推理优化的巨大收益类比于量化金融:后者的价差已从1970年代约20%的差异收窄至极小比例。一个1万亿参数模型,在未优化的技术栈上可能只有每秒30–40个token,但在硬件条件理想、配合缓存、量化、投机解码和针对延迟调优的流量后,可能达到300–400个;不过,在相同硬件上的更干净结论是 2–4X,4–6X比激进的10X headline更常见。

  • 真正的生产护城河,始于模型吐出第一个token之后。 Day-zero服务需要架构支持、NVFP4量化与校准、训练好的投机模型、基础设施集成、按流量特征调优,以及数周的真实环境调试。“支持这个模型,可以是我能从它生成一个token;也可以是我拥有一个生产就绪的API。”

  • 优化正在同时变成训练问题和系统问题。 量化感知后训练、logit蒸馏、针对流量的投机解码器,甚至替换低效模型层,都能实质性改善服务效率。讨论中最有力的表述是:“要实现快速推理,就需要非常好的训练”;反过来,缓慢的rollout也会卡住强化学习流程,把训练推向off-policy。

  • 这套技术栈的经济交接点,是serverless转向专用部署。 按token付费的API让模型试用几乎没有摩擦,但每小时消耗数百万token的客户,租用容量并自行打满,通常更省钱。专用endpoint还提供可靠性、隔离能力——不会被另一个租户发送的1亿token benchmark拖累——以及定制化的延迟-吞吐设置、指定精度和针对流量的投机解码。

  • 下一轮收益中,硬件互联可能比kernel更重要。 Philip Kiely看空mega-kernel,因为生产级库可以更好地优化并重叠多个小kernel;Rubin的讨论则指向tile和系统层面更多的编排。Ali认为下一前沿的“无聊答案”是更快的NIC:如果消除今天KV cache搬运的两阶段流程,在理论最佳情况下,分离式解码速度可能提升接近 100X。

  • 开放视频推理首先受模型质量约束,而不是价格约束。 Ali表示,一部$10的开放模型电影仍可能输给$1,000的闭源模型结果,因为Wan 2.2与Kling或Veo之间仍是“天壤之别”。480p、16 FPS的5秒视频,在压缩后约有 35,000个latent token,之后还要面对二次注意力;稀疏注意力会损害质量,而当前自回归视频质量很差,拼接扩散片段也会出现明显漂移。

  • 推理已经开始优化自身。 一个Claude Code harness中的GLM-4.5 endpoint被用来检查profiling trace、定位SGLang瓶颈、为GLM-5.2编写替代GPU kernel、重新profiling,并打包最终image。因此,在这套循环的驱动下,为GLM-5.2提供服务的部分kernel实际上由GLM-4.5编写。需要强调的是,模型仍会reward-hack并做出糟糕决策,但从实时推理到后训练、A/B测试和部署的闭环,已经从研究构想走向生产架构。

精读

上游暂未提供,后续同步将继续补齐。