第011期 - GPT 5.5 对决 Claude 4.7:OpenAI 绝处反攻(Tokenomics)| Jordan Nanos、Dylan Patel、Doug O'Laughlin、Max Kan
第011期 - GPT 5.5 对决 Claude 4.7:OpenAI 绝处反攻(Tokenomics)| Jordan Nanos、Dylan Patel、Doug O'Laughlin、Max Kan
摘要
- GPT-5.5 让 OpenAI 重新回到牌桌,此前一段时间被 Max Kan 形容为「实在太惨」。 凭借 Opus 4.5 在编码和智能体能力上的跨越式提升,Anthropic 在4月上中旬按同口径收入反超 OpenAI(泄露数据显示,Anthropic ARR 约190亿美元,而 OpenAI 年初约240亿美元);GPT-5.4 则「说实话就是个笑话」,发布说明甚至没有拿它与 Opus 做比较。GPT-5.5 重回前沿,但还不能说「确定优于」Opus 4.6/4.7,尽管 Twitter 舆论机器在发布日极力推动这一说法。
- Dylan Patel 的发布日历是:「两周内大家都会发布」——Google 和 OpenAI 确定在列。 「Spud」(5.5)在预训练尚未完成时就出货了,下一次发布预计会补完预训练并加入更多 RL;Google 的版本则预计「基本就是」一次多模态替换。
- Fast 模式的速度溢价正在衰减,但价格仍为 6x:Opus 4.6 fast 的加速倍率已从 2.5x 降至不足 2x(90→70 tok/s,而未变的基准速度为 35–40 tok/s)。 这却是 SemiAnalysis 工程师第一次选择更快的 token,而不是质量更高的 token;Jordan Nanos 的判断是,「对现在的用户来说,4.7 的质量相较4.6并没有实质提升」。
- Token 定价开始让连重度专业用户都用不起。 Dylan 表示,团队「快要用不起」这种价格;Mythos 的报价含义不明,可能是25美元/150美元,也可能是25美元/125美元,而 Opus 为5美元/25美元;Doug 将其概括为约5倍,fast mode 还要再叠加6x。Doug 花800美元用 AI 抓取数据,而同样任务通过数据增强 API 只需55–100美元,这就是警示案例;成本增长来自新任务(Jevons 效应),而不是旧任务涨价。
- Doug 对前沿模型定价的结构性看空逻辑是:Opus 4.5 可能已经跨过了一道门槛,日常任务多数无需监督即可一次完成。 如果在「可能不到一年」的时间里,100–200B 参数规模的模型就能达到 GPT-5.5 级别的智能,可能大多数人都不再需要前沿级智能。
- 基准测试已经退化成「确认模型不是彻底垃圾的体感检查」。 Humanity’s Last Exam 是晦涩的选择题;SWE-bench 则从 GitHub 抓取 issue,再用实现范围明确的单元测试评估。同时,4.7 的新 tokenizer 可能让相同输出的成本增加35%;而团队内部的「说真话」版本——「Opus 4.7 其实就是 Sonnet」——则说明了这个模型散发出的体量感有多小。
- Dylan 直截了当地说,中国开源模型与美国的差距又在扩大——背后是算力约束。 中国前沿模型的权重恰好能塞进8x H200 pod 的内存域,Ascend 内核只能部分支持 DeepSeek V4 推理;Max 预计 Meta 虽然目前落后、但正在签下巨额算力合同,到 H2’26 或 H1’27 将「甩开所有中国团队」。
- 形态之争正在进行:Dylan 称 CLI 是「注定消亡的遗物」,认为 OpenAI 的 app 才承载真正的智能体编排愿景;Max 则反驳:「一切最终都是 CLI。」 纯 maxi 派愿景。Dylan 从 Tri Dao 的群聊里引述了一套 kernel 开发流程:先让 Codex 写,再让 Opus 修正粗糙部分——「顺序不能反过来」,尽管「公司里其他人其实都更喜欢反过来」。
精读
1. GPT-5.5 将 OpenAI 从悬崖边拉回;Anthropic 收入曾反超
- Max 对自己在 SemiAnalysis 发布的首篇文章作出的总结是:The Information 泄露的数据显示,Anthropic ARR 约190亿美元,而 OpenAI 年初约240亿美元;即便不考虑超大规模云厂商采用净额还是总额确认收入的差异,Anthropic「在4月上旬至中旬按同口径计算明显超过了 OpenAI」。核心驱动是 Opus 4.5 在编码和智能体能力上的「真正跨越式提升」:从11月底到4月初,「所有人基本都在用 Opus 4.5、4.6 疯狂跑各种工作负载」。
- GPT-5.4 的结论毫不留情:「说实话就是个笑话」——它的发布说明只与 OpenAI 过去的模型比较,没有拿 Opus 做对照。「这基本已经说明了一切。」到了5.5,Opus 又回到了对比表里,OpenAI 也「重新回到前沿」;但它并不能说确定优于4.6/4.7,尽管 Twitter 舆论机器在发布日期极力推动这一说法,不过「肯定重新回到了牌桌」。
- Dylan 给出的后续发布日历是:「两周内有新版本……Google、OpenAI,也可能 Anthropic。」Spud「有点像预训练根本没做完就直接发布了」,所以接下来大概率是先完成预训练、再进行更多 RL,然后推出新版本;Google 的版本则「基本就是一次多模态替换」。
2. Fast mode:速度溢价正在衰减,且这是首次有人为速度牺牲质量
- Doug 已经没法持续使用 Codex:「使用上限每天都把我硬生生卡住,兄弟。」团队一致认为,OpenAI 的 fast mode「相当于障眼法」:推理深度被削弱,但速度并没有明显提升。Jordan 的分类是,priority mode 收取约2x溢价,买到的是 SLA,而不是更快的交互;5.3 Codex Spark 则「完全是障眼法,那就是另一个模型」。
- Jordan 给出的 Opus 数据显示,4.6 fast 上线时单用户速度约为90 tok/s,普通模式为35–40 tok/s;现在 fast 约70 tok/s,而普通模式仍未变——「花6x的价格,速度甚至不到2x」。
- 用户行为已经说明问题:这是 SemiAnalysis 工程师第一次宁愿选择速度,也不愿购买质量更高的 token。Jordan 的解释是:「对现在的用户来说,4.7 的质量相较4.6并没有实质提升。」
3. 代币经济学:被价格挤出,以及前沿智能是否真的必要
- Doug 通过 OpenAI 与 Cerebras 的交易提出结构性看空逻辑:如果 Opus 4.5 已经跨过一道关键能力门槛,许多日常任务无需监督就能一次完成,那么即便 Cerebras 永远无法运行大于约100–200B 参数的模型,它也可能「不到一年」就获得 GPT-5.5 级别的智能。届时,大多数人可能不再需要前沿级智能。
- Dylan 表示,SemiAnalysis「快要用不起」Mythos fast。Dylan 估算 Mythos 的价格可能是25美元/150美元,也可能是25美元/125美元,而 Opus 为5美元/25美元;Doug 认为大约贵5x,fast mode 还要再叠加6x。Doug 说目前的支出「还算合理」,「但如果再翻倍……我们可能得关掉 fast mode 了,伙计们」——「毛利率很重要」。
- Doug 对成本的关键判断是:「我不认为新模型完成同一个任务会更贵……问题在于,你会拿它去做新的任务。」他还认为,如果 Mythos 的 token 效率更高,那么对很多任务来说,Mythos fast 可能比4.6 fast更便宜。Max 说:「这就叫 Jevons 效应,老兄。」最令人沮丧的未来,是用户不得不先问自己:「这个任务真的值得支付 Mythos fast 的 token 价格吗?」
- 几个样本很能说明问题:Max 用 Opus 4.6 fast 在 DigitalOcean 的 droplet 上搭建基准测试,烧掉了约400美元;Doug 用800美元 token 抓取10,000份员工资料,而同样的数据通过数据增强 API 只需55–100美元——「我只是试图用 AI 把整个海洋煮干」。随后节目用《Rick and Morty》收尾:「你的用途是什么?」「把黄油递给我。」
4. 4.7 与 4.6 打平,基准测试也无法裁决
- Doug 的体感是,指令遵循「客观上变差了」:模型会漏掉 CLAUDE.md 中的指令和 skills,还总是在收工:「今天已经做了很多,去享受你的周末吧。」他明明是在周一使用,于是回了一句:「回去工作。」他的理论是,推理优化叠加用户数增加10–100x,正在拖累体验——「那是4.6的黄金时代,当时还没量化……还没被削弱。那段日子真好。」他的解决方案是:「我需要一款 NIMBY 前沿模型。」
- Doug 认为基准测试无法解决争议:接近前沿是必要条件,但「基准排名第一,不一定意味着你就是最好的模型」;如今它们只是「确认模型不是彻底垃圾的体感检查」。HLE 是「你见过的最晦涩的选择题」;SWE-bench 则从 GitHub 抓取并不具备清晰任务边界的 issue,单元测试还会要求模型输出特定的20词错误信息,而提示词里从未提到这一点。
- Jordan 梳理了4.7的变化:在 high 和 max 之间新增 extra-high 推理档位,支持高分辨率图像,思考过程默认隐藏,加入任务预算,以及词表扩大35%的 tokenizer——这可能使相同输出的成本增加35%。节目中打盹后醒来的 Dylan 反驳说,更大的词表应该压缩输出;Jordan 在概念上承认这一点,但表示实践中4.7的 token 效率反而更低,并追问:如果4.7没有明显变好,为什么要换 tokenizer?
- Doug 说:「我不认为 Anthropic 真会做半成品模型,OpenAI 显然会。」5.3 Codex 就只在代码上做了 RL。真相派的判断是:「Opus 4.7 其实就是 Sonnet,老兄。」Dylan 又补了一句:「而且 Opus 4.7 是 Mitas。」——「这个模型一闻就是小模型。」
5. DeepSeek V4 与中国的算力高墙
- 节目的诱导性问题是:由于算力约束,中国与美国之间的开源模型差距是否又在扩大?Dylan 的完整答案只有一个字:「是。」
- 记录重点提到,V4 支持1M token 上下文,而 Kimi 只有256K,这可能成为长周期智能体任务的优势;此外,曾发布后又撤下的「Reasoning in Visual Space」代码库,也可能暗示多模态版本的存在。但同一位嘉宾也承认,与他们「经常拿来处理各种杂事」的初代 DeepSeek 不同,这一版他们实际上并不怎么用。
- Doug 说,这次没有出现让人惊掉下巴的时刻:「它发布了,只是当前开源水平的代表」,并没有明显优于 Kimi K2.6。真正的新闻在推理优化:如果 Ascend 内核能够部分支持它的推理,「将首次真正为中国解锁更多算力」;同时,它的权重恰好能塞进8x H200 pod 的内存域,而当前 SOTA 没有更大的模型在提供服务。「很明显,他们开始撞上某种算力高墙了。」
- Jordan 认为 DeepSeek 的工程实现很有意思,重点在于注意力机制变体和 KV-cache 压缩;Doug 则质疑更长上下文的实际价值:即使 Opus 把上下文从256K扩到1M,质量也「烂得不行」,而上下文压缩过程非常痛苦。
- Max 对行业斜率的判断是:目前 DeepSeek/Kimi「可能领先」Meta、Grok、Cursor 和 xAI,但算力是关键投入;Meta 正在签下巨额算力合同,也已经消化了先裁员、后重招的包袱。他预计 Meta 会在 H2’26 或 H1’27「甩开所有中国团队」。撇开蒸馏不谈,Dylan 表示 Mistral 蒸馏的是中国实验室的模型,而不是 Anthropic 的模型。
6. CLI 对 app:创新者困境,还是纯 maxi 派愿景
- Dylan 的激进判断是:Anthropic 把 CLI 做成了创新者困境的极致——「CLI 是死路,是 H1’26 和 H2’25 注定留下的遗物」;而 OpenAI 的 app 才承载着「真正的智能体编排平台愿景」,包括语音和多模态能力。Max 另行提到,Codex app 正在加入生成式 UI。
- Max 的极致派反驳是:操作系统甚至不必存在——只要有硬件、终端和 Claude API,就能替你搭出操作系统。「一切最终都是 CLI。纯 maxi 派愿景。」他认为 Claude Code「显然只是 CLI 的封装」,而 Codex CLI「显然只是 app 的封装」。Jordan 则是 VS Code 插件派:「别指控我在读代码。」
- Dylan 在研究高性能 kernel 的群聊里讲了 Tri Dao 的一则轶事:Codex 不聪明,但会直接实现;Claude 则会在小众微架构细节上反复兜圈。所以流程应该是「让 Codex 写,再让 Opus 修。顺序不能反过来。」Max 回应:「其实公司里其他人都更喜欢反过来。」Dylan 说:「我们又不是在写他妈的 Tri Dao kernel。」
7. 长上下文、压缩与假新闻式前沿
- 对上下文压缩,Doug 的态度非常明确:「压缩糟透了……去他的压缩。」还不如清空上下文、重新开始。Jordan 指出,DeepSeek 3.2 论文也得出了完全相同的结论:在他们测试的任务上,超过上下文窗口后,彻底清空的效果甚至优于总结。
- Llama 4 Scout 当初宣布的10M token 上下文为什么还没人真正发布?Dylan 说:「从1M到10M上下文,我到底有什么对下一个 token 生成有用的数据?少得可怜。」同样的数据荒地,也让250K–1M的上下文「反正都是垃圾」,即便是 Opus 也一样。
- 当天走红的创业公司 SubQ 遭到 Max 的评价:「极度、超级、离谱地可疑。」如果真的存在 KV-cache 突破,「内存股今天应该暴跌 10^15%」;而且「我就是不相信这帮人会解决整个 AI 领域最难的问题」。Dylan 的模式匹配是:每次去亚洲,都会冒出一篇美国研究人员从未听说过的 KV-cache 缩减论文;TurboQuant 已经是假新闻。
- 但 Jordan 对市场的判断仍然成立:「资本多得超过了机会。」Dylan 认为 SubQ 可能以10亿美元估值融资5000万美元。
8. 收尾观点
- Jordan 称 Claude Code 是「2026年2月的拐点」,并表示 Doug 在5月的胜利巡礼已经完成。Dylan 希望下一个拐点能更令人兴奋。