先锋 趋势 方法 投研 作者
(预览)Google开始起舞:Gemini周的赢家与输家,OpenAI面临广告难题
返回节目精读

(预览)Google开始起舞:Gemini周的赢家与输家,OpenAI面临广告难题

摘要

  • Gemini 3 在基准测试中的横扫,确实验证了 Google 的回归,但不能证明每位用户都会体验到最强模型。 Ben Thompson 的基本判断是,这些分数“总体上是准确的”,因为 Google 拥有最终胜出所需的资源、经验和一体化技术栈;但他仍表示,自己既没有立场,也没有资格认证谁是“业界最佳”。

  • Anthropic 成为本周另一大赢家,因为编码是 Gemini 唯一没有领先的基准项目。 Thompson 认为,Anthropic 自他判断的 Claude 3.5 时代起建立的优势,持续得出人意料;Andrew Sharp 则说,这种优势“暂时构成护城河”。

  • 当团队可以针对测试进行优化、甚至作弊时,基准排名就很难解读。 Thompson 以 Llama 4 的专项版本为例:通过基准测试博弈来掩饰平庸模型,意味着“该有人掉脑袋了”。一位朋友对 Google 官僚主义倾向的概括是,它“围绕基准测试打造产品”,现实世界的翻译能力究竟如何,仍未有答案。

  • Google 的战略武器不只是 Gemini 3 的质量,还有一套可能长期低于竞争对手的 TPU 成本结构。 模型与芯片协同设计、更便宜的专用硅片,以及不必让 NVIDIA 抽取利润,叠加 Google 庞大的现金流,形成了 Thompson 所说的“相当具有毁灭性”的组合,不过其中部分规模化收益目前仍停留在理论层面。

  • ChatGPT 的装机量可能像 Windows 的生态一样,削弱技术上更强的 Gemini 对用户的吸引力。 Thompson 提到 ChatGPT 有8亿或9亿用户,但随后表示,别引用他关于这个数字究竟对应周活、月活还是日活的说法。两人都强调,改变用户习惯比争夺一块尚未形成的市场更难:“即便 Gemini 更好”,ChatGPT 也已经足够好,而且用户足够多。

  • 发布周的热度,正在超过用户辨别模型差异的能力。 Thompson 自己对比时,ChatGPT 在 UniFi 带宽控制和火鸡盐水腌制时长上都胜过 Gemini,后者还漏掉了至关重要的晾干表皮步骤;这些例子虽属个案,却说明了判断模型差异的难度,也呼应了 Sharp 对 iPhone 的类比:产品在持续进步,但越来越稳定,也越来越不惊艳。

精读

1. Gemini 3 终于让 Google 按自己的节奏起舞

  • Sharp 以2023年的几句挑衅为 Gemini 3 定调:Altman 担心一个“慵懒的搜索垄断者”,Nadella 则希望这个“800磅重的巨兽”起舞,还希望外界记住是他让它跳起来的。Pichai 当时温和回应,不要“随着别人的舞曲起舞”;如今这句话已经变成 Google 逆袭叙事的一部分。

  • Thompson 认为,基准测试的问题首先是感知问题:对很多用户而言,AI 已经足够好,差异反而越来越难以察觉。“向下看比向上看容易”,而模型可能很快就会让几乎所有人都只能仰望,却无法可靠判断彼此的智力差距。

  • 模型能力依然“非常尖刺化”:它可能在一个领域表现出色,在另一个领域产生幻觉,也可能明显从 Reddit 抽取内容。因此,Thompson 觉得 AI 最有意思的地方,一是没有标准答案、创造力有价值的任务,二是正确性可以客观验证的任务。

2. 编码让 Anthropic 保住领先,也暴露了基准博弈

  • 在这套被报道的测试中,Gemini 领跑了除编码以外的所有基准项目,编码仍由 Anthropic 占据第一。Thompson 认为,Anthropic 在 Claude 3.5 左右发现了某种“让所有人都大吃一惊”的东西,形成了出人意料且持久的领先,因此成为“本周最大赢家之一”。

  • 编码尤其具有信息量,因为“代码必须能跑”:要么编译成功,要么失败;要么抛出错误,要么不抛出。这种可验证性既支持可信的测量,也支持强化学习循环——通过测试模型输出,再持续改进后训练。

  • 公开基准测试很容易被扭曲。Thompson 提到 Llama 4 的专项版本,并批评任何“通过作弊掩饰失败”的团队:底层模型平庸本身已经是一个问题,但“失败”加上“掩盖失败”,就意味着“该有人掉脑袋了”。

  • Google 的问题更隐蔽。一位朋友曾把它的官僚主义弱点概括为围绕基准测试打造产品——“你测量什么,就会得到什么”——因此 Gemini 的高分可能代表真实优势,也可能只是 KPI 优化。Thompson 的态度不是直接否定,而是继续放回现实世界里使用。

3. 日常任务刺破发布周叙事

  • Thompson 对模型的使用偏好已经随着实际体验发生变化:Grok 4 曾让他觉得是“一次巨大跃进”,但浏览器摩擦和疑似下滑的质量又让他回到 ChatGPT,后者在他看来反而一直在变好。他看重的是持续的实用性,而不是发布周的兴奋感。

  • 在一个 UniFi 网络问题上,Thompson 说 ChatGPT 解释了如何用服务质量策略限制访客带宽,随后提醒软件处理可能拖慢整个网络。Gemini 漏掉了这个选项,转而建议使用独立接入点,并通过100Mbps路由器或交换机连接——“第一,这个答案就很离谱。”

  • Thompson 认为,火鸡料理是一个他愿意相信自己真正擅长的领域。在他的对比中,ChatGPT 覆盖了解冻、湿盐水腌制,以及让火鸡裸露放置以晾干并烤脆表皮;Gemini 开始得太晚,也跳过了晾干步骤,意味着最后会得到湿软的表皮。“你要是想谈什么叫动摇信心,这就是。”

  • Sharp 的反驳是,这些发布越来越像成熟期的 iPhone:曾经令人震撼的跃进,如今变得更稳定,也“没那么性感”。Thompson 表示同意,但补充说,Google 不仅拥有强势的逆袭叙事,也有充分的结构性理由让人相信它最终会在技术上领先。

4. TPU 经济学把 Gemini 的质量优势变成更大的威胁

  • Thompson 原本就预计 Google 最终会造出最强模型:它研究这个问题的时间最长,拥有巨量资源,还掌握完整的一体化技术栈。Google 发明了 Transformer,但 OpenAI 更模块化的 Azure/NVIDIA 架构仍然先行一步;如今 Gemini 为 Google 的一体化路线提供了重要验证。

  • TPU 的可编程性不如 GPU,但结构更简单,制造成本也更低。Google 可以协同设计训练架构与芯片,围绕 TPU 的能力做架构选择;Thompson 将单体模型与 mixture-of-experts 系统放在一起比较,指出两者在通信和扩展能力上各有取舍。

  • 新一代 TPU 设计可能支持在不同系统或设施之间实现更强的扩展能力,但 Thompson 并没有声称 Gemini 3 已经验证了这一具体能力。此次发布真正验证的是,Google 的模型团队与硬件团队之间的协同“正在产生回报”。

  • 经济层面的结果,可能是一种“可持续的成本优势”:Google 不必支付 NVIDIA 的利润,使用更便宜的芯片,即便有 Broadcom 协助,也仍能保留大部分核心诀窍。再加上 Thompson 所说“前所未有地强”的现金流,Sharp 的总结就很明确了:现金比几乎所有公司都多,成本还有可能比所有人都低。

5. ChatGPT 的装机量可能压过 Google 的一体化优势

  • Thompson 纠正了 Windows 与 Mac 的标准历史叙述:DOS 及其软件生态早于 Mac 出现,而 Windows 继承了与这套装机基础的兼容性。Mac 更早引入图形界面,也可能是更好的产品,但 Windows 实际上先占据了具有经济决定性的那一层软件。

  • 这段历史也修正了“一体化系统总会输给模块化系统”的简单结论。消费市场奖励一体化,因为用户就是买单的人,而且“用户体验的质量没有上限”;企业采购则让表格和组织约束拥有更大影响力,即便 SaaS 已经推动了自下而上的采用。

  • AI 并不是从零开始。Thompson 提到 ChatGPT 有8亿或9亿用户,但紧接着表示,别引用他关于这个数字究竟是周活、月活还是日活的说法。迁移这些用户比争夺一块尚未成形的市场更难,Gemini 只是在体验上略胜一筹,未必足以改变行为。

  • Sharp 的反驳值得保留:Google 真正的胜利,可能是守住 Search,同时做大 Cloud 和 YouTube,而不是把 ChatGPT 用户全部转化过来。Thompson 最后的类比也认同这一点:消费级 AI 可能会重演 PC 时代——一体化的 Mac“更好,但这并不重要,因为所有人已经在用 Windows”。