先锋 趋势 方法 投研 作者
Google 的 Gemini 3 已发布:特别提前体验
返回节目精读

Google 的 Gemini 3 已发布:特别提前体验

摘要

  • Gemini 3 Pro 最明确、可量化的跃升出现在 Humanity’s Last Exam,得分从 Gemini 2.5 Pro 的 21.6% 升至 37.5%。 Google 表示,新模型在十多个基准测试中都取得了类似幅度的进步,Josh Woodward 则提到它“突破了 LMArena 的 1,500 Elo”。Roose 转述了 Google 的绝对化宣传:凡是 ChatGPT、Claude 或旧版 Gemini 能完成的事情,在这里都应该完成得更好。
  • Google 正试图把交互界面从聊天机器人的回答,推进到按需生成的软件。 Gemini 3 可以把一个请求变成定制界面,比如交互式 Vincent van Gogh 教程或房贷计算器;目前正在测试的 agent,则被设计用来整理收件箱并拟写回复。Casey Newton 的保留意见是:这款 agent 的展示只有“几张动图”。
  • 分发能力的重要性可能不亚于模型质量:Gemini 3 本周将在 Gemini app 和 Search 的 AI Mode 上线,也会面向开发者进入多个产品,但还没有接入 Docs 或 Gmail 集成。 Demis Hassabis 表示,Google 的目标是达到“成本与性能的 Pareto 前沿”,因为 AI Overviews 等产品必须服务数十亿用户。Kevin Roose 面向投资者的推论是,Google 能部署前沿能力,而不至于让服务器“融化”。
  • Gemini 3 并没有缩短 Hassabis 对 AGI 的 5至10年预测。 他称进展“完全按计划推进”,但仍预计还需要“再来 1到2次”突破,同时继续改善推理、记忆和世界模型,Simmer、Genie 等项目都属于这一方向。他承认规模化可能面临回报递减,但仍能带来“极其丰厚的投资回报”。
  • Hassabis 驳斥了“Google 正在简单赢下竞争”的叙事,认为进展速度比暂时领先更重要。 他称 Google DeepMind 是公司的“发动机舱”,其 AI 工作不仅覆盖 AI-first 产品,也正在进入 Search、Maps、YouTube、Android、Workspace 和 Gmail。Google 的庞大用户基础,为 Alphabet 提供了多条获取使用量和近期收入的路径。
  • Hassabis 看到的是选择性的 AI 泡沫,而不是整个行业的幻象。 对于几乎“一无所有”的团队拿到“数百亿美元级”的种子轮融资,他认为确实带有泡沫特征;但他也看好大约 6至12个从零起步的业务,涵盖机器人、游戏、药物研发和 Waymo,有望成长为“数千亿美元级的超级企业”。他的投资组合判断是:无论行业继续扩张还是投资退潮,Alphabet 都应处于赢家位置。
  • 更强的工具调用和函数调用能力提升了编程与推理表现,也放大了网络安全风险。 Hassabis 称 Gemini 3 是 Google “经过最全面测试”的模型,测试覆盖内部工作、外部测试人员和安全研究机构。Josh 将产品定位为工具,并提议衡量“我们一天帮你完成了多少项任务”,而不是把重点放在陪伴关系上。

精读

1. Gemini 3 的基准测试跃升,必须转化为切身可感的效用

  • Roose 给出的核心数字是:Gemini 2.5 Pro 在 Humanity’s Last Exam 上的得分约为 21.6%,Gemini 3 Pro 则达到 37.5%。Google 提供了十多个基准测试,显示新模型“轻松击败旧模型”。

  • Woodward 强调了“突破 LMArena 的 1,500 Elo”,但也称基准测试只是代理指标。最终真正重要的是用户满意度,而 Google 发现,这两项指标“仍在朝同一个方向变化”。

  • Newton 的反驳值得保留:普通聊天可能已经基本解决,用户反而无法提出一个能暴露前沿模型优势的请求。Woodward 的回答是更简洁、更清晰的呈现;Hassabis 则强调可靠性、更令人愉悦的风格,以及 vibe coding 体验的“跃迁”。

2. 生成式界面把答案变成一次性软件

  • Woodward 表示,Gemini 3 可以跨越多个步骤进行推理而不丢失思路,同时特别介绍了新的生成式界面。Google 展示的案例包括交互式 Vincent van Gogh 教程,以及一套用于购买超过 100万美元房屋的房贷计算器。

  • 编程获得了“大量投入”,Google Antigravity 被拿来作为展示案例。Hassabis 称,前端开发和 vibe coding 的表现已经越过“有用性门槛”,甚至足以让他在圣诞节期间重新投入游戏编程,做一些项目。

  • 正在测试的 Gemini agent,目标是检查收件箱、整理相关邮件并拟写回复。Newton 很感兴趣,但也明确指出证据有限:简报只展示了“几张动图”。

  • Gemini 3 本周将登陆 Gemini app、Search 侧边栏中的 AI Mode 以及面向开发者的产品。Google 没有给出将 Gemini 3 接入广泛使用的 Docs 或 Gmail 集成的时间表。

3. Google 的分发机器正在成为竞争核心逻辑

  • Gemini 3 进入 Search,让 Roose 认为 Google 有能力以经济可行的方式、在极大规模上提供这一模型。Hassabis 表示,面对 AI Overviews 这类“极端使用场景”,效率和蒸馏是必需品,Gemini 3 时代的其他家族模型也在开发中。

  • 当被问及 Google 是否重新夺回领先地位时,Hassabis 拒绝了这一表述:在一个“极其惨烈”的竞争市场里,“唯一重要的事情就是你的进展速度”。当前的工作,是把 Google DeepMind 的研究转化为产品,让实验室继续充当 Google 的“发动机舱”。

  • 这套发动机舱战略覆盖 Gemini、NotebookLM、Maps、YouTube、Android、Search、Workspace 和 Gmail。Newton 提供了一个令人不适但重要的反面观察:AI Overviews 似乎正在提升 Google 的使用量和收入——“对整个互联网的其他部分并不奏效,但对 Google 奏效”。

  • Google 还向美国大学生提供 1年免费的付费 Gemini 使用权。它反复强调的“学会一切”,在主持人听来像是对做作业的委婉说法,也像经典的“第一口免费”获客策略。

4. AGI 仍需要规模化之外的突破

  • Hassabis 对 AGI 的 5至10年预测没有变化:Gemini 3“完全按计划推进”,并没有带来意外加速。要实现稳定的通用智能,可能仍需要“再来 1到2次”突破,同时改善推理、记忆、世界模型和物理智能。

  • 他对规模化的回答,拒绝了“指数级进展或完全没有进展”的二元选择。他表示,回报可能递减,而不是每个时代都翻倍;但规模化仍然“非常值得做”,持续投入依然会产生“极其丰厚的回报”。

  • 工具使用体现了能力与风险的绑定关系。更强的函数调用能力会改善编程和推理,但也会让模型更擅长“网络安全这类更高风险的事情”,因此必须与安全研究机构和外部测试人员一起谨慎测试滥用风险。

5. Alphabet 同时为 AI 繁荣与退潮做好准备

  • Hassabis 强调这是“严格来说只是我个人的看法”:只有 AI 行业的部分领域存在泡沫。优秀团队在“几乎一无所有”的情况下拿到“数百亿美元级”种子轮融资,可能是早期预警,但这并不否定技术本身的价值。

  • 从更长期看,他认为机器人、游戏、Isomorphic 的药物研发和 Waymo 等领域,可能诞生 6至12家“数千亿美元级的超级企业”。更近期的回报,则可能来自重组已有的数十亿用户产品,以及云收入和 TPU。

  • 这套投资组合逻辑有意保持双向暴露:Alphabet 希望从行业持续扩张中获益,但 Hassabis 认为,即使市场退潮,公司也会处于“最有利的位置”。如果要找一个眼下的消费端抓手,Woodward 选择了基于自拍的图像编辑;Roose 的结论更直接:“Nano Banana 会拯救感恩节晚餐。”