先锋 趋势 方法 投研 作者
突发:Gemini 2.0 Flash上线——与Logan Kilpatrick深入聊Google DeepMind最新发布
返回节目精读

突发:Gemini 2.0 Flash上线——与Logan Kilpatrick深入聊Google DeepMind最新发布

摘要

  • Google已将更新后的Gemini 2.0 Flash投入生产环境,输入价格为每百万token 10美分,输出价格为每百万token 40美分。 付费版Flash默认配额为每分钟2,000次请求、400万token,更高档位可达每分钟10,000次请求和1,000万token。Logan Kilpatrick预计,DeepMind与产品的更紧密整合,将通过让组织从模型创建到部署实现“端到端”,同时加快研究和产品进展。

  • Gemini最强的商业切入口,是面向Bolt.new、Cursor等文本生成应用产品的低价编程智能,Lovable和v0也可能采用。 Kilpatrick将每月在LLM上支出约4万-5万美元的初创公司,与预计1,000美元或更低的Flash账单作对比,称这意味着“成本降低40倍”;他认为,成本下滑尤其会赋能没有顶级VC支持的开发者。Google的高端目标仍然明确:“我们会在Google做出世界上最好的编码模型”(“We’re going to have the world’s best coding model at Google”),Pro和推理模型预计将承担这一任务。

  • Flash-Lite主要是为了守住Google的低价定位,Pro则服务于能力优先的实验。 Flash-Lite维持1.5 Flash每百万token 7.5美分的价格点,也不支持原生图像或音频生成等昂贵功能;Nathan Labenz质疑,从7.5美分涨到10美分是否真能改变一门生意。Kilpatrick基本认同,同时承认保持价格连续性,也能避免“Google在给开发者涨价”成为市场叙事。Pro的价格当时尚未公布,因为它仍属实验性产品;但Kilpatrick预计,其定价会沿袭此前的Pro模型,明显更贵。

  • 多模态Live API指向持续存在的AI“共在”,但当前的经济性和架构仍将单次会话限制在10分钟。 使用反馈涵盖编程辅助,也包括盲人尝试应对日常生活。另据Labenz介绍,他曾用Advanced Voice Mode带家人玩Mario 64。Kilpatrick预计,在常驻助手实现规模化之前,成本、记忆、状态和上下文都还需要持续迭代,但他认为这一方向“非常明确”(“very clear”)。

  • 长上下文与推理结合后,可能比即时生成答案更能释放实际价值。 Kilpatrick表示,100万或200万token的窗口可以回答涉及少数相关事实的问题,但综合“1,000件不同的事情”仍然困难;推理能力可能让模型真正处理这些材料,并最终通过工具调取和传递信息。原生图像和音频输出则提供了另一条路径:专业图像模型在某些领域可能仍保持更高质量,但Gemini可以牺牲部分画质换取世界知识,解锁此前那些“并不聪明,只是擅长生成图像”的模型无法覆盖的场景。

  • Kilpatrick对初创公司的判断,集中在视觉语言系统、具备推理能力的智能体、面向智能体的互联网基础设施和更好的评测体系。 他认为,垂直领域的计算机视觉技术栈仍处于“待争夺”状态;未来2年,推理能力将让更多目前脆弱的智能体产品真正可用;而当非人类访客成为常态,网站将需要新的保护、归因和价值捕获机制。评测问题依然棘手:基准测试泛滥掩盖了模型选择,而即使是成熟团队,也很难把品味转化为可重复的测试——“生活中的大多数问题,最终都会变成评测问题。”

精读

1. DeepMind如今覆盖从模型到产品的完整闭环

  • Kilpatrick加入Google已有10或11个月,从第一天起就看到了DeepMind内部的紧密协作。此后,组织逐步从基础研究走向生产落地:Gemini app已经转入这一体系,过去3个月内,AI Studio和Gemini API也加入了同一项更大的工作。

  • 他对新架构的描述高度一体化:DeepMind如今“端到端完成研究、创建模型,再真正将它们带入Google内部的产品”。减少研究人员与产品开发之间的摩擦,应能让新模型的能力更容易转化出来。

  • 对于不关心Google组织重组的外部人士,Kilpatrick给出了一个具体检验标准:这项变化应该带来“模型进展的加速”和“产品进展的加速”。Labenz从外部观察到,两者似乎都已经在提速。

2. 低价编程智能扩大软件创造市场

  • Kilpatrick最看好的新兴用例,是文本生成应用。Bolt.new刚接入Gemini,Cursor正在使用2.0 Flash;随着非程序员越来越多地通过提示词创建基础的领域专用软件,他希望Lovable和其他开发者也跟进。

  • Labenz把这一变化称为“软件超新星”:没有编程技能的人,现在也能做出像样的基础全栈应用,尽管企业级平台仍然超出他们的能力范围。关键转变在于,软件开始由那些从未打算成为开发者的人创造,而不再只是获得编程辅助。

  • 成本差异推动了这一机会。Kilpatrick见过一些初创公司每月在LLM上支出约4万-5万美元;他估计,类似规模的Flash使用量可能只需1,000美元或更低,“就像成本降低了40倍”。他表示,Google会继续提升Flash的能力,同时限制大幅涨价。

  • 但低价智能并不会让所有公司同等受益。Kilpatrick认为,资金充裕的YC初创公司可能几乎感受不到又一次降价;相比之下,个人开发者可以开始尝试过去只有获得数百万美元融资的团队才做得起的用例。

3. 实时多模态正在变成AI共在

  • 多模态Live API支持视频、音频和文本之间的协同实时交互,指向Kilpatrick所说的“共在”——助手能够看到用户所看到的内容,并与用户并肩互动。使用反馈涵盖编程辅助,也包括盲人处理日常生活。

  • 另据Labenz介绍,他曾在玩Mario 64时和孩子们一起使用Advanced Voice Mode:孩子们找不到星星时,他就展示或描述关卡,再询问应该往哪里走。甚至他1岁的孩子也开始伸手拿手机“和AI聊天”。

  • Kilpatrick提醒,目前的系统仍处于早期阶段。由于持续共在的成本很高,单次会话被限制在10分钟;要实现规模化,还需要改善记忆、状态,以及贯穿用户此前展示或讨论过的一切内容的上下文处理。

  • 这类似于文本LLM的发展:它们大约用了1年半,就从“有点像玩具演示”发展到支持10亿用户规模的应用。他预计,共在也会沿着类似路径迭代;而关于AI产品只是低价值套壳的说法,也会继续被证明是错的。

4. 推理能力可能释放长上下文的真正价值

  • 长上下文已经可以用于生产环境,Kilpatrick认为,20万token与100万或200万token之间的差异可能很重要。瓶颈在于注意力:询问少数项目效果很好,但要跨整个窗口整合“1,000件不同的事情”,仍然困难。

  • 他逐渐形成的假设是,推理能力能够补上缺失的那一层。能够处理海量上下文、并最终通过工具将信息调入调出的模型,或许可以把长上下文从令人印象深刻的容量,变成真正实用的能力放大器。

  • Kilpatrick建议在AI Studio里直接做实验:在对比模式下,分别用2.0 Pro和推理模型处理同一个长上下文任务。他的直觉——明确强调这还不是定论——是“额外的推理步骤确实会带来差异”。

  • Gemini仍能原生处理视频、音频和图像,原生图像与音频输出也已向早期测试者开放。Imagen 3原定于录制次日接入API;专用生成器在某些领域可能仍保持质量优势,但Gemini的世界知识可以支持一些更漂亮、却知识更少的模型无法胜任的用例。

5. 视觉语言模型可能压缩垂直计算机视觉技术栈

  • Labenz问道,Flash的低成本是否足以支持被动监控:工厂安全、违规行为,或帮助那些不喜欢佩戴报警设备的老年人进行跌倒检测。这类工作负载可能吞噬海量token,对应Kilpatrick此前提出的“每天在Flash上花1美元”。

  • 结合自己过去作为机器学习工程师的经历,Kilpatrick回忆说,传统安防摄像头系统很难跨不同摄像头帧追踪同一个人,并维持目标持久性。视觉语言模型在这类理解任务上表现极强,而刚性的领域专用系统在许多场景下可能缺乏容错能力。

  • 他还没有遇到在生产环境中运行这一确切场景的人,因此保留了重要的不确定性;但他认为这是一个显而易见的机会。Gemini的空间理解演示已经能够识别物体并绘制边界框,表现可与定制的边界框模型相媲美。

6. 2.0产品组合兼顾生产规模与实验广度

  • 此次发布让更新后的Gemini 2.0 Flash达到生产可用状态,输入价格为每百万token 10美分,输出价格为每百万token 40美分。Google还预览了更小的Flash-Lite,发布了实验性的2.0 Pro,并以一款Flash推理模型补齐产品线。

  • Kilpatrick表示,Flash免费API层级的配额约为每分钟10或15次请求,以及每分钟400万token。付费使用取消每日请求上限,默认约为每分钟2,000次请求,并逐步增加到每分钟10,000次请求和1,000万token的配额档位。

  • 这样的容量需要“大量TPU”,但模型数量增加也让算力分配变得更复杂。当Cursor、Bolt和其他规模化客户需要稳定算力时,Google不可能把每个实验变体都投入生产。因此,正式可用既体现了基础设施承诺,也体现了模型质量。

7. Flash-Lite守住价格连续性,Pro押注编程能力

  • 标准版2.0 Flash的价格高于1.5 Flash,因此Flash-Lite在提供更好模型的同时,维持此前每百万token 7.5美分的价格点。它之所以能更便宜,部分原因在于不支持原生图像或音频生成等高端能力。

  • Kilpatrick提到,早期Flash-8B在OpenRouter上的token用量领先,可以作为某些场景使用量的合理代理指标,也说明开发者确实重视低价模型。Labenz仍然怀疑,从7.5美分降到10美分是否足以颠覆一门可行的生意;Kilpatrick认同,这一决定部分也是为了避免形成“Google在给开发者涨价”的叙事。

  • Pro采取相反策略:先从最强模型开始,验证应用,再通过更小的模型、优化或微调来降低成本。它的价格尚未公布,因为仍属于实验性产品;但Kilpatrick预计,其定价会沿袭此前的Pro模型,明显更贵。编程是它相对最强的领域,仍保留200万token上下文,而Kilpatrick依然相信Google会做出“世界上最好的编码模型”。

  • Ultra的未来取决于成本与基础设施权衡,而不是放弃扩大预训练规模。Kilpatrick表示,Google仍在扩大预训练规模,但也要考虑:假设某个模型只好5%,体量却大5倍、成本也高5倍,是否值得占用相应基础设施——尤其是在推理能力仍有大量“低垂果实”可摘的情况下。是否再发布一款Ultra,仍是一个开放的研究问题。

8. 模型选择本质上是评测问题,而不是基准测试答案

  • Kilpatrick讲述的一次“圆桌边角”调试经历,反而戳破了他自己对模型的直觉。Claude在Gemini让他受挫后一次性解决了任务;但当他用不同格式重新组织问题和上下文、再次运行完全相同的提示词时,Gemini也解决了。这个插曲暴露出开发者比较模型时那种“凭感觉、极不结构化、近乎科学”的方式。

  • 公开证据散落在“这里20个随机基准、那里50个随机基准”之间。Kilpatrick呼吁建立一个集中收集基准测试和排行榜的平台;Kaggle则在探索个人评测,让系统自动针对新版本运行测试,并在模型符合开发者提出的需求时发出提醒。

  • Labenz的反驳值得保留:许多有价值的输出并不存在客观正确答案。以视频创作为例,他的团队可以识别结构性失败、时长过长以及其他“明确禁止事项”,但越过这些护栏之后,质量仍然取决于品味、专家示范和“感觉”。

  • 让用户选择模型,至少能为开发者提供数据,也能给用户更多自主权。Copilot从只提供GPT到加入模型下拉菜单,就是这一趋势的例子;即便基准分数相近,模型的行为差异仍可能影响结果,正如Labenz将DeepSeek与行为打磨更成熟的西方模型进行比较时所展示的那样。

9. 微调、推理和智能体互联网构成初创公司地图

  • Kilpatrick仍然“极度看好”个性化微调:未来每个人都可能使用一个携带所需上下文的模型版本,同时又不会让这些上下文过度扭曲模型的先验。但2.0 Flash尚未开放微调,1.5 Flash也仍有明显短板,例如不支持图像微调。

  • 当被直接问及强化学习时,他确认RL是构建Google推理模型的一部分。Google在实验性发布上采取了一贯的低调方式,但随着推理受到更广泛关注,他预计公司会进一步解释相关工作。

  • 他最强烈的判断是:“推理能力会让智能体真正工作起来。”许多智能体公司正在解决真实有效的问题,但产品本身就是无法稳定运行;未来2年,推理能力预计会比其他任何模型进展都解锁更多这类产品。

  • 智能体也在挑战互联网原有的社会契约:除了索引爬虫,网站默认访客都是人类。Kilpatrick认为,围绕智能体访问、网站保护、归因和价值捕获,都存在创业机会。他也看好评测,但承认自己不知道行业将如何把人类品味转化为程序化测试——“生活中的大多数问题,最终都会变成评测问题。”