先锋 趋势 方法 投研 作者
Unsupervised Learning × Latent Space 交叉特别篇
返回节目精读

Unsupervised Learning × Latent Space 交叉特别篇

摘要

  • 本期最强的投资判断是,AI 的价值正在上移到模型层之上,应用可以按效用收费,而不是在成本加成的基础设施上变现。 swyx 表示,行业已经从嘲笑 GPT wrapper,转向认为 wrapper 是“唯一有意思的东西”;编程、客服和深度研究是目前最成熟的形态。对话摘要是强用例,但未必属于 agent。产品体验、分发、网络效应和执行速度,如今比拥有定制模型更重要。

  • 推理模型在预训练看似触顶之际重新打开了 scaling,但 DeepSeek 展示了专有模型优势压缩得有多快。 swyx 认为,R1 的完整推理轨迹在开源领域是净新增价值,但小组将 DeepSeek 的成就与可持续的“开源团队”区分开来:企业对开源模型的使用率约为5%,且还在下降;与此同时,一次由 DeepSeek 驱动的叙事曾伴随 NVIDIA 单日下跌约15%。“没有什么开源团队,只有不同的公司,以及它们选择开源还是不开源。”

  • 对于仍在快速变化的工作负载,agent 框架显得过度建设;协议和状态才是更持久的下注方向。 小组称今天仍处于“jQuery 时代”,认为 MCP 的重要性可能更接近 XMLHttpRequest 式协议,而不是另一个包罗万象的框架。记忆是被低估的一层:如果没有超越上下文窗口的持久知识,agent 就很难变得更聪明,也难以在工作中学习。

  • 当前的产品市场匹配集中在编程、客服和深度研究,下一波产品将瞄准收入创造。 swyx 估计,OpenAI 20美元到200美元的深度研究升级方案可能对应数十亿美元 ARR;当 Jacob 问访问权限是否很快降到了20美元档位时,swyx 澄清说,访问权限实际上是被扩大了。语音产品即使可靠性不完美,也能创造价值:如果家政服务企业漏接50%的电话,一个75%时间有效的 AI 仍能带来可观收入。

  • 编程正在成为模型厂商、IDE 和自主 agent 之间的第一场全栈争夺战。 Cursor 约90亿至100亿美元的估值提高了被收购的难度,而 Anthropic、Cognition 等公司可能在“内循环”的 IDE 工作与“外循环”的云端 agent 之间 converging。剩下的护城河是运营层面的苦活——代码库集成、安全审批、基础设施和企业信任——而不只是模型质量。

  • 应用的防御力并不神秘,但会持续复利:网络效应、品牌、集成能力和持续高速执行,胜过“训练自己的模型”叙事。 swyx 以 Chai 连接用户与模型供应商的市场为网络效应案例;在其他领域,据报道,品类领导者的 ACV 已翻倍,即便投资人原本预计定价会被压缩。Jacob 的框架是“让产品令人愉悦的1000件小事”,以及在3到6个月内吃透每一个新模型。

  • 最大的技术分叉在于,强化学习能否走出可验证领域。 如果 RL 能用于编程和数学,却无法用于法律、销售或营销,结果可能是完全自主的技术 agent,与依赖人类的创意 copilots 并存:“要写最基础的销售邮件”,人可能仍然是品味决定者。报道称,Bob McGrew 的可靠性规则也留下一个基础设施问题:从90%提升到99%,再从99%提升到99.9%,每一步都需要再增加一个数量级的算力。

  • 明确提出的公开市场配对交易是做多 Google、做空 Apple,但 Jordan 认为 Apple 的 Private Cloud Compute 是一个重要例外。 Google 的模型正在获得实际使用,Flash 据称在 swyx 每日运行的前沿模型测试中大多数时候胜出,但分散的开发者入口仍在阻碍采用。Apple Intelligence 的表现远低于预期,而 PCC 可能把类似端侧的隐私保护带到云端工作负载;Jacob 认为,AI 在多租户环境中需要单租户保证。

精读

1. 推理模型拯救 scaling,但 DeepSeek 压缩了护城河

  • 开场最令人意外的是,行业从 Ilya Sutskever 在 NeurIPS 时代“scaling 已死”的情绪,突然转向推理模型:“一切都结束了”几乎立刻变成“我们又回来了”,推理时算力取代预训练,成为新的 scaling 前沿。

  • swyx 认为时机“巧得可疑”。据报道,Strawberry 已经推进了约2年,而 Noam Brown 加入 OpenAI 被视为一项重大战略押注的证据:这项工作恰好在预训练看似触顶之际准备就绪。“如果真有光明会,这就是他们策划的事情。”

  • 开源模型呈现出一个悖论。Braintrust 的 Ankur 估计,企业使用率约为5%,且正在下降。Jacob 的解释是,企业仍处于发现用例的阶段,会持续选择当时可获得的最强模型;swyx 表示,DeepSeek 让他看清了模型公司能够独占产品构建窗口的时间有多短。

  • 关于 DeepSeek 的分歧值得保留:Alessio 认为,复制的成本比发明低“一个数量级”,因此市场过度炒作;swyx 则认为,R1 的完整推理轨迹在开源领域是净新增价值。他更尖锐的修正是:“没有什么开源团队”,尤其是如果 DeepSeek 停止发布模型,而其他人只是从它那里做蒸馏。

2. 传统产品入口让老牌公司错过了 AI 原生转向

  • 让 swyx 意外的是,Zapier、Airtable、Retool 和 Notion 没有抓住 AI 软件创造,而 Bolt 和 Lovable 做到了。老牌公司拥有分发能力和低代码基因,但只是用自然语言改进既有的操作、文档和表格,而不是“从一张白纸开始”重建软件创造。

  • 时机可能和想象力同样重要:据报道,Bolt 和 Lovable 在3个月内从0美元做到2000万美元,正值模型跨过可用性门槛。它们的数字把一个架构层面的好奇心,变成了投资人再也无法忽视的市场。

  • Jordan 对老牌公司的负面案例是 Apple Intelligence。Apple 看起来最适合打造个人助理,却做出了在社交媒体走红但质量糟糕的消息摘要;其中一条与 BBC 相关的错误摘要称一名男子开枪自杀,而事实并非如此。这个消费产品远低于小组预期。

  • 他认为 Apple 的例外是 Private Cloud Compute,它把类似端侧的隐私保护延伸到更大规模的云端工作负载。Jacob 给出的机制是:GPU 让专用 VPC 部署变得不现实,因此 AI 需要“多租户环境中的单租户保证”——随着消费级 AI 处理越来越多敏感数据,这构成了一个架构层面的突破口。

3. 协议和记忆比 agent 框架更持久

  • 对框架的批评不是说 LangChain 缺乏执行速度——在抽象层不断变化时,它仍然持续快速发布——而是工作负载仍不稳定,开发者无法选择一个可以信任数年的框架。小组的比喻是:agent 仍处于“jQuery 时代”,市场还在不断构建更多 jQuery,之后才会发现自己的 React。

  • swyx 的修正是,即使 React 也可能为时过早:“关键在协议,而不是框架。”MCP 类似 XMLHttpRequest,是 AJAX 背后的基础原语;协议能够适应实现方式的变化,而不会把今天对 agent 的假设冻结进一个单体框架。

  • 记忆是 agent 缺失的基础原语。OpenAI 的 Agents SDK 和 Cloudflare 的 agent 工作都没有加入持久的“记忆记忆”——即延伸到上下文窗口之外的事实、偏好和知识——尽管 MCP 最初的服务器中已经有一个 swyx 推荐作为起点的实现。

  • Alessio 反驳说,记忆可能是难做,而不是被忽视,并提到 LangMem、Letta 和 Zep 周围正在进行的工作。swyx 承认其难度,也提到了这些项目,但仍坚持这一投资判断:有状态的抽象应当成为标准;“任何有状态的东西都应该让 VC 感兴趣”,因为它的商业模式类似数据库。

4. 通用模型挤压新实验室,迫使它们寻找专有数据

  • Jacob 仍然对大量新公司训练通用模型感到意外;swyx 原本以为,这一品类在前一年年底就已经结束。基本的战略质疑是:每个新进入者都想实现 AGI 并赢下基准测试,但“它们不可能都做到”,而且没有哪项缺失的通用能力明确需要再建一个实验室。

  • Alessio 对 Noam Shazeer 回答的解读是,测试时算力最终可能让模型自行完成 AI 工程,并发现下一次算法突破。除非拥有真正不同的方法,否则这给没有差异化的挑战者留下的空间很小。

  • 可信的例外是独特的数据生成:机器人、生物和材料公司可以通过物理系统、湿实验室和实验收集专业数据。即便如此,“越大越好”的问题仍未解决——更小的垂直模型可能更便宜,而下一代通用模型也可能直接胜过它们。

  • BloombergGPT 提供了一个警示案例。Bloomberg 得出闭源模型更好的结论,停止了模型项目,但保留了周边的宝贵资产:数据管道、组建起来的团队、微调能力,以及公司内部约12或13个应用生成式 AI 的团队。“除了模型,一切都活了下来。”

5. 编程正在成为模型与应用之间的第一场全栈对决

  • 模型公司进入产品领域,部分原因是昂贵的研究创造了短期变现压力,但每次跨界都会制造新的敌人。搜索威胁 Perplexity;深度研究挤压应用供应商;编程产品则提出一个问题:Anthropic 会继续做 Cursor 的供应商,还是会成为它的竞争对手。

  • 在 swyx 看来,Cursor 约90亿至100亿美元的估值已经让它“很难被收购”;如果估值在50亿至60亿美元,加入 OpenAI 并贡献编程数据也许仍然合理。如今 Cursor 可能必须保持独立,并降低对任何单一模型供应商的依赖。

  • Alessio 认为,相比 Cursor,Devin 暴露得更多,因为 Anthropic 可以在不打造 IDE 的情况下追求自主 agent。swyx 的反驳是 Claude Code;Jacob 则预计双方会趋同:IDE 会加入 agent,agent 也会提供交互式编程环境。

  • 护城河取决于循环位置。内循环工具运行在 IDE 和一次 Git commit 内;外循环 agent 工作在两次 commit 之间,必须集成代码库、满足安全要求,并承受企业级“苦活”。这给 Cognition 提供了潜在护城河,也可能有利于 Sourcegraph:后者拥有10年的合同积累和代码库信任,这是成立仅2年的创业公司难以复刻的。

6. 产品市场匹配真实、狭窄,并正在扩张

  • swyx 最初设定了1亿美元门槛,用来反驳生成式 AI 产品只是“不可靠玩具”的说法。他举出的例子包括 Copilot、Jasper 所代表的写作品类——但附带提醒:“Jasper——已经不是了”——以及作为编程 agent 的 Cursor。

  • 深度研究是最新得到验证的形态:长时间运行的 agent 能够在 OpenAI、Gemini、Grok、Perplexity,以及金融领域的 Brightwave 等垂直产品上生成带有推理过程的报告。swyx 估计,OpenAI 20美元到200美元的升级方案可能意味着数十亿美元 ARR;当 Jacob 问访问权限是否已降到20美元档位时,swyx 澄清说,访问权限实际上是被扩大了。

  • 客服与编程、深度研究并列为“杀手级 agent”品类。Alessio 认为,Brett Taylor 选择创办 Sierra,尽管他热衷于开发者工具、几乎有能力为任何项目提供资金,这一选择强烈说明客服拥有持久预算;Decagon 及类似进入者也印证了这一点。

  • Google 正在成为使用量上的制衡力量。Gemini 负责 swyx 的 YouTube 摘要、原生图像生成和 thinking 工作负载;在他手动运行的每日模型测试中,Flash“大多数时候胜出”。Google Cloud、Vertex 和 AI Studio 的入口碎片化仍在伤害开发者,但 swyx 和 Jacob 做出了同一笔交易:做多 Google,做空 Apple。

7. 下一波应用必须从节省成本转向创造收入

  • 第一波产品把成本削减卖给企业已经外包给 BPO 的工作,尤其是客服。Alessio 认为,随着 Jensen Huang 在 GTC 上的措辞变化,叙事正在转向:去年是“你买得越多,省得越多”;今年是“你买得越多,赚得越多”。

  • Jacob 担心,外包成本中心也可能面临最激烈的价格竞争,因为买方本来就接受用较低表现换取节省。创造收入的工具可能更具防御力:一个能够稳定带来增量销售的 go-to-market 产品,可以收取更高价格,因为它的 ROI 看得见。

  • 语音 AI 说明,不完美的系统已经能够扩大收入。据报道,电工等家政服务企业会漏接50%的来电;一个只有75%时间有效的 agent 仍能捕获大量需求。下一个瓶颈随之出现:电工能否招聘、培训并部署足够多人,以完成翻倍的工作量?

  • 被提出的下一批形态包括屏幕共享助手、外呼销售、招聘、金融、个人 AI 和聚焦型教育产品。swyx 从尝试让 Python 成为新加坡官方语言的经历中得到的教育启示是制度阻力——教师没有准备好——因此他更看好 Speak 这样的窄产品,而不是试图一次性重建整个教育体系。

8. 持久的应用护城河来自网络、品牌和复利式执行

  • 关于应用防御力,swyx 最明确的回答是“网络效应”。Chai 是 Character.AI 的竞争者,没有专有模型优势,却能把用户与外部模型供应商连接起来;这个市场平台可能损害短期差异化,但会让公司对未来模型变化更有韧性。

  • 品牌已经在企业品类中带来意外的经济结果。投资委员会预期品类商品化、定价压缩和 ACV 收缩,但 Jordan 表示,一些 ACV 已经翻倍,因为客户愿意为那个已经进入每一次采购流程的品类定义者支付溢价。

  • Jacob 称独特数据集和自训模型是早期的“假动作”。真正的防御力没那么神秘:是让 UX 令人愉悦、覆盖广泛产品范围并保持组织速度的“1000件小事”。每次模型发布都会制造一场生死攸关的3到6个月竞赛,企业必须在竞争对手之前吃透新能力。

9. Agent 基础设施重要,但应用拿走更丰厚的利润

  • 有吸引力的“LLM OS”层位于模型周围:E2B 式代码执行、记忆、搜索、安全以及 agent 所需的其他工具。它不同于裸机服务;但应用层仍然“有意思得多”,因为供应商按客户获得的效用收费,而基础设施往往向成本加成收敛。

  • Alessio 的安全判断是对称的:AI 在提升进攻能力的地方,防守就必须在邮件、身份、红队和二进制检查等领域跟进。模型为历史上偏语法的规则加入了语义理解——推理代码试图完成什么,而不只是匹配孤立的指令。

  • 研究实验室会吸收一部分基础设施。swyx 的经验法则是,ChatGPT 自定义 GPT 构建器里的每一个复选框都代表一家创业公司,而这些复选框正在变成 API;OpenAI Search 被拿来与 Axon 对比,后者以约5倍价格提供相同量级的研究,因此多供应商策略仍有空间。

  • swyx 对独立微调、AI DevOps/SRE 和实时语音基础设施能否成为风险投资级别的品类感到怀疑。Jordan 反驳了对 SRE 的质疑:完全自主还很遥远,但即使把平均修复时间缩短10%,也足以支撑有意义的收入。swyx 承认增量价值,但坚持认为,基础异常检测早在 LLM 出现前就已经存在。

10. 奖励、可靠性、硅片与身份仍未解决

  • swyx 最大的问题是,RL 能否在可验证领域之外成功。编程和数学拥有可检查的奖励;法律、合同、营销和销售则需要品味。如果失败,市场将被分成两部分:可验证工作中的自主 agent,以及其他领域的 copilots,最终出现一个奇怪的世界——软件由自动化系统编写,销售邮件却仍由人来写。

  • 据报道,Bob McGrew 的“9的规则”把可靠性变成一个算力问题:从90%提升到99%,再从99%提升到99.9%,每次都要额外增加一个数量级的算力,这一进程据称需要约2到3年。这同时把硬件供应能力和 NVIDIA 能否继续保持生态主导地位,推向了更高层面的疑问。

  • swyx 认为,Transformer 专用芯片存在理论上的突破口,因为 GPU 对游戏、加密货币和 AI 来说仍然足够通用。这笔下注要求工作负载稳定,也就要求相信 Transformer 会持续存在;相比在 Transformer 明确胜出之前就已成立的芯片公司,2019年或2020年之后进入的公司可以更加激进地进行专用化。

  • 新出现的协议问题是 agent 身份认证:当 Operator 或其他 agent 访问网站时,必须表明自己是代表用户行动的 agent,而不是用户本人。swyx 称这是一种必要的“实际上面向 agent 的新 SSO”,随后也接受了 Sam Altman 的回答可能走在前面这一令人不适的可能性:“也许你得扫描眼球。”