先锋 趋势 方法 投研 作者
为什么所有人都在复制 Deep Research?
返回节目精读

为什么所有人都在复制 Deep Research?

摘要

  • Gemini Deep Research 瞄准的是那些“从0到50”的工作:这类任务通常要耗掉一个周末和50–60个浏览器标签页。 它运行在经过后训练的 Gemini 1.5 Pro 上,大约用5分钟把多面问题整理成一份有来源的报告;如果用户已经明确知道自己要找什么,普通 Search 仍然更合适。
  • 可编辑的研究计划既是用户掌舵的界面,也是昂贵代理任务的一份契约。 用户说“告诉我电池相关的一切”时,Gemini不会连环追问,而是展示拟研究的维度,允许用户通过对话修改——swyx称之为“可编辑的思维链”,Aarush表示认同。大多数用户仍会直接点击Start,但这份计划解释了报告为何会长成现在这样。
  • 真正的技术优势在于迭代式规划,而不只是多搜几页网页。 模型会并行探索不同规划分支,读取结果,识别缺口或矛盾,再决定下一步调查什么——比如发现欧盟禁令后,继续核查FDA政策。随后它生成提纲、起草、自我批评并修改,试图从“高层次要点”推进到有依据的二阶结论。
  • 长上下文保留正在进行的研究过程,而RAG则负责溢出内容和长期记忆。 近期来源会直接留在上下文中,因为用户可能追问细粒度比较;“10轮之前”的材料则可以转入检索。Sridhar警告称,当查询包含多个属性时,基于余弦相似度的检索效果会减弱;而更新的长上下文模型即便窗口逐渐填满,仍能保持有效。
  • 延迟正逐渐变成努力程度的信号,也为研究代理带来了最终的“质量还是表演”问题。 Google测试过15分钟的“hardcore mode”,但最终上线的版本大约耗时5分钟,并将上限设在10分钟以内;出人意料的是,用户并没有一味要求即时答案,反而可能认可看得见的工作过程。团队仍未找到在更广泛探索与更深入核验之间分配算力的最佳方案,而如果提供“max power”,用户大概会直接按下去。
  • 评估依旧顽固地依赖人,因为有效输出空间太大,不可能由一个基准分数概括。 自动化检查会监控计划长度、迭代步骤以及行为分布变化,人工评审则从覆盖面、完整性和依据充分性等维度打分,评估范围从广泛发现选项到狭窄而深入的调查。“如果我在HLE上表现很好,并不代表我就是优秀的深度研究员。”
  • 更大的机会在于连接专有信息的个性化、多模态研究代理,而不只是更好的网页摘要器。 团队希望针对15岁青少年和PhD提供不同输出,并生成图表、地图、图片或交互式界面,再叠加私有文件和付费订阅内容。swyx面向投资人的判断异常直接:这可能是“第一个真正达到产品市场匹配的代理”,目前对部分用户而言每月200美元已经合理,如果能力大幅提升,价格或许能到2,000美元。

精读

1. Deep Research 从协商工作开始

  • Selvan给出的产品定位是:Deep Research是一名个人研究助理,帮助用户在新主题上快速“从0到50”。它浏览约5分钟,再返回一份用户可以审阅、追问或重塑的报告。

  • 它与 Google Search 的边界在于用户意图是否明确。用户已经知道自己要找什么时,Search仍然是终点;Deep Research处理的是多面向的探索过程——这类任务会打开“50–60个标签页”,耗掉一个周末,最后往往还会让用户放弃。

  • 在投入5–10分钟和大量算力之前,Gemini会先提出研究计划。“告诉我电池相关的一切”可能指创新、化学原理,也可能指某项具体技术,因此模型先给出初步拆解,而不是让用户经历一连串追问。

  • swyx称这个界面为“可编辑的思维链”,Aarush表示认同。早期测试显示几乎没人主动编辑,团队于是加了一个显式按钮;即便用户像点击“I’m Feeling Lucky”一样直接按Start,这份计划仍然是透明机制,也是用户接受的任务契约。

2. 迭代式规划把网页浏览变成研究

  • Sridhar的技术解释是:被接受的计划包含可并行执行的分支,模型主要通过两种能力展开——搜索,以及深入阅读某个选定页面。关键在于,它会先读取此前的结果,再决定下一步行动。

  • 食品监管演示展示了这一机制:如果一次搜索发现欧盟委员会禁止某些添加剂,Gemini可以继续判断是否需要核查FDA是否也采取同样做法。Sridhar认为,没有这种迭代式的依据校验,报告就会不完整,最后只能退化成“高层次要点”。

  • 初始探索通常是广度优先,但团队并没有把这种行为写死。Gemini会先采样计划中的每个维度,再对信息不完整或来源冲突的地方深入追查;研究结束后,它构建提纲、起草报告、自我批评并完成修改。

  • 最终的牛奶和肉类报告不只是罗列规则,还推导出一组哲学上的分歧:欧盟采取预防性路径,即便证据尚不充分也倾向于先行禁止;美国则更偏反应式路径,在危害得到证明前允许其继续存在。Selvan认为,这正是目标中的“二阶洞察”。

3. 报告是工作空间,背后由分层记忆支撑

  • Selvan把后续操作分成3类:找回已经遇到过的事实、针对实质性新增范围启动新一轮研究,或直接编辑产物——压缩、删除或增加章节。报告与聊天并排呈现,正是为了同时支持这3种行为。

  • 如果用户把比较范围从美国和欧盟扩展到亚洲,Gemini会判断现有研究是否足够,还是需要重新浏览。所有近期读过的网站仍然可用,因此缺少某个细节时,系统可以快速回答,无需重复最初那次5分钟的任务。

  • 当反复执行研究任务开始逼近100万–200万token的上下文窗口时,团队会使用内部检索。经验法则是:复杂比较尽量把近期工作留在上下文中,再把大约“10轮之前”的材料放到RAG之后;相关且连贯的项目可以留在同一条线程里,因为早期发现的细分信息可能会指导后续搜索。

  • Sridhar对RAG的限定是:当查询本身包含多个属性时,点积或余弦距离检索会遇到困难。新一代模型在更长上下文中也能更深地保留细粒度信息,因此检索何时优于直接放入上下文的临界点正在后移。

4. 网页呈现与多模态仍是现实取舍

  • Deep Research同时提供Markdown和HTML两种呈现。Selvan表示,Markdown有助于减少纯HTML中的噪声;对话中提到JavaScript和Tailwind CSS就是这类噪声的例子,但嵌入式HTML片段仍可能需要原生处理。

  • 目前描述的产品还不包含视觉能力。Selvan承认,典型问题是关键信息被困在JPEG图片里;但他认为,对今天的主要使用场景而言,渲染页面会增加延迟,而价值只集中在“尾部的一小部分”。

  • Fanelli反驳称,代理本来就已经拥有数分钟的延迟预算。Selvan表示,模型的VQA能力正在提升,但仍把页面渲染留作未来的取舍,而不是当前能力。

5. 评估从研究行为开始,而不是从垂直领域开始

  • 输出熵让评估“很难做”。自动化评分器可以识别行为漂移——研究计划长度、步骤数量、规划耗时或迭代搜索深度的变化——但这些分布只能说明发生了变化,无法说明是“变好还是变坏”。

  • 因此,人工评审仍然不可或缺,他们会根据产品定义的覆盖面、完整性和依据充分性等质量指标进行评分。

  • Sridhar的评估本体不使用旅行或购物等垂直领域标签。一端是广而浅的选项探索:找出大量夏令营并分别总结;另一端是狭窄而深入的理解,中间则由比较任务以及不同广度和深度的组合填充。

  • 复合项目会同时检验多种模式。规划一场里斯本婚礼,可能需要在10个子任务中分别研究婚礼策划师、场地和餐饮。系统没有硬性的对话轮数上限,但目前大多数用户并不会深入太多。swyx认为,完成后的文档在视觉上更像终点,而不是“起点”;Mukund也承认,用户体验还可以更积极地邀请用户继续探索。

6. 有用的延迟正在颠覆Google的速度正统

  • swyx指出了一个“反常激励”:搜索70个网站或运行1小时的代理,即使其中30个来源都无关,也可能看起来更有能力。低效暂时会被解读为勤勉,但他预计,当用户开始追问为什么同样的质量不能更快交付时,这段蜜月期就会结束。

  • Google最初做了两个版本:一个运行约15分钟的“hardcore mode”,以及最终上线的约5分钟版本。Selvan曾要求工程团队把硬停止时间设在10分钟以内,因为他以为用户会放弃任何更慢的产品。

  • 真正令人意外的是,Jason Calacanis问Google是否其实在10秒内就生成了答案,只是故意延迟展示。这与团队在Assistant及其他Google产品上的经验完全相反——在那里,延迟越低,满意度和留存通常越高;而在这里,看得见的努力本身就有价值。

  • Selvan把算力决策定义为探索与核验之间的取舍。关于美联储利率变化和中产家庭收入的问题,需要精确回答并引用历史来源;生日餐厅则可以更宽松。理想的代理应当自行推断这项取舍,因为如果设置一个显式的“max power”控制,用户会倾向于把所有任务都调到最大。

7. 掌舵、专业化与持久执行构成产品护城河

  • swyx最强烈的用户体验批评是:用户应该能在研究运行期间修改计划。Devin会展示实时计划,并接受任务进行中的修正;他认为,如果研究最终需要运行1小时,Gemini就应当像一名实习生:带着发现回来,报告遇到的问题,并请求下一步指示。

  • Selvan同意,任务越长,执行过程中的掌舵就越有价值:当前几分钟的研究阶段几乎没有干预空间,但1小时的任务可以让代理带着发现和问题回来,等待用户指示。swyx提出的设计是一个实时更新的计划,它可以安排下一项任务,同时不锁死聊天窗口。

  • 这套体验底层是一个平台级的异步系统:用户可以离开、关掉电脑,完成后通过手机收到通知。5分钟或6分钟的任务必然会失败,因此系统会保存状态、选择性重试,并避免丢弃已经完成的研究。Mukund表示,系统已经能够稳定处理数百次LLM调用,也足够灵活,可以支持未来运行1小时甚至数天的任务。

  • 购物场景说明了专业化为何重要。Deep Research不擅长根据外观挑鞋,但在HVAC系统上更有吸引力,因为规格、额定电压以及寻找能够安装的承包商,比外观更关键。Selvan将其概括为“选项探索”,同样适用于商品、奖学金或夏令营。

8. 更好的推理必须带来有来源的新颖结论,而不是基准测试表演

  • 这款产品并非纯粹使用 Gemini 1.5 Pro:Selvan称其为一个经过后训练的版本,并表示并不存在所谓特殊访问权限。他认为,广义上的系统可以通过工具调用和微调复现,包括使用Gemma;但要实现稳定规划和可靠性,仍需要大量后训练。

  • 思考模型在迭代式网页搜索之外,又引入了第二种推理时算力。Mukund表示,模型可以更多调用自身记忆,生成更强的二阶洞察,但事实仍需核验;即使模型记得某个正确的美联储统计数据,没有.gov来源也仍然可疑。难点在于平衡模型记忆与事实依据。至于是否会超越1.5,他的回答是“stay tuned”。

  • 可泛化的迭代式规划是最难的建模问题。为每个领域或研究本体分别训练轨迹将是“噩梦”,因此团队强调高效利用模型记忆、进行数据增强,并通过后训练恰到好处地教会模型这种行为,同时不抹掉预训练继承的能力。

  • 基准测试仍然有助于凝聚研究人员。Selvan回忆,MLPerf竞赛曾推动TPU性能快速提升;但产品有效性是另一回事。团队希望避免针对“科比进入联盟那天,总统的侄子是谁”这类不自然的琐碎问题优化,Sridhar则警告,文本输出熵太高,会让验证和公平比较都变得困难。

  • 要实现超越网页综合的信息发现,既需要二阶推理,也需要能够检验假设的环境。代码和数学有沙盒与验证器,化学却没有等价的合成实验室。Sridhar的条件很明确:代理需要一个试验场、准确反馈和重复实验,只有这样,“新想法”才不至于沦为未经验证的漂移。

  • Selvan的路线图正转向个性化和生成式UI:15岁青少年和post-doc应当收到不同的研究报告,而图表、地图、图片和交互式结构应取代千篇一律的文本文档。

  • 开放网络最终会成为受限语料库。高价值的产业研究存在于公司文件、付费订阅和私人资料库中;但Sridhar提醒,现在还处于将代理平台化为横向组件的早期阶段。他给构建者的建议是,选择一个使命,然后“把这一件事做到极致”。