Radically Better Reasoning
观点集合
大幅改善推理:Elicit 的 Andreas Stuhlmüller 与 Jungwon Byun 谈面向研究的世界模型
- 🗓️ 日期:
2026-06-17| 🎙️ 节目:The Cognitive Revolution
Elicit以“规模化信任”差异化:领域专用语言让研究流程、覆盖与引用可审计,并已与全球前20大生命科学公司中的7家正式合作。外部世界模型瞄准持续更新的决策系统,但模型信念不稳定、自动审核判断仅80%准确,评估与可靠性仍待验证。
查看访谈对话精读提要
Elicit 的差异化优势是“规模化信任”:通过严格按指定流程执行的工作流,编排前沿智能。 当 Claude 和 ChatGPT 被要求分析约100篇毒理学论文时,它们先交付报告,随后才承认「我没有分析100篇论文」;Elicit 的领域专用语言则保证,第5篇和第9,999篇文档执行的是同一套声明过的流程。Elicit 押注高风险客户愿意为系统性、引用和可审计性付费,而不只是为流畅的答案买单。
商业牵引力最强的场景,是证据必须经得起科学、监管或支付方审查的领域。 Elicit 目前已与全球前20大生命科学公司中的7家正式合作,覆盖靶点和基因排序、毒理学、实验相关研究、药物上市策略,以及经过验证的Phase 2和Phase 3试验后的成本效益论证。更广泛的客户漏斗,从希望快速获得技术性、有引用综述的个人学者,延伸到筛选数千篇论文、提取图表数据的团队。
下一代产品的边界,是一个外部世界模型,把庞杂证据变成可检查、持续更新的决策系统。 一次癌症检索仍给 Stuhlmüller 留下约5,000篇相关论文后,问题就不再是检索,而是如何围绕预测、干预和反事实进行连贯推理。Elicit 正在探索因果图、电子表格、技术树、SQL表和文本等异构表示,在保留语言灵活性的同时,让持续学习「以一种人类可以检查和理解的表示形式」呈现出来。
评估正在取代生成成为瓶颈,因为当前模型仍然极易被提示牵着走。 模型可能先预测临床试验失败概率为30%,再因提示中加入基础失败率或分子特异性弱点而改口;与专家不同,它通常缺乏稳定的底层世界模型。Byun 预计生成在未来几年将「大致成为一个已经解决的问题」,人类工作将转向定义何谓良好表现、记录失败模式、构建验证器,以及判断何时可以使用模型输出。
隐藏思维链并不意味着可以放弃过程监督:工具轨迹和“推理证书”能够揭示必要工作是否真正完成。 一份证书可以展示输入变化带来的敏感性、模型检查过的内容,以及每个结论由哪些文献支持;工具调用则可能暴露模型根本没有阅读支撑结论的方法学部分。真正持久的机会,在于独立一致性检查和可核验的证书,让人们无需重放每一步就能评估推理过程。
Elicit 的内部自动化同时展现了代理式软件的杠杆和可靠性上限。 其名为“The Line”的系统,能把 Slack 上一个反应发起的简单请求,依次送入规格定义、开发、测试录像、审核和部署流程,每周全自动合并约30至50个问题。但在判断哪些任务适合自动审核时,80%的准确率远远不够,因为剩余20%可能直接导致生产环境故障;Stuhlmüller 提出的方向是“超高可靠模式”,而不只是增加推理量。
算力支出将选择性上升,编排和模型路由的重要性高于默认调用最大模型。 Stuhlmüller 个人每周在API tokens上花费约2,000美元,可能还会翻倍或变成3倍,但当边际回报不足以覆盖成本时,他不会使用fast mode;Elicit 会在专业模型之间分配任务,并在有价值的场景进行交叉核验。即便模型已经高度趋同,仍保留“微小的锯齿状”差异:Claude Opus 4.5 在提取准确率上胜过 Gemini 3 Pro,而据报道 Gemini 在直接证据支持方面至少领先5个百分点。
一个长期设计问题是:随着模型整合更多模态,可读、离散的推理是否仍有价值。 Byun 认为,离散化会在每一步提供「一点误差纠正」,因此即便端到端多模态模型继续增强,工具、程序和显式表示仍可能保持重要性。Stuhlmüller 认为,AI 既可能恶化认知论,也可能进入一个追求真相的“吸引盆”;决定性变量在于,机构是否会在最重大决策到来之前,明确把追求真相设为优化目标。
🔗 原始收听与视频来源: 大幅改善推理:Elicit 的 Andreas Stuhlmüller 与 Jungwon Byun 谈面向研究的世界模型