AI科学家来了。但科研进展真的在加速吗?| EP 170
摘要
- Edison Scientific 的 Kosmos,将合作者所说的3至6个月博士级数据分析,压缩到约12小时的一次运行中。 这一结论来自这样的测试:把未发表研究中的相同目标和数据集交给 Kosmos,它在一夜之间复现了研究人员的发现;Sam Rodriques 起初认为「这不可能是真的」。他说,Kosmos 的结论约有80%的正确率,大致相当于让一名人类独立开展调查研究。
- Kosmos 的经济账看起来很不寻常:200美元的一条提示词,可能消耗1,500篇论文并生成42,000行代码。 Kosmos 通过一个能维持长任务连贯性的「结构化世界模型」,协调 OpenAI、Google、Anthropic 的数百个智能体,以及 Edison 内部训练的模型。Rodriques 称200美元只是推广期定价,并将其与科学家收集这些数据可能已经花掉的5,000至10,000美元相比较。
- Kosmos 已经在产出新发现,但「AI发现」目前仍意味着加速分析,而不是自主得出科学真理。 其论文中的7个结论里,3个复现了已知发现,另外4个被描述为新的科学贡献,其中包括一套拟议机制:将一个非编码2型糖尿病变异、结合蛋白、基因表达与参与胰腺胰岛素分泌的 SIRT1 联系起来。科学家仍必须理解、交叉核验并通过实验验证这些输出。
- 医学领域最大的瓶颈仍是临床试验,而不是缺少合理的研究假设。 Rodriques 认为,假设当下数亿美元规模的试验已经经过最优设计,「那你就是疯了」,因此 AI 可以改进实验和临床试验。但制造临床级材料、招募稀缺患者、给药并等待结果,仍是顽固的物理约束。
- Rodriques 称在10年内治愈所有疾病「很疯狂」,但认为30年的巨大跃进是可信的。 即便一种药物能够彻底阻止衰老,也可能需要5年或10年才能证明有效;而且「拥有无限智能」也不代表所有答案都能凭空获得,新的实验仍不可或缺。更快的生物标志物可能缩短这一时间,因此他承认,激进预测仍有可能超出自己的预期。
- 生成式生物学——而非单纯预测——是当前科学能力跃迁最大的方向。 模型如今可以从零开始提出具备目标特征的抗体、蛋白质或生物体;设想中的工作流是输入一种疾病蛋白,生成与之匹配的抗体,但后续仍要经过制造、验证和人体试验。Rodriques 认为 AlphaFold 3 受到的关注仍不够,实验室自动化的热度基本合理,而「虚拟细胞」、量子计算和脑机接口被过度炒作。
- 科学智能体正处于采用 S 曲线的起点,但普通实验室的实践方式会比模型前沿变化得更慢。 编程助手和文献检索能立即为保守的生物学家创造价值,而更深层的智能体式研究,需要靠已经展示出的结果逐步建立信任。Rodriques 曾认为2026年或2027年由智能体生成大多数高质量假设是过度炒作;如今他称2026年仍属激进预测,但2027年可能真的实现。
精读
1. Kosmos 将数月分析压缩为12小时运行
Rodriques 最初听到「6个月」这一说法时的反应是「这不可能是真的」。Edison Scientific 的测试方式,是把学术研究中相同的目标和数据集交给 Kosmos,而这些研究当时尚未由合作者发表。Kosmos 在一夜之间重新发现了研究人员称耗时3个月、5个月或6个月才得到的结果——这不一定意味着连续6个月不间断工作,而是相当于投入了这么多研究精力。
Kosmos 看起来像一个提示词输入框,但它「不是聊天机器人」:用户提交研究目标,然后等待约12小时。每次运行都会同时调用 OpenAI、Google 和 Anthropic 的模型,以及 Edison 针对具体任务训练的内部模型,而不是押注某一个前沿系统。
真正的技术突破在于一个记录任务知识状态持续演变的「结构化世界模型」。它让数百个智能体可以并行工作、按顺序推进,同时不忘记目标,也不至于「脱轨」,最终产出一项连贯的调查,而不是一堆彼此割裂的模型输出。
工作量解释了定价:一次平均运行会阅读1,500篇论文、编写42,000行代码,而一次 Claude 会话可能只写几百行。当前200美元的收费是推广价,未来会涨价;但相较于收集实验数据需要花费的5,000至10,000美元,用户告诉 Rodriques,他们「简直不敢相信」这项服务只要200美元。
2. 新发现先于证明出现,但仍离不开科学家
Kosmos 团队在论文中给出了7个结论:其中3个是复现结果,另外4个被描述为对科学文献的新贡献。Rodriques 说,系统确实能给出很深的洞见,正确率约为80%,「有点像」让一名人类研究人员独立开展调查。
他最有力的例子,涉及数百万个与疾病相关、但作用机制仍未知的遗传变异。拿到2型糖尿病的原始数据后,Kosmos 将一个位于基因之外的变异,与在其附近结合的蛋白质联系起来,找出相关的基因表达,并进一步连接到 SIRT1 的作用机制;SIRT1 参与胰腺胰岛素分泌。这套机制此前没有任何人类研究人员从这些输入中完整拼接出来。
Casey Newton 的一个有用拆解是:科学研究先选择数据,再收集数据,最后得出结论;Kosmos 目前主要攻克的是第三步。Rodriques 回忆,自己攻读博士期间花了6个月分析数据集,当时年收入约40,000美元。智能体可以迅速浮现研究结果,但科学家首先必须理解这几个月的工作如何被压缩,再重新运行分析、交叉比对并进行实验验证;在他看来,这个具体结果不太可能最终成为药物靶点。
3. 临床现实,而非创意生成,决定医学进度
Casey Newton 的反驳值得保留:当临床试验、患者招募和 FDA 审批耗时远超药物发现时,药物发现可能并不是限制因素。Rodriques 基本同意这一点:科学家已经知道如何在小鼠身上治愈的疾病数量「多到天文数字」,因为在那里开展实验很容易;而人体实验天然更慢。
AI 仍然能在上游发挥作用,因为如果你认为每一项药物试验都已经基于全部可用知识进行了最优设计,「那你就是疯了」。临床试验成本高达数亿美元,而现有数据集里藏着大量此前无人有能力挖掘的洞见。因此,更好的分析应当带来更好的实验和临床试验,即使它无法取消临床试验本身。
Rodriques 对时间表的直白判断是:在10年内治愈所有或大多数疾病「很疯狂」;但30年内实现「巨大的跃进」是可信的,尽管终结衰老或治愈一切都不保证在物理上可行。假设一种药物能让25岁至65岁期间的衰老停止,研究人员可能仍需要5年或10年才能检测出效果。
监管只是延误的一部分。即使完全没有监管机构,团队仍需生产足够的人体临床级材料,通过与医生建立联系来找到稀缺患者,给患者用药,然后等待结果。「GPT-7」也不会简单地解释如何治愈 Alzheimer’s:即使「拥有无限智能」,关于现实世界的缺失事实仍然缺失,直到实验补齐它们。生物标志物可能加快迭代,Rodriques 也承认,这是一条乐观预测可能跑赢他自己判断的合理路径。
4. 更好的科学需要世界模型,也需要有生产力的噪声
Rodriques 将 AI 科学分成两类:一类是对自然世界建模,另一类是对科学研究如何开展建模。Kosmos 属于后者;蛋白质结构预测、抗体生成和生物体设计属于前者。能力变化最大的是生成式设计:根据要求从零产出蛋白质、抗体或生物体,这是他所说的「此前从未拥有过的新能力」。
Kevin Roose 用 Google 回答「2026年不是明年」这一例子,质疑科学分析的可靠性。Rodriques 表示,研究人员确实必须投入大量时间检查智能体,但发表论文本来就要求检查这类工作。无论有没有智能体,完美都无法实现;现实标准是达到与人类相当的可靠性,而「检查工作永远会比一开始就产出工作更快」。
尚未解决的问题是:优化是否会摧毁偶然发现。Rodriques 预计错误仍会存活,并提到孢子飘进一扇敞开的窗户,最终产生了青霉素这一观察结果。研究生一年级学生同样会通过做专家会否决的「最随机、最古怪的事情」推动进展。他的回应是,系统可能需要保留变异,或者「加入噪声」;生物进化也依靠随机性来发现有用的功能。
5. 采用从编程起步,智能体逐步逼近 S 曲线
大多数科学家的工作方式尚未发生根本变化。Rodriques 认为,生物学家偏保守,因为沿用下来的实验流程即使没人完全理解每一步,也往往确实有效,而逐一测试所有替代方案又不可能。因此,大多数实验室会继续使用熟悉的方法,直到看到同行取得可明确验证的更好结果。
编程和文献检索是眼下的例外。随着研究人员使用 Claude Code、OpenAI 模型和 Gemini,即使此前不会编程,生物学领域长期存在的编程瓶颈也正在下降;智能体则可以解析原本难以处理的科学文献。完整的科研智能体仍处于更前沿的位置,扩散速度可能会更慢。
在快速问答环节中,Rodriques 认为 vibe proving 作为终端用途可能被过度炒作,尽管它对推动 AI 很有价值;科学实验室机器人「热度合理」,但技术上仍不成熟;AlphaFold 3 可能反而没有得到足够重视,尽管已经受到大量关注。「虚拟细胞」这个名称被过度炒作,因为当前系统建模的只是狭窄的细胞功能,而不是完整细胞;量子计算和科幻式脑机接口同样被过度炒作,或者距离真正实现比人们想象得更远。
他定义2025年的3项进展是:科学智能体、包括 Chai 和 Nabla Bio 在内的团队开展的从头抗体设计,以及 Arc Institute 从零开始设计噬菌体——后者即便实际用途尚不明确,也「很棒」。他预计智能体将在2026年「渗透进一切」。当年由智能体生成大多数高质量假设仍是激进预测,但他曾认为自己是在过度炒作的那一判断,到2027年可能会成为现实。