先锋 趋势 方法 投研 作者
Artificial Analysis:独立 LLM 分析机构——与 George Cameron 和 Micah Hill-Smith 对谈
返回节目精读

Artificial Analysis:独立 LLM 分析机构——与 George Cameron 和 Micah Hill-Smith 对谈

摘要

  • Artificial Analysis 已将独立性本身做成了产品:没有人为公开排名付费,企业购买决策报告,AI 开发者购买私有基准测试。 公司目前有20多人,服务两类客户,将免费公开数据与订阅及定制项目结合起来。swyx 将其概括为“AI 领域新的默认 Gartner”,但商业隔离墙才是核心命题:“如果不是独立的 AI 基准测试,我们做这些就没有意义。”

  • 可靠的评测成本远高于跑一组问题,因为提示词、输出解析、答案顺序、采样方差、端点操纵和重复运行都可能改变排名。 Artificial Analysis 的目标是让其 Intelligence Index 在95%置信度下控制在约±1分,因此真实成本高于公开展示的单次重复成本。私有实验室端点通过“神秘顾客政策”进行核验,使用无法识别身份的账户,因为实际提供的模型可能不同于送测端点所标示的模型。

  • Intelligence Index 必须持续变化,因为昨天的前沿测试如今已接近饱和,而成功的基准测试会迅速变成优化目标。 V1 的 HumanEval 式 Python 函数题对许多当前模型来说已接近常识;V3 则融合10个数据集,覆盖问答、智能体、长上下文推理和实际用例。核心警告是:“被测量的东西会变成被针对的东西”,因此竞赛数学分数上升不一定代表更广义的智能提升。

  • 前沿格局已从 OpenAI 看似无法撼动的领先,转向 Micah-Hill Smith 所说的“每个季度都严格变得更具竞争性”的市场。 录制时,Gemini 3 Pro High 位居第一,其后是 Claude Opus 4.5、GPT-5.1 High 和 Kimi K2 Thinking。DeepSeek 的决定性信号来自前一年节礼日发布的开放权重 DeepSeek V3——一个被描述为61.1B MoE 的模型;之后 R1 才让更广泛的世界开始关注。

  • Artificial Analysis 正通过明确惩罚幻觉、奖励模型回答“我不知道”,将“智能”从答对率扩展出去。 其 Omniscience 指标范围为-100至+100,事实性错误答案每次扣1分;Claude 模型的幻觉率最低,而通用智能与模型是否知道何时应拒答几乎没有相关性。取舍取决于场景:在 Critical Point 的研究级物理题中,最高分只有9%,研究人员会刻意提高温度,因为探索性幻觉可能有用。

  • 智能体表现很大程度上取决于执行框架,而不仅是底层模型,由此在模型 API 之上形成了新的竞争层。 GDPval-AA 将44项涉及电子表格、PDF、演示文稿、音频和视频的白领任务转化为与模型无关的基准测试;每个受测模型在 Artificial Analysis 的框架中都优于其对应的消费级聊天机器人。这个极简框架包含网页工具、文件系统、代码执行、上下文管理和图像查看,后来以 Stirrup 名义发布,并给出建议:“让模型想工作多久就工作多久。”

  • 基础设施的悖论是,GPT-4 级别的智能至少便宜了100×,但推理总支出仍可能增长几个数量级。 更大的稀疏前沿模型、推理 token、超长智能体工作流和反复交互,会压过单位成本下降的影响;据称有一家初创公司仅在 coding agents 上就为每位员工花费5000美元。George Cameron 预计两种趋势都会延续:可比智能的成本再下降一个数量级,可行消费量再扩大一个数量级。

  • 下一场效率竞争不在于“推理模型还是非推理模型”,而在于模型是否针对每个问题花费了恰当的 token 和交互轮次。 年初,推理模型每次 Intelligence Index 查询平均使用的 token 数是非推理模型的10×;如今,不同模型之间的 token 效率本身就相差超过一个数量级。在 τ²-bench Telecom 中,GPT-5 的 token 单价更高,却可能比更小的开放模型整体更便宜,因为它用更少的轮次解决了客户问题。

精读

1. 一个基准测试副项目变成了独立数据公司

  • Smith 的起点是2023年的法律研究助手项目:他不断为准确性、性能和成本优化各个环节,最后发现,“你做的每一件事,最终都会变成一个基准测试问题”。当时没有人独立衡量不同模型和供应商之间的这些取舍,于是他和 Cameron 做了自己需要的工具。

  • 第一版确实只是副项目:买来的域名指向一个 Vercel 部署,通过一条推文公开发布,个人投入的评测费用只有几百美元。随着模型发布速度加快,开发者不仅需要比较质量,还要比较输出速度、供应商选择和价格,项目的价值随之上升。

  • 两年后,Artificial Analysis 已有20多人,形成两条商业线。企业订阅标准化的 Benchmarking Insights 报告,其中一份比较无服务器推理、托管部署和租用芯片自建服务;企业与 AI 厂商也可以委托定制化私有基准测试。

  • 加入 AI Grant 第4期带来了导师资源,也让公司接触到一批把 AI 推向极限的初创企业。swyx 曾质疑前沿初创公司是否是真正的客户,但 Cameron 和 Smith 认为,这些公司正是典型的重度用户:它们组合使用大量模型、频繁切换,并针对应用的不同环节分别优化准确性、速度和成本。

2. 基准排名建立在一整套不起眼的控制措施之上

  • 创业之初的方法论选择是重新运行评测,而不是直接接受实验室公布的结果。各实验室对名义上相同的基准测试采用了不同提示方式;极端情况下,“你甚至可以把答案放进模型里”。据报道,Google 为 Gemini 1.0 Ultra 的每个 MMLU 主题构造了32个从未发布的思维链示例,以争取一个高于 GPT-4 的分数;Micah-Hill Smith 的表述是“我认为”。

  • 输出解析本身也涉及判断。模型可能推理正确,却违反要求的格式:如果基准测试只考察推理,LLM 答案提取器可以恢复结果;如果指令遵循也是能力的一部分,格式错误的答案可能应得0分。现代模型通常能很好地遵循示例格式,使用正则表达式便已足够。

  • 选择题顺序偏差、温度、数据集规模和随机推理都可能造成较大方差。Artificial Analysis 在开发评测时会反复运行候选测试,并选择合适的重复次数,力求让综合 Intelligence Index 在95%置信度下控制在约±1分。公开成本按单次重复计算,因此内部实际评测支出明显更高。

  • swyx 从数据库行业提出的担忧是:实验室提供的端点是否可能被调优,或是否不同于公开服务。Artificial Analysis 的回答是“神秘顾客政策”:由无法识别身份的账户同时运行智能和性能测试,实验室无法识别这些账户。竞争利益也在发挥作用——实验室同样希望确保竞争对手无法操纵基准测试。

3. 基准测试必须演进,因为测量会改变模型行为

  • Cameron 最大的担忧是概念性的,而不是欺诈问题:一旦某项评测影响模型发布和媒体头条,研究人员就会理性地针对它进行优化。如今模型在竞赛数学上表现极强,但这项能力与具有经济价值的 coding agents 或一般工作之间只有不完美的映射。因此,分数上升可能快于通用能力的提升。

  • 当前 Intelligence Index 将10个数据集合并为嘉宾所说的模型智能“最佳单一数字”,同时保留底层图表,服务于更窄的决策场景。其覆盖重要的问答基准、几个智能体数据集、Artificial Analysis 的长上下文推理研究,以及其他面向具体用例的评测。

  • 如今,许多模型——包括相对较小的模型——都能让 V1 饱和;编写 HumanEval 式 Python 函数已不再是前沿能力。V2 和 V3 提高了难度、覆盖更多用例,也更贴近开发者需求。下一步重点是智能体工作、具有经济价值的任务,以及长上下文推理等持续存在的弱点。

4. 模型市场明确走向多极化

  • 录制时的排行榜注定很快过时:Gemini 3 Pro High 排名第一,其后是 Claude Opus 4.5、GPT-5.1 High 和 Kimi K2 Thinking。swyx 开玩笑说,未来的听众会觉得“真可爱”;这种快速失效本身,就是 Artificial Analysis 所追踪的发布节奏的证据。

  • 拉长时间看,更持久的结论是:在 o1 和 Claude 3.5 Sonnet 之前,推理模型和 coding agents 还不是成熟品类;再往前,OpenAI 曾“在超过一年时间里看起来不可撼动”,市场一度可能走向所有人只调用少数前沿实验室的 API。Smith 将如今的市场形容为“每个季度都严格变得更具竞争性”。

  • Cameron 记得自己在新西兰的节礼日逐题评估 DeepSeek V3。这个被描述为61.1B MoE 的架构,成为 Artificial Analysis 当时评测过的最强开放权重模型,也表明 DeepSeek 已不再只是众多玩家之一。R1 的强化学习后续版本带来了更广泛的震动,但真正的“基础”是那个异常强大、完全开放权重的底座模型。

5. Omniscience 将拒答变成一种可评估能力

  • 大多数 AI 基准测试奖励答对率,实际上是在告诉模型每道题都要尝试。Omniscience 改变了事实性知识上的激励:分数范围为-100至+100,每答错一题扣1分。在这个语境下,Cameron 和 Smith 认为,与编造事实相比,“直接说我不知道严格更有帮助”。

  • 第一批结果将事实知识与拒答行为区分开来。swyx 注意到,Haiku 的幻觉少于 Sonnet,Sonnet 又少于 Opus,并认为这可能量化了此前只能凭“感觉”判断的部分用户偏好。在不同模型家族中,更聪明的模型并没有明显更可能识别出自己不知道答案。

  • Gemini 3 Pro 相比 Gemini 2.5 Flash 和 2.5 Pro,在事实准确性上实现了大幅提升,但幻觉率没有同步改善。Omniscience 准确率与总参数量的相关性也高于 Artificial Analysis 的其他任何指标,而幻觉差异似乎更多与后训练选择有关。

  • swyx 不赞成把任何专有数据集当作全人类统一的幻觉率标准。嘉宾表示同意:这是特定的“AA Omniscience 幻觉率”,事实性问题中10%公开,其余保留用于防止污染。目标是提供一个有用的维度,而不是打造“人类最后一个幻觉”基准。

6. 硬科学表明,幻觉有时恰恰是优势

  • 嘉宾明确反对对猜测进行普遍惩罚。在编程、构思和开放式研究中,用户可能希望模型“先试试看”。他们举出的最佳反例是 Critical Point:这是一个类似 FrontierMath、包含研究级物理问题的学术数据集,领先模型的得分只有9%。

  • 据称,Critical Point 的创建者在让模型充当物理学思考伙伴时,会尽可能提高温度,刻意寻求更广泛的探索。在这里,幻觉不是缺陷而是有用能力——正确的评测政策取决于任务需要可靠的事实回忆,还是新颖的候选思路。

  • 这也体现了 Artificial Analysis 更广泛的数据来源模式。公司会内部构建评测,与学者和 AI 公司合作,也会独立运行最初由实验室发布的高质量数据集。Cameron 和 Smith 并不“痴迷”于所有东西都由内部发明;只要披露充分,他们可以在保持基准测试独立性的同时进行合作。

7. GDPval-AA 将办公室工作视为长时运行的智能体任务

  • OpenAI 的 GDPval 数据集包含44项宽泛的白领任务,配有详细指令,以及电子表格、PDF、演示文稿、音频和视频等产物。Smith 的有用表述是“相当难的带回家考试题”:它们能捕捉有意义的工作成果,但无法涵盖真实工作的全部混乱背景。

  • Artificial Analysis 将这套数据集转化为可在任何模型上运行的基准测试。其参考框架允许智能体使用网页搜索、浏览、代码执行和文件系统;Gemini 3 Pro Preview 根据明确标准评估提取出的视觉和文本输出。团队称已针对人类偏好全面测试评估器;值得注意的是,Gemini 3 Pro 自己作为 GDPval-AA 应试者的表现并不突出。

  • 由于营销视频或幻灯片没有简单的正确答案,基准测试采用相对 Elo,而不是答对率。swyx 希望加入一名签约人类,让50%保留 OpenAI 所谓“普通人类”的解释;嘉宾更倾向于 Elo,以便在大量模型之间扩展,并指出人类与智能体解决这类任务的方式不同。

  • 每个受测模型在 Artificial Analysis 的框架中都比通过对应的消费级聊天机器人表现更好;Claude Opus 4.5 是被举出的例子。参考智能体最多可运行100轮,而消费级产品面临不同的使用场景和成本约束。“我们基本上让模型想工作多久就工作多久。”

8. Stirrup 将智能体框架提升为一等层

  • GDPval 的结果表明,Artificial Analysis 可能意外构建出了一个强大的通用智能体,而不仅是一个评测封装器。Stirrup 在录制前一天发布到 GitHub,刻意保持极简:上下文管理、网页搜索和浏览、代码执行、文件系统访问,以及在视觉产物必须进入上下文时使用的图像查看工具。

  • 预期工作流很务实:克隆这个小型代码库,再让 coding agent 根据目标任务进行改造。Cameron 和 Smith 认为,能力越来越强的模型,使用紧凑的工具集并掌控自己的工作流,表现会好于被复杂框架逐步规定每个动作。

  • 消费级智能体仍是明显不同的产品,因为它们的工具和连接数据源已经分化。Smith 已经可以让模型通过 MCP 以只读方式查询 Supabase、运行 SQL 分析、制作图表,并查阅 Gmail 或 Notion;但他的保留意见依然成立:这些东西“基本上还不好用”,而且他至今从未发送过一封由聊天机器人起草的邮件。

9. 开放性不只是允许下载权重

  • Openness Index 补上了许可证追踪中缺失的一维:“关于模型如何制造出来,披露了多少信息。”它除了评估模型权重所附带的权利,还考察预训练和后训练数据的获取、数据再利用许可、方法透明度以及训练代码是否可用。

  • 当前最高分为18分,录制时由 AI2 的 OLMo 3 32B Think 领先。最有价值的图表是将开放性与智能放在一起比较,明确展示理想的爬坡方向,同时暴露出一个令人不适的斜率:最容易复现的模型不一定最聪明。

  • swyx 质疑这套计分体系,因为少量数据披露与大规模开放权重贡献,可能被归入无法体现实际影响差异的类别。嘉宾承认影响加权很难;他们优化的是足够客观的规则,让观察者无法合理争论某次发布应归入哪个类别。

  • 对商业用户而言,获得高分最简单的方式是采用 MIT 或 Apache 2 这样的标准 OSI 许可证:“这个框就勾上了。”较低类别涵盖署名要求或商业使用限制。NVIDIA 的 Nemotron 工作获得了额外认可,因为其模型和合成数据贡献支持了大量下游活动。

10. 更便宜的智能可能带来更高得多的基础设施支出

  • Artificial Analysis 按智能层级追踪成本,而不是只问某个旗舰 API 是否降价。其保守估计是,如今 GPT-4 级别智能的成本比 GPT-4 发布时低超过100×;swyx 认为 Amazon Nova 可能让降幅更接近1,000×。

  • 表面矛盾在于,用户可以同时花费更多。小模型继承了昨天的能力,但前沿需求转向更大模型;推理会增加输出 token,智能体系统则在长工作流中同时放大输入和输出。一家被提及的初创公司仅在 coding agents 上就为每位员工花费5000美元——这很高,但如果使用率能带来生产力,也并非不可想象。

  • 硬件经济性取决于工作负载、目标用户速度和每块 GPU 的吞吐量:提供更快服务的成本更高。对于大型稀疏模型,Cameron 认为 Blackwell 相比 Hopper 的表现提升“远不止两三倍”;未来 NVIDIA 迭代将降低每个 token 的成本,同时支持更大的模型和多得多的生成 token。

  • swyx 提出,有效参数可能已从约25%降至15%左右,并询问稀疏化是否接近下限。Cameron 表示,他不确定5%的下限是否显而易见;GPT-OSS 模型的有效参数约为5%,他认为2%或3%也许可能实现。嘉宾还指出,基准测试表现往往与总参数量的相关性高于有效参数量。他们预计,更便宜的智能和可行消费量都将再提升一个数量级。

11. token 与轮次效率取代推理/非推理二元划分

  • 年初,平均推理模型每次 Intelligence Index 查询使用的 token 数,是平均非推理模型的10×。如今这种清晰区分已经瓦解:推理强度可以调节,不同模型之间的 token 效率相差超过一个数量级。

  • 理想行为是条件计算:简单问题使用少量 token,困难问题使用大量 token。Artificial Analysis 内部追踪了问题难度与 token 使用量之间的相关性,发现模型在这一年中有所改善。在长时智能体中,这种适应会在每一步累积。

  • 更少的轮次可能压倒更便宜的 token。在 τ²-bench Telecom 中,GPT-5 每个 token 的收费更高,却可能比更小的开放模型端到端成本更低,因为它更快解决了客户问题。因此,“轮次数量”很可能与价格和输出 token 数一起,成为头条级效率指标。

  • 多轮基准测试在运营上很难,但在概念上并非可选。GDPval-AA 已允许最多100轮,但每次模型发布时,基础设施都必须在数百个模型上快速执行这类工作负载。Cameron 和 Smith 的态度很简单:“做得到。我们正在投入工作。”

12. V4 将把可靠性和能动性纳入智能

  • 计划中的 Intelligence Index V4 将纳入 GDPval-AA 的通用智能体表现、Critical Point 的未解决研究级物理题,以及 AA-Omniscience,包括幻觉率。如何给不兼容的分数类型加权是难点;每个大版本都是一次有意的重置,同一版本内则不允许分数漂移。

  • 嘉宾表示,大量 τ-bench 任务可能本来就无法完成;但他们相当确信,早期的 τ-bench Telecom 版本是可靠的。它剩下的问题可能只是模型已经变得太擅长这项测试。

  • 除文本外,Artificial Analysis 已经在评测语音、图像、视频和硬件。其视频竞技场会预先生成输出,再收集偏好;用户可以提出被忽视的类别和提示词。swyx 希望看到的是生产级信息图,而不是更多艺术作品——更广泛的启示是,测量可以将努力重新导向服务不足的工业用途。

  • 被问及明年会发生什么变化时,Cameron 给出了刻意“无聊的答案”:大多数图表曲线会继续沿既定方向发展,直到产品出现质变。另一方面,swyx 认为市场对更高 AI 智能的需求将“永不满足”,并问道:有哪个管理者会拒绝一个能让同事——或自己——变得更聪明、工作更出色的按钮?