先锋 趋势 方法 投研 作者
[评测现状] LMArena 的 17亿美元愿景——Anastasios Angelopoulos,LMArena
返回节目精读

[评测现状] LMArena 的 17亿美元愿景——Anastasios Angelopoulos,LMArena

摘要

  • Arena 融资 1亿美元买来的是战略重试权,而不是烧钱授权。 Anastasios Angelopoulos 称,如果第一笔下注失败,资本就是可以翻开的“牌”;眼下的支出包括为免费推理买单、招聘,以及从 Gradio 迁移到 React,但他强调,Arena 不必把这笔融资全部花掉。

  • Arena 的护城河来自原生使用的规模与真实度,而不是一套静态基准测试目录。 主持人将其社区规模描述为 500万 MAU;Angelopoulos 提到,平台上已有约 2.5亿次对话,每月新增数千万次。他还表示,约 25%的用户以软件为业。不同于围绕预生成输出搭建的竞技场,Arena 记录用户提出的真实问题,持续刷新评测分布。

  • 公开排行榜是建立可信度的亏损引流产品,并明确承诺不 pay-to-play。 Angelopoulos 称其既是“慈善项目”,也是“亏损引流产品”:无论是否付费、得分多少,已发布模型都会出现,模型提供商也不能付费要求下架。他对“排行榜幻觉”批评的回应是,相关分析存在事实错误,包括声称开源模型抽样率为 9%,而 Arena 的实际构成约为 60/40;同时,该分析也误读了长期运行的预览模型测试。

  • Nano Banana 展现出图像生成的经济吸引力后,嘉宾与主持人都扭转了此前的怀疑。 Angelopoulos 如今预计,多模态系统将成为 AI 在消费端和企业端最具经济价值的能力之一,营销与设计是增长最快的采用领域。主持人的案例是:把 DeepSeek V3.2 对强化学习环境的解释输入 Nano Banana Pro,得到一张论文级图示;这项工作过去可能需要一个博士生花上一个月。

  • Arena 正从单一综合排名扩展到职业、模态和智能体专属评测类别。 其庞大用户群中,已有个位数比例分别构成医疗、法律、金融、会计、创意和营销等群体;视频评测计划于今年晚些时候或明年初推出。Code Arena 也可能从评估模型,进一步比较 Devin 这类完整智能体 harness。

  • 用户留存与创业公司的聚焦能力仍是执行约束。 持久化历史记录显著推动了用户登录,但 Angelopoulos 表示,“每个用户都要靠自己赢得”,用户在一次“昙花一现”的爆发后仍可能随时离开。API 仍有可能推出,但 Arena 当前应对战略发散的答案很简单:“我们确实应该把一件事做好”——竞技场。

精读

1. 公司成立:把学术基准变成基础设施

  • Angelopoulos 最终判断,Arena 无论作为学术项目还是非营利组织,都无法获得所需的分发能力、平台质量和运营规模。其使命早已明确:通过真实用户与原生反馈,“衡量、理解并推动前沿 AI 能力”;成立公司,成为将这项使命规模化落地的实际组织形式。

  • Anjney 在创始团队决定创业前孵化了 Arena,提供早期资助与资源;Sequoia 也提供了一笔资助。Anjney 设立实体时,还做出了一个不同寻常的承诺:团队随时可以退出。Angelopoulos 最终同意,成立公司是“我们实现规模化的唯一方式”。

  • 1亿美元融资买来的是选择权:“一家公司拿到钱的目的,是给自己留下可以翻开的牌。”Arena 为平台上的免费使用承担全部推理成本,并持续招聘;此前支撑其达到约 100万 MAU 的 Gradio,如今已迁移至 React,以获得更丰富的组件,以及更容易吸引熟悉该技术栈的开发者人才。

2. 原生提示词是 Arena 的核心数据优势

  • 主持人将 Arena 社区规模描述为 500万 MAU。Angelopoulos 则单独提到“超过 500万”,但没有说明对应指标;平台累计约有 2.5亿次对话,每月新增数千万次。他表示,约 25%的用户以软件为业,如今约一半用户会登录,使 Arena 能够结合问卷研究用户行为——但他明确保留了样本存在回答偏差的限制。

  • 主持人转述了 Artificial Analysis 打造“AI 界 Gartner”的目标。该机构将公开基准测试汇总并独立重跑,产出分析与报告;Arena 则让用户输入自己的使用场景和问题,而不是仅仅评判预先生成的输出。

  • 主持人提出了另一面:策划好的示例可以让不擅长提示词的用户了解模型能做到什么。Angelopoulos 同意,查看他人的提示词具有教育意义,但他强调,Arena 让用户输入自身使用场景,才是其真实度的来源。

3. 榜单公正是 Arena 拒绝出售的资产

  • 《Leaderboard Illusion》论文称,预览模型测试制造了未披露的不平等。Angelopoulos 认为这一批评“不科学”,并指出其中一些事实错误已经得到修正;具体而言,论文声称开源模型抽样率约为 9%,而他表示实际分布更接近 60/40。

  • 他为预览模型辩护,依据的不只是统计学,也包括社区文化:Arena 长期以来都会以秘密代号向用户开放预发布模型,社区乐于自行发现它们。Nano Banana 就是在这一机制中出现,随后成为“全球现象”。

  • Angelopoulos 表示,Nano Banana 的那一刻本身就改变了 Google 的市场份额。主持人认为,它在当时肉眼可见地领先于其他产品,并将其与 Google 股票中数十亿美元的资金流动联系起来。

  • 主持人更尖锐的质疑是,并非每个预览模型都会登上排行榜。Angelopoulos 的回答是:尚未发布的模型不必出现,但每个已发布模型都会基于数百万张选票获得统计上可靠的分数。模型提供商不能购买上榜资格,也不能付费要求下架;排行榜必须继续成为“透明、公平反映模型表现”的工具。

4. 多模态模型改写了双方对经济价值的判断

  • 主持人承认,自己曾认为图像生成是 AGI 的边缘能力,还可能带来声誉风险:AI 的上行空间为何不集中在语言、编程和推理上?Nano Banana 改变了他的看法;Angelopoulos 也表示:“我对这件事的判断也有些错了。”

  • 他们修正后的判断是务实的,而非哲学性的。营销与设计是 AI 采用速度最快的领域之一;创作者则获得了“无限供应”的图表、解释图和信息图,使多模态系统有潜力成为 AI 在消费端和企业端最具经济价值的能力之一。

  • 最具代表性的案例是 DeepSeek V3.2:主持人把其对强化学习环境的解释输入 Nano Banana Pro,生成了一张帮助自己理解论文的图示。他认为,如果手工完成同等工作,过去可能要一个博士生“花上一个月”。

5. Arena 扩大评测范围,但不放弃聚焦

  • Angelopoulos 希望 Arena 继续成为行业的“北极星”:一个持续更新的基准,通过不断进入的新数据点抵抗过拟合。Arena 跟踪新模型与新使用场景,并已发布数百万条真实对话,供研究人员研究和改善真实世界表现。

  • 职业视图如今可以分别展示医疗、法律、商业、金融、会计、创意和营销用户的结果。在 Arena 的规模下,即使个位数百分比也足以形成有意义的用户群体;视频评测预计在今年晚些时候或明年初推出。

  • API 仍有可能推出,但 Angelopoulos 从创业公司聚焦的角度对其提出疑问:公司应该把“一件事做好”。在留存方面,持久化历史记录提高了登录率,但任何功能都无法免除一项基本义务:每天都要“赢得每一个用户”。

  • 他还在寻找消费产品、机器学习、B2B 市场进入、营销及相关领域的专家加入 Arena。

  • Code Arena 可能将评测单位从模型扩展到完整的智能体 harness。在一项潜在的 Cognition 合作中,Angelopoulos 提议把 Devin 放进 Arena,测试它是否“在所做的事情上成为全球最强或最强之一”,以回应外界关于 Devin 已经消亡的说法。