为 AGI 提供底层数据的创业公司
摘要
2020 年创立、未获风险投资支持的 Surge 在 2024 年营收突破 10 亿美元,员工仅略超 100 人——意味着人均营收约 1000 万美元。 Chen 将这种资本效率归因于坚持使命导向、避免打造组织“帝国”,以及向真正重视数据质量的研究人员销售。对于 Surge 认为与 AGI 无关的项目,公司甚至会放弃其收入。
Surge 所称的差异化优势是质量控制技术,而不是廉价劳动力。 Chen 将竞争对手形容为依赖电子表格的“人肉外包工厂”,同时强调用于衡量工人与任务质量、追踪质量变化、开展实验和过滤低质量产出的系统。「不能只是把一群人扔进去」(“You can’t just throw warm bodies at it.”)。
生成式 AI 数据让旧有的共识式标注模型变得不够用,因为多数偏好可能筛出通用、最低公分母式的产出。 一首 8 行月亮诗可以满足所有检查项,却依然糟糕;英语文学博士也可能缺乏所需的创作能力。Surge 转而试图保留多元洞察——写诗或证明勾股定理都可以有“一千种方式”。
需求已从搜索评测和内容审核,转向多模态、多语言、专家级 LLM 工作,足以让贡献者连续投入数天甚至数周。 Surge 目前覆盖超过 50 种语言,包括用阿根廷西班牙语编程,以及在玻利维亚提供法律或金融专业知识。Chen 预计前沿将从研究生 STEM 能力进一步迈向真正的科学协作。
Chen 认为,基准测试激励可能带来更高的分数,却造出更差的模型。 在 LMSYS/Chatbot Arena 排行榜上,普通评测者可能奖励更长的答案、格式和 emoji,即使答案在幻觉或无视指令;据称,一些研究人员只有在模型获得 10 个排行榜积分后才有资格晋升。Chen 的判断异常绝对:这个排行榜“至少让行业倒退了 1 年”。
Surge 倾向于在有限的 SFT 启动之后采用 RLHF,同时认为合成数据有用,但一旦压过人类信号就会带来风险。 一项评测中,使用 1000 万至 2000 万道合成数学题训练,改善了狭窄的学术领域,却让模型在其他领域变差。Chen 说,一些实验室后来丢弃了规模相当的数据,因为发现“哪怕只有 1000 条真正高质量的人类数据”也更有用。
Chen 看不到模型开发的瓶颈墙:下一轮扩展将来自更丰富的 RL 环境、更长周期的智能体、个性化、创造力,以及持续投入的人类数据。 一个例子是模拟的 AI 初创公司,里面包含 Gmail、Slack、Jira、GitHub、代码库,以及突发的 AWS 或 Slack 故障。按照当前激励机制,他猜测闭源模型将继续胜出;不同实验室的数据支出可能约占算力支出的 1% 至 10%,而这部分占比应该更高。
精读
上游暂未提供,后续同步将继续补齐。