互联网数据快挖完了,AI 下一座矿是你的工作流
深度思想,谈 AI 与向往 —— 字节深思圈
数据这门生意一直在翻页。自动驾驶和早期大模型那阵,Scale AI 靠数据标注赚到第一桶金;训练转向专家数据,Mercor、Surge 这批公司跟着起来;现在需求又换了形态,模型实验室开始围着一样新东西转:企业真实工作流里产生的数据。互联网公开数据被反复淘过,这座矿基本没动过。
为什么是现在?答案藏在模型进步的主线上。
任务变长了,沙盒编不出来了
这一代模型竞赛的关键词是长程任务。模型处理工作的单位,正在从一次代码修改,扩大到一个文件、一整个代码库,最终是一个完整项目。
任务越长,人工搭环境就越难。真实项目里全是历史状态、工具依赖、组织规则和意外分支。一个运行了八年的代码仓库,哪些模块没人敢动、哪条流程绕不开审批,这些细节专家坐在沙盒里凭空编不出来。实验室的预算于是从专家标注,转向强化学习环境,再转向现在的真实世界数据采购。
这个市场还有一个结构性错配,模型公司通常工程师多、数据少,企业正好反过来,数据多、懂训练的人少。两端错配,中间就长出两类生意:一类给实验室供数据,一类帮企业把业务流程改造成可训练的环境,顺便把训练咨询也卖了。
好数据只有一条标准:卡在能力边界上
数据分两种。一种是从真实工作里捕获的,接近工作过程的录像,屏幕操作、协作记录,最好的版本连动作背后的意图都能还原。GitHub 是这种数据的典范:提交信息、issue 和解决方案串在一起,一个问题从出现到被解决的全程都在。另一种是人为构造的,找专家、设计任务、沙盒执行、收集结果。构造出来的数据适合早期能力爬坡,但当模型开始处理链路更长、经济价值更高的任务,真实数据就越来越值钱。
这里有个反常识的判断标准。很多团队设计任务的逻辑是,做出一个模型不会的任务就有机会。但让前沿模型做不出来一点都不难,难的是让任务刚好卡在能力边界上。一个任务,模型一次做不对,允许独立尝试三十二次,有三成的成功率,说明它已经偶尔摸到路径,只是不稳,这种数据有训练价值。另一个任务,试两百五十六次一次都不成,多半是超纲或者偏门,喂进去也学不会。挑数据不是挑最难的,是挑刚好够得着的。
市场红火,坑也成体系。行业里流传的几种失真值得记住:把构造数据包装成真实数据;评测集故意加难度,制造模型还有很多提升空间的假象;质检靠堆人力,规模一上去质量就崩。我的经验是看一家数据公司的招聘结构就能判断它的 DNA:频繁招项目负责人,说明它在卖人力接订单;只招工程师,说明它在建工厂。随着数据价值向真实端迁移,纯构造数据公司的窗口可能只剩两年。
你的公司,该不该自己练一个模型
工作流变成训练数据,企业自然会想:要不要自己动手练。硅谷的讨论很多,动真格的都有具体理由。
客服公司是最早自研的一批。通用模型被训练得友好顺从,但企业不希望模型面对退款有求必应,这种偏好没法靠提示词解决。另一个理由是成本:一个编程工具公司如果按外部 API 价格买模型,每增长一个用户,都在给竞争对手交过路费,对手拿这笔钱补贴它自己的产品。自研到前沿模型八九成的能力、一到两成的价格,体感竞争力就拉平了。
但自训本质上是用一次性资本开支换长期推理开销,这笔账能不能算过来,看四个乘数:数据独特性,乘以评测清晰度,乘以任务频率,乘以单次改善的价值。任何一个乘数接近零,投资都不成立。
| 乘数 | 它决定什么 | 为零时的样子 |
|---|---|---|
| 数据独特性 | 通用模型学不学得会 | 数据只是脏,谈不上独特 |
| 评测清晰度 | 训练能不能稳定优化 | 没法验收的工程 |
| 任务频率 | 成本能不能摊薄 | 一年用两次的能力 |
| 单次改善价值 | 回报的天花板 | 省下的是零钱 |
一个正面案例是外卖平台的菜单录入。每年超过十万家商户入驻,上传菜单图片,系统要把图里的信息按平台内部规则转成电子菜单,商品、加料、规格各有一套标准。通用模型认识菜单,但不懂这套内部规则,于是平台拿内部数据和外部供应商合作,练了一个懂自己业务标准的小模型。四个乘数全部为正,账就算得过来。
自训还有一层隐藏优势。占据真实工作流入口的公司,天然产出高质量的智能体执行轨迹,这类数据在外部市场单条报价能到上千美元。而且企业任务范围窄,不用管跨领域泛化,资本效率反而高。通用实验室做编程强化学习要小心别的技能退化,垂直公司没这个包袱。
这门生意的边界,也要讲清楚
三个冷静的判断。
第一,数据市场是冲浪生意。每当一个能力瓶颈被突破,最有价值的数据就换一种形态,玩家跟着翻页。上一轮的赢家如果押错了下一轮的需求类型,护城河瞬间变成沉没成本。给数据公司估值,别按资产估值,按窗口期估值。
第二,企业对自己数据独特性的判断,普遍过于乐观。多数所谓独特的数据,问题出在脏,不在独特:口径不统一、流程没记录、权限说不清。四乘数里最先归零的往往也不是独特性,是评测清晰度,连“做好了”都定义不出来的任务,训练无从下手,数据再多也是原料堆。
第三,这是一笔有隐含条件的交换。企业交出工作流细节,换模型能力或换更好的服务,数据的主权和边界值得在合同里抠清楚。你的流程数据越值钱,越该想清楚换回来的是什么。
对创业者,判断标准只有一条:没有向真实数据靠拢路线图的数据公司,不值得投也不值得做。对企业,先算四个乘数,算不过来就别碰训练,把数据当成可谈判的资产,去换更好的模型服务。位置最好的永远是占着工作流入口的那一方,矿在你地里,挖法可以慢慢谈。
要点:长程任务让真实工作流数据成为新稀缺资源;数据市场的两端错配催生供数据和造环境两类公司;好数据卡在模型能力边界上,过难和过易都没价值;企业自训看数据独特性、评测清晰度、任务频率、单次价值四个乘数;数据生意按窗口期估值,独特性常被高估,评测清晰度最常缺席;占住工作流入口是结构里最好的位置。