AI 没有品味,是因为它天生爱求平均
深度思想,谈 AI 与向往 —— 字节深思圈
打开任何一个 AI 生成内容的平台,你都有一种熟悉的感觉:产出的东西越来越多,看起来却越来越像同一个人做的。配色是那几套,文案是那个腔调,设计稿像从同一条流水线上跑出来的。这个现象有个名字,叫 AI slop。
多数人把原因归结为"模型只会模仿,没有创造力"。这个解释听着顺,其实什么都没说,它把问题推给了模型,却说不清模型为什么会这样。
我最近听到一种讲法,把这件事的底层逻辑拆得很干净。讲的人是 Taste Labs 的创始人 Thais,一家专门研究"AI 在主观领域为什么不行"的公司。她的结论可以浓缩成一句话:AI 没有品味,根源在训练信号,它一直在奖励平均值。
能测量的地方,模型才会进步
先说一个背景判断。我们习惯说"模型很擅长写代码",好像这是模型自带的本事。Thais 的看法正好相反:这其实是代码的特性。
代码可以被执行、被验证。写错了,跑一遍就报错;写对了,测试通过。反馈信号干净、明确,可以直接拿去训练。设计做不到这一点。你让一个人看一个页面,他多半只会说"感觉不太对",说不清哪里不对;换一个人看,判断可能完全不同。审美还会变,五年前时髦的风格,今天可能已经过时。可 2 加 2 等于 4,不会因为时代变了就变成 5。
她把这个差异概括成一句话:能力跟着可测量性走。能测量的地方,模型在进步;测量不了的地方,模型停在原地。
这个框架比"AI 有没有创造力"的争论有用得多。它把问题从玄学变成了结构:主观领域难,难在它的"好"没有客观答案,而是一个依赖人和情境、还会随时间漂移的判断。把两类问题混在一张能力地图上讨论,本来就说不清楚。
模型的天性是求平均
接下来是她讲得最狠的一个概念,也是解释 AI slop 的底层机制。
模型的训练方式,本质上是预测"下一个最可能出现的内容"。在数学和代码里,最可能出现的答案恰好也是最好的答案:2 加 2 等于 4,既是出现频率最高的答案,也是唯一正确的答案,两者重合。设计和写作里,最常见的答案和最好的答案之间,隔着一道很宽的裂缝。
真正让人记住的创意,几乎都发生在分布的边缘:有意打破惯例的那支广告、偏离常规的那张海报、别人不敢用的那组配色。而模型的优化目标天然地把输出往中间拉,往"最常见"靠。结果就是输出越来越像均值:不差,但绝不惊艳,像你见过一百次的那种东西。
而且这个毛病不会随参数变大自动消失。更大的模型只是在更大的数据集上做了更精确的均值估计,它不会自己学会"什么时候该打破规律"。你抱怨 AI 生成的东西没有灵魂,真正该追问的是:训练信号有没有奖励过"不平均"。
把品味拆成能验证的问题
Thais 给了几条可操作的路径,核心是分解。
“这个设计好不好"没法回答,“这个页面符不符合品牌调性"就具体多了。把一个品牌拆开看:用了什么颜色、什么字体、间距怎么定、动效是快是慢、有没有纹理。每一单项都有对错,AI 生成的页面可以逐项打分:颜色用对了吗,字体是品牌规范里的吗,间距符合设计系统吗。分解的价值在于,它把一个模糊的"好"变成一串可验证的子问题,这些子问题本身就能当训练用的基准答案。
还有一个更隐蔽的坑在数据上。常见的做法是找一堆人打分,把分数平均掉当训练信号。但不同人的审美本来就不同,这些分歧是真实世界的一部分。平均掉之后,你得不到更好的答案,只剩一个谁的偏好都没被代表的混合物。
她的做法是给每类用户建一个偏好向量,和训练数据绑在一起。模型学到的不是"好设计的统一标准”,而是"对这种偏好的人,什么算好”。她还处理了专家打架的情况:两个专家对同一个设计评价相反,如果是风格偏好上的分歧,这是数据真实捕捉到了偏好差异,应该保留;只有在对齐这种客观问题上打架,才说明数据本身有问题。
一句话总结:在主观领域,数据质量远比数据数量重要。喂进去的是均值,出来的就是均值;喂进去保留了真实多样性的专家数据,出来的才有可能有品味。
对做产品的人意味着什么
把这几段机制合起来,有几条判断可以直接拿走。
第一,别指望"等更大的模型"解决品味问题。先想清楚自己产品里哪部分有客观对错,哪部分是纯主观。有对错的部分放心交给模型迭代;纯主观的部分,要么自己下场把"好"拆成规则,要么老老实实攒高质量偏好数据。把模糊问题交给模糊信号,结果必然平庸。
第二,个性化要深一层。现在多数产品做"千人千面",是在行为层面打标签:你点了什么,我推什么。审美层面的个性化是另一回事,是理解一个人的判断标准,他在什么情境下喜欢什么。这一层建起来,产品能做的就从"推你可能喜欢的"变成"帮你生成、筛选出符合你品味的东西"。
第三,均值本身也是一门生意。讨好大多数人的安全设计,靠"绝不犯错"也能赚钱。所以真正要回答的问题是:你要的是让大多数人觉得还行,还是让一小群人觉得惊艳。选后者,就得从现在开始攒差异化的品味数据,这条路又贵又慢,没有捷径,因为它直接决定模型输出的天花板。
要点:AI slop 的根源是训练信号奖励均值(最常见≠最好);代码能训好是因为可验证,能力跟着可测量性走;解法是分解成可验证子问题、用偏好向量保留分歧;均值也是生意,先想清自己要大众的安全还是小众的惊艳。