趋势 方法 投研 作者
返回趋势

四成大网站拉黑 AI,问题是没人会收机器的钱

2025/04/21

深度思想,谈 AI 与向往 —— 字节深思圈

2024 年 7 月,全球流量前一万的网站里,只有 9% 屏蔽 AI 爬虫。一年之后,这个数字是 37%,而且还在涨。

网站主人拦的并非某个具体的机器人,而是一种新局面:互联网上将近一半的流量已经不来自人类。这些机器访客读走内容,拿去喂模型或者替人办事,一分钱不付,带宽和服务器的成本还得网站自己扛。

多数讨论把这当成攻防战:爬虫越来越会躲,屏蔽越来越狠。但攻防只是表象。真正的问题是,互联网这套系统从头到尾按"使用者是人"来设计,计价、支付、身份,全都默认对面坐着一个人。当对面换成机器,整套商业逻辑失灵,失灵的方式比想象中彻底。

互联网给人类用户打的三个补丁,机器全用不上

先看广告。互联网最主流的商业模式是"你看内容,我卖你的注意力"。这个模型对机器完全无效:爬虫不看广告,不产生注意力,广告主也不会为一次机器访问掏钱。内容被抓走的网站,等于免费替别人搬砖。

再看支付。人类用户有银行卡、有订阅账户,互联网的商业闭环建立在这上面。AI 代理没有银行账户,开不了户,也过不了 KYC。让一个代理按次为抓取的网页付钱,今天的金融体系里找不到对应的接口:单笔金额太小,频次太高,主体还不是人。

最后是身份。机器人可以无限复制,一台服务器一夜之间能"变成"一万个用户。判断对面是人是机器,现在主要靠验证码这类老办法,而新一代模型已经能解题。深度伪造和社交水军让这件事雪上加霜:不只是分不清对面是谁,连对面"是不是人"都成了问题。

这三套系统同时失效,就是过去两年冲突的根子。法律先动了:多家美国报纸起诉模型公司侵犯版权,教育类网站在学生大量改用 AI 工具后流量锐减,索性砌墙。屏蔽率从 9% 涨到 37%,是这场诉讼战和封锁战的直接后果。

但诉讼算不清账。一场官司能定一个总额的赔偿,却算不出某一次抓取到底值多少钱、该分给链条上的哪一层。如果一个数据集同时被几千个爬虫引用过,贡献怎么归因、分成怎么结算,法院给不了粒度。定价这件事,最终需要一个技术方案来收尾。

机器用户需要一套机器原生的轨道

这时候区块链才有出场的机会。它在整件事里的角色不是币价,是给机器世界重建三样东西:机器的支付、机器的身份、机器能读懂的产权记录。

支付这块,数字现金系统恰好能补上金融体系的缺口:近乎零成本的小额结算、可编程的分成规则、不需要银行账户也能持有。一个爬虫代理可以带着链上余额,跟每个网站的准入协议实时议价,抓一页付一页;智能合约还能把一次付费自动拆给上游的多个内容来源。x402 这类付费协议已经在朝这个方向做。人类用户则可以走另一条通道:用"人格证明"类的去中心化身份工具证明自己是人,继续免费访问。网站由此第一次能把机器流量和人类流量分开定价。

身份这块同理。AI 代理需要一个跨平台通用的"数字护照":谁签发的、什么版本、能干什么活、历史信誉如何,任何接口都能统一解析。没有这层公共身份,代理每接入一个系统都要从零谈,换个渠道信誉就清零,发现机制永远停留在临时拼凑。产权记录也一样:训练数据、模型权重、生成内容的归属和授权,如果要机器自动执行,就得写成机器可读、无人能单方面篡改的登记格式。Story Protocol 这类确权协议和链上 IP 注册的早期尝试,赌的就是这一层。

不过要泼一盆冷水。Crypto 与 AI 的结合清单可以列得很长,从去中心化算力到链上 AI 伴侣,条条听起来都像未来。多数条目经不起一个追问:这个问题,是机器带来的新问题吗?

我的筛子只有这一条。机器支付、机器身份、机器可读确权,这三个矛盾在机器成为互联网主力用户之前并不尖锐,传统方案确实接不住,区块链有机会。而去中心化算力、隐私广告、链上 AI 伴侣,这些问题要么早就存在,要么区块链在解法里可有可无,加进去更多是为了叙事完整。判断一个交叉场景的真伪,就把它放进纯 Web2 环境里看会不会卡死:卡死的才是真需求,能绕过去的只是装饰。

还有一层容易被忽略:区块链在这些场景里的真正卖点,不是性能。论用户体验,垂直整合的大平台永远做得更好,亚马逊和 Facebook 的封闭身份体系今天依然是体验最优解。区块链卖的是"没有谁说了算"。当互联网的谈判桌一边是几十万个中小网站、另一边是少数几家模型巨头时,一个中立的中间层才有价值。这本质上是反垄断的政治问题,只是顺带用技术手段解决。

三个真问题,和它们各自的拐点条件

机器带来的新问题现有方案为什么接不住可能的新轨道
代理按次为内容付费银行卡、订阅制机器无法开户,小额高频结算成本过高链上微支付与付费爬虫协议
代理跨平台身份与信誉平台内账号体系身份锁在围墙内,信誉不可迁移可移植的代理数字护照
训练数据归属与自动分成版权诉讼、人工授权算不清每次使用的账,无法自动执行机器可读的确权与分账登记

拐点什么时候来?可以盯三个信号。一是主流托管服务(Cloudflare 这一层的 CDN)是否开始内置付费爬虫协议,robots.txt 的君子协定是九十年代的遗产,靠它自己不会进化成收费系统。二是人格证明类身份的用户量是否过临界规模,这类基础设施有网络效应,早期慢,过了临界点会突然加速。三是第一个"不付费就抓不到高质量内容"的杀手级场景是否出现。

在那之前,这些尝试大多停留在实验阶段,时间尺度是年,不是季度。

对做 Agent 的人和投 Agent 的人,这个判断有实际含义。机器原生的支付和身份,大概率是 Agent 基础设施里迟到但绕不开的一块:现在把它当配角的团队,等轨道修好再补票,价格会比想象中高。反过来,如果只是在产品白皮书里给 AI 场景加一层链的叙事,趁早省下这份力气。机器不需要叙事,机器只认接口。

最后更新于