AI大模型的“数据饥渴”正在带火一个老概念:付费互联网。具体到眼下,就是网站向AI机器人收取“爬取费”(pay-to-crawl)。这个想法理论上很美好,但目前的落地提案却让人捏把汗。
事情是这样的。无论是训练还是运行主流AI模型,都需要从互联网上抓取海量数据。这笔流量对网站来说是有成本的——带宽、服务器、电费,都得真金白银地掏。如果访问者是真人,这钱花得还算值;但如果对面是个AI机器人,那基本就是纯亏本买卖。数据显示,如今互联网流量的大头已经是机器人了。
![]()
网站主当然想拦。麻烦在于,有些机器人为了混进来,手段相当不光彩:无视robots.txt协议、伪装成普通浏览器的user-agent,甚至偷偷借用普通用户的电脑算力来爬数据。你可能装了个浏览器插件,电脑就在不知情的情况下成了AI训练的“免费劳工”,电费还得自己出。
收钱,是拦不住之后的“B计划”
既然完全挡不住,一些公司和机构开始换思路:既然拦不住,那就让AI机器人交钱进门。这就是“pay-to-crawl”的由来。
从理念上讲,这其实是个好方向。互联网最初的设计构想里,付费访问本来就是题中之义。只是当年没有合适的支付系统,广告才趁虚而入,但也带来了不少副作用。这些年一直有人想用微支付替代广告,包括我自己也做过类似系统,但都因为广告平台的网络效应太强而没能推广开。AI机器人目前还没有形成这种网络效应,所以“爬取费”或许真能成为撬动付费互联网的那根杠杆。如果真能成,那将是一个更公平、更高效的互联网的开端。
但现在的提案,让人乐观不起来
问题出在具体操作上。目前提出的方案,本质上是自愿性质的自动化授权框架,根本解决不了“机器人伪装成真人”这个核心难题。更尴尬的是,它们提供的授权许可,在法律上可能压根不是AI训练的必要条件——美国法院已经多次裁定,AI训练属于“合理使用”范畴。这么一来,所谓“爬取费”从技术角度看,最大的用处就变成了打造“AI专属数据图书馆”。
打个比方,就像建了一个只有通过Gemini才能访问的“维基百科”。这滋味可不太好受。
更糟的选项:让一家公司卡住全网咽喉
既然“爬取费”分不清真人和机器人,那就有人想用技术手段来硬分。Cloudflare是目前最大的机器人拦截服务商,它也在试验自己的“爬取费”系统。理论上,它确实能逼一部分机器人交钱。但我认为这个方案更糟——它会把太大的权力交给单一公司。要知道,Cloudflare现在就已经控制着全球约20%的互联网流量。
一个公司既当裁判(判定谁是机器人)又当收费员(决定收多少钱),这局面怎么看都让人不安。
更好的解法:向所有人收一笔“过路费”
在我看来,更优的方案是:向每一个用户收取一笔微支付,用来覆盖网站的基础托管成本——不管你是真人还是机器人。这笔费用对真人来说几乎可以忽略不计,毕竟我们消费数据的速度慢得多。而现有的支付系统,其实已经足够支撑这种小额交易了。
这个思路的好处在于,它不试图去分辨谁是人谁是机器,而是把成本分摊到所有访问者头上。真人几乎无感,机器人则必须为它消耗的资源买单。既公平,又不会把权力集中在少数几家巨头手里。
“爬取费”这个概念本身值得期待,但通往更公平互联网的路,显然不该是给AI建围墙,更不该是给Cloudflare这样的公司发“收费站”牌照。真正的解法,应该是让每一比特数据的流动,都有一笔对得起它成本的“小费”。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.