你打开一个普通网站,看到的不是内容,而是一道数学题。浏览器要先算完这道题,才能进入页面。这不是什么极客彩蛋,而是站长们被AI爬虫逼出来的防御手段。
这个网站的管理员部署了Anubis,专门用来挡住那些疯狂抓取网页的AI公司。这些爬虫的抓取量太大,经常把网站拖到宕机,让正常用户也访问不了。Anubis的思路借鉴了Hashcash——当年有人提出用工作量证明来减少垃圾邮件,现在同样的逻辑被拿来对付AI爬虫。
![]()
核心逻辑:让单次访问几乎无感,让大规模抓取贵到肉疼
Anubis的设计很直接。普通用户偶尔访问一次,多出来的计算量可以忽略不计,页面照样秒开。但爬虫要抓的是几十万、几百万个页面,每个页面都要求算一道题,成本就会迅速累积。抓取规模越大,要付出的算力就越高,最终让批量抓取变得不划算。
这本质上是一道经济账。AI公司不是技术上解不开这些题,而是当抓取成本超过数据价值时,它们自然会收手。Anubis没有试图从技术上彻底封死爬虫,而是把对抗拉回了成本维度。
这只是个临时方案,真正的方向是识别无头浏览器
Anubis的定位很明确:一个占位解决方案。它争取的是时间,让网站管理员能腾出手来研究更精准的识别手段。比如通过字体渲染方式的差异,判断访问者到底是真人浏览器,还是AI公司批量运行的无头浏览器。
![]()
如果能准确识别无头浏览器,就不需要给每个用户都弹工作量证明页面。那些大概率是正常人的访问可以直接放行,只有可疑流量才需要做题。这样既保住了防御效果,又不会误伤普通用户。
JavaScript成了绕不开的门槛
Anubis有一个硬性要求:必须启用JavaScript。它依赖现代JavaScript特性来完成验证,像JShelter这类会禁用脚本的隐私插件,反而会让验证无法通过。想访问这个网站,就得先关掉这类插件。
站长对此也很无奈。AI公司已经改变了网站托管的社会契约——过去网站默认开放给所有人访问,现在却要先验证访问者是不是机器人。一个不需要JavaScript的解决方案还在开发中,但眼下,没有脚本就过不了这道关卡。
这件事折射出的问题比技术本身更值得琢磨。当AI公司把公开网页当成免费训练语料库,网站运营者被迫在开放与生存之间做选择。工作量证明只是第一道防线,它背后是互联网内容生态正在被重新划分边界。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.