如果要选出2026年互联网世界的“公害”,那么AI爬虫一定榜上有名。大批中小网站、个人博客已经被AI爬虫逼到崩溃的边缘,为抓取更多的数据训练模型,AI厂商的爬虫以近乎DDoS的方式疯狂访问他们能访问的网站。
![]()
当大量中小网站开始关闭,实质上掌握互联网流量分配权的谷歌终于行动起来。目前,谷歌正在逐步推广一种新的搜索结果跳转机制,当用户点击搜索结果时,链接不再直接指向目标网页,而是为搜索结果对应的网址(URL)添加“goto”跳转参数。
对此谷歌公司发言人表示,“我们长期以来一直在部署技术措施以应对不断演变的滥用行为,并会定期采取行动保护我们的服务和用户”。
事实上,在常规的Web开发中,goto并非标准协议参数,而是由开发者自定义的查询参数(Query Parameter)。在长期的实践过程中,Web开发者普遍会选择将goto参数作为重定向目标。例如用户从网站的某个页面登录账号系统,登录成功后系统会将其重定向至原页面,这时URL中便包含类似goto=/original-page这样的参数。
![]()
那么谷歌为搜索结果对应的网址(URL)添加“goto”跳转参数,让用户的访问先来到带有“google.com/goto”参数的中转地址为什么能反AI爬虫呢?这是因为“重定向”在反爬策略中,是比直接封IP更柔和却又有效的方式。其逻辑是通过检测请求的合法性,将爬虫请求重定向到验证页或空白页,这时候爬虫往往就会自动跟随重定向而丢失目标数据,或者干脆无法识别重定向。
谷歌为搜索结果的URL加入goto跳转参数后,谷歌的服务器就将负责最终的重定向跳转。由于这些goto链接无法被直接解码,爬虫服务商就必须实际跟随完整的重定向链路才能识别最终页面,无法再像之前那样批量快速提取真实网址对应的页面内容。
一直以来,AI爬虫并不是一次只抓取几个网页,在大规模抓取场景下,每个搜索结果页可能就包含数百个URL,爬虫要是逐一解析每一个URL,就会显著增加数据获取的成本与难度。简而言之,谷歌这个新策略并不能从技术层面过滤AI厂商的爬虫,而是大幅度提升AI爬虫的运行成本,消耗AI厂商宝贵的算力和带宽,让后者觉得爬取网站缺乏性价比。
![]()
那么问题就来了,百度会跟进谷歌的这个做法吗?大概率不会,倒不是因为百度不想维护自己的搜索生态,而是没必要。
网络技术调查机构W3Techs去年公布的一组数据显示,截至2024年,在全球所有可被搜索引擎抓取的公开网站中,中文内容占比仅为1.3%,在全球排名第13位,不仅远低于英语的51.7%,还排在了俄语、法语、西班牙语后面,只略高于印尼语和越南语。
当然不是不生产中文内容,恰恰相反,中文互联网的内容产量极其庞大。只不过这些内容大部分被困在了搜索引擎触达不到的地方,也就是App、小程序里。为了自家的注意力生意,各大互联网厂商纷纷选择“圈地自萌”,甚至就连百度自己都在做大做强百度App。
虽然超级App提供的一站式闭环体验满足了用户大部分需求,但也让用户习惯于在一个App里完成所有操作。不仅如此,相比注册抖音、微信公众号,搭建并运营一个网站的门槛要高得多,所以贡献高质量内容的创作者也就随之迁移到知乎、小红书、B站、微信公众号等平台。
![]()
相比于自行建站的成本,直接托庇于这些平台显然才是更具性价比的选择,比如服装企业直接在天猫开店,以及餐厅在美团提供外卖服务的成本,无疑要远低于自己建设网站并进行推广。同时,大量国内网民第一次触网是通过智能手机而非PC,所以他们也更习惯通过App来获取信息。
如此一来,当平台、创作者、用户都在拥抱App时,Web生态又岂有不衰退的道理。从某种意义上来说,海外的中小网站、个人博客在国内变成了不同平台的大V、中V、小V。海外创作者既然选择了更自由、开放的网站,自然就要自己来负责反爬虫,而国内创作者选择受控于平台的规则,反爬虫这个工作也就“外包”给了平台。
【本文图片来自网络】
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.