Cloudflare澄清了一件事:它的AI流量控制影响的不只是专门的AI爬虫。按照该公司更新后的政策,一个网站如果选择了阻止Training,那么在提供广告的页面上,像Googlebot、Applebot、BingBot这类"混合用途"爬虫也可能被一并拦截。对依赖自然搜索流量的生意来说,真正要分辨的问题已经变了——不再是"AI机器人有没有被挡住",而是"当前这套策略,有没有在限制AI训练的同时,把搜索发现的路也堵上"。
三个开关,取代了那个一键按钮
![]()
Cloudflare在2026年9月15日宣布了这套扩展方案,用Search、Agent、Training三个独立控制项,替换掉了早先那个"一键阻止AI机器人"的模式。
这个变化的意义在于颗粒度。新框架把爬虫访问拆成三类,站长的控制力更强了,但配置选择的后果也更重了。因为一个爬虫可以同时承担多种功能——搜索索引、AI代理活动、模型训练。只盯着其中一个功能去拦,却忽略了这个爬虫的其他行为,就可能波及搜索可见性。
需要特别说明的是,这些默认设置适用于2026年9月15日新接入的域名,不能想当然地认为它描述了所有已有的Cloudflare配置。团队应该去自己的账户里检查设置,尤其是那些用旧的"阻止AI机器人"控件创建过策略的地方。
混合用途爬虫,是按"全部行为"来评估的
技术上的关键点,在于Cloudflare怎么处理混合用途爬虫。Googlebot、Applebot和BingBot都能执行不止一种相关功能。当网站选择阻止Training时,Cloudflare的策略就可能在带广告的页面上把这些爬虫也拦下来。这会打断搜索爬虫抓取内容用于索引的正常路径。
Cloudflare给出的替代方案是"Accountable爬虫"思路。公司把苹果、谷歌、微软认定为可问责的提供方,它们承诺不将受保护内容用于训练、也不用于摘要。在这个分类适用的情况下,选择"Disallow AI Training"就能让搜索发现继续进行,同时表明内容不供AI训练使用。
对站长来说,这提醒了一件事:机器人策略如今既是内容使用设置,也是SEO设置。想阻止模型训练,并不必然意味着要把一家具备AI能力的公司旗下的所有爬虫都拒之门外。
动手前,先过一遍这份清单
一次实际的复查,至少应该覆盖以下几点:
- 把Search和Training的决定分开。不要假设一个宽泛的AI拦截策略能保住自然搜索抓取。
- 仔细检查带广告的页面。Cloudflare的Agent默认设置,专门和提供广告的页面挂钩。
- 复查遗留配置。旧的一键设置可能并不反映新的三控件模型或原本想要的策略。
- 在合适的地方使用Disallow AI Training。Cloudflare把它描述为一条路径:既保留可问责爬虫的索引,又限制训练。
- 策略变更后监控抓取和可见性。自然流量或索引的变化,往往是最早的信号,说明某个重要爬虫已经失去了访问权限。
Cloudflare还推出了Bot Preference Sync,用来让网站的robots.txt和策略设置保持一致。这能降低在两个地方维护互相矛盾指令的风险。它并没有消除"网站到底想要哪类访问"这个必须做的决定,但让这个策略更容易被一致地表达出来。
对市场或网站团队来说,操作层面的教训很直接:机器人控制应该成为一套有记录的SEO变更流程的一部分。在改动Training、Search或Agent规则之前,记录下当前配置,并确定哪些爬虫对发现至关重要。改动之后,密切观察索引和流量信号,以便在意外访问问题演变成长期可见性损失之前就识别出来。
对于同时应对AI搜索和传统搜索的企业,机器人设置会直接影响有价值的页面是否还能被发现。爬虫策略、技术
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.