从 Googlebot 到 GPTBot:2025 年谁在爬取您的网站(二)
robots.txt 和 AI 机器人:GPTBot 两次领先
根据 Cloudflare Radar 截至 2025 年 6 月 6 日的数据显示,在我们能够找到 robots.txt 文件的 3,816 个域中(前 10,000 个),有 546 个(约 14%)域的 robots.txt 文件包含针对 AI 机器人的“允许”或“禁止”(全部或部分)指令。
这让许多网站所有者处于一个灰色区域,因为并不总是清楚 robots.txt 在管理 AI 爬虫方面的效果。一些网站所有者可能不会想到专门针对 AI 机器人而使用它,而另一些人可能不确定这些机器人是否会遵守 robots.txt 规则,尤其是较新或透明度较低的爬虫。在其他情况下,网站会使用部分规则进行访问微调,尝试在不完全选择加入或退出的情况下平衡可见性与保护。
“禁止”规则出现的频率远高于“允许”规则。最常被阻止的机器人是 GPTBot ,被 312 个域(250 个完全,62 个部分)禁止,其次是 CCBot 和 Google-Extending ,如下图所示。
图1
尽管 GPTBot 被阻止最多,但它也是最被明确允许的,有 61 个域授予访问权限(18 个完全,43 个部分)。尽管如此,公开且明确允许 AI 机器人访问的网站仍寥寥无几,即便允许,通常也仅针对有限的部分。请注意,站点的 robots.txt 中未列出的机器人默认情况下是被允许的。
随着 AI 爬取活动增加,越来越多网站正在从 robots.txt 等被动保护措施转向 Web 应用防火墙 等主动式保护方案。生态系统正在发生变化,越来越注重可执行的控制措施。
注意:在分析爬虫流量时,我们将 robots.txt 文件中找到的用户代理令牌(如 AI 爬虫的用户代理)与 HTTP 请求中的实际用户代理字符串进行比较。值得注意的是,某些 robots.txt 令牌(例如 Google-Extended)不是用户代理子字符串。如 RFC 9309 中所述,这些令牌的一个目标可能是表明爬虫的用途。例如,Google 在 robots.txt 中使用 Google-Extended 来查看您的内容是否可用于 AI 训练,但流量本身仍来自标准的 Google 用户代理,例如 Googlebot。因此,并非每个 robots.txt 条目在 HTTP 请求日志中都会有直接匹配。
总结
随着 AI 爬虫重塑互联网,网站在管理其在线状态时既面临新的挑战,也迎来新的机遇。
本次分析凸显了 AI 对 Web 爬虫的影响与日俱增,表明其已从传统的搜索索引明确转向为训练 AI 模型进行数据收集。详细统计数据,例如 Googlebot 的持续增长和 AI 爬虫的快速崛起,为理解该领域的发展及其对未来 Web 内容访问的影响提供了背景参考。
目前的趋势是采用更强大、可执行的屏蔽方法,Cloudflare 也有参与其中,这也标志着未来网站控制与 AI 系统交互的方式将发生关键转变。
Cloudflare 保护整个企业网络,帮助客户高效构建互联网规模的应用程序,加速任何网站或互联网应用程序,抵御 DDoS 攻击,防止黑客入侵,并能协助您实现 Zero Trust 的部署与实施。
从任何设备访问 1.1.1.1,使用我们的免费应用加速和保护您的互联网。
立即联系我们,获取更多相关信息http://t.cn/A6Tx4yTT
#Cloudflare##爬虫##AI#
