Cloudflare 推出“禁止 AI 训练”设置:保留搜索收录,拒绝训练抓取

Cloudflare AI Bl2 天前

Cloudflare 宣布推出新的 “禁止 AI 训练”(Disallow AI Training) 设置,试图解决网站所有者长期面临的两难:如果允许搜索引擎爬取内容,内容可能同时被用于 AI 训练;如果完全拒绝爬虫,又可能影响搜索可见性。

这一问题的核心在于,一些大型互联网公司使用的是 混合用途爬虫:同一个爬虫既用于搜索索引,也可能用于 AI 训练。过去,网站所有者往往无法只拒绝其中一种用途。

新设置解决什么问题?

“禁止 AI 训练”设置会通过 robots.txt 发布相应偏好,让网站在继续允许搜索索引的同时,表达不允许内容被用于 AI 训练的意愿。

Cloudflare 表示,Apple、Google 和 Microsoft 已经遵守或承诺在明确时间范围内遵守这一设置。

也就是说,对于被 Cloudflare 认定为符合要求的混合用途爬虫,网站可以:

  • 继续允许其用于搜索索引;
  • 拒绝其将内容用于 AI 训练;
  • 避免“一封全封”导致搜索可见性受损。

为什么 robots.txt 本身还不够?

Cloudflare 认为,仅靠 robots.txt 指令无法完整解决问题,原因包括:

  • robots.txt 可以表达偏好,但无法确认是谁在抓取;
  • 无法判断爬虫抓取的具体目的;
  • 无法阻止不遵守规则的爬虫。

Cloudflare 的做法是结合网络层能力:发布网站偏好、识别爬虫身份、分类爬取目的,并阻止不遵守偏好的爬虫。

“Accountable” designation:对爬虫运营方提出要求

Cloudflare 还引入了一个名为 Accountable 的认定,用于标识那些提供控制能力并作出明确承诺的爬虫运营方。

要获得这一认定,爬虫运营方需要满足或承诺满足以下要求:

  1. 提供网站所有者退出 AI 训练的机制,例如通过 robots.txt 或类似标准;
  2. 提供退出 AI 摘要的机制,当前可由运营方直接设置,未来计划通过 Cloudflare 统一设置;
  3. 提供 URL 级别的可见性,让网站所有者了解哪些页面可被用于训练,并提供内容在搜索中出现的相关指标;
  4. 保证退出 AI 训练不会影响传统搜索结果。

Cloudflare 称,Apple、Google 和 Microsoft 均符合 Accountable 的资格要求,既包括已经可用的能力,也包括仍在开发但有明确时间表的承诺。

三类爬虫行为:搜索、训练、代理

Cloudflare 将机器人行为分为三类,并提供对应控制:

  • Search(搜索):用于构建搜索索引;
  • Training(训练):用于训练或微调模型;
  • Agent(代理):代表用户访问页面,例如聊天检索机器人或浏览器使用代理。

混合用途爬虫的问题在于,它们同时承担搜索和训练任务。新的“禁止 AI 训练”设置主要针对这类场景。

设置选项发生变化

随着新设置上线,Cloudflare 的相关控制项也发生调整。可选项包括:

  1. Allow(允许)
    默认允许所有爬虫,除非被其他设置或防火墙规则拦截。

  2. Disallow AI Training(禁止 AI 训练)
    通过 robots.txt 发布不允许训练的偏好。符合 Accountable 要求的混合用途爬虫仍可用于搜索;其他训练爬虫会被阻止。Cloudflare 提到,Amazon、Anthropic、Meta 和 OpenAI 的训练专用爬虫会被阻止,而这不会影响搜索。

  3. Block on pages with ads(在含广告页面阻止)
    只在检测到页面投放广告时阻止爬虫,包括混合用途爬虫。

  4. Block(阻止)
    阻止所有相关爬虫,包括混合用途爬虫。这也意味着 Applebot、Bingbot、Googlebot 等无法访问网站,搜索收录也可能受到影响。

Cloudflare 特别强调,如果网站希望拒绝训练但保留搜索,应选择 Disallow AI Training,而不是直接选择 Block

9 月 15 日起的变化

Cloudflare 表示,自 9 月 15 日起,Bot Management 和 AI Crawl Control 将发生以下变化:

  • “Block”和“Block on pages with ads”将适用于混合用途爬虫,包括 Applebot、Bingbot 和 Googlebot;
  • 这意味着使用这些阻止选项会同时影响搜索和训练;
  • “Block AI Bots”将被更细粒度的 Search、Training、Agent 控制取代;
  • Managed Robots.txt 将由 Bot Preference Sync 取代;
  • 已启用 Managed Robots.txt 的客户会迁移到新系统;
  • “禁止 AI 训练”将成为部分新域名的推荐配置之一。

对于大多数现有用户,Cloudflare 表示无需额外操作,现有设置会自动迁移。

对主要爬虫的影响

Cloudflare 将 Applebot、Bingbot 和 Googlebot 归类为 Accountable。启用“禁止 AI 训练”后,它们仍可用于搜索抓取;如果选择“阻止”,则会被完全拦截,包括搜索用途。

此外,Cloudflare 也将 Amazon、Anthropic、Meta 和 OpenAI 的相关爬虫归入 Accountable 范畴。不过这些公司的搜索与训练爬虫是分开的,因此 Cloudflare 可以只阻止训练爬虫,而不影响搜索。

Applebot

Applebot 支持网站通过 robots.txt 中针对 “Applebot-Extended” 的 Disallow 规则退出训练。

网站也可以通过页面 HTML 中的 nosnippet 指令表达对 AI 摘要的偏好。对于付费墙内容,也可以通过标记方式将其排除在生成式输出之外。

Cloudflare 提到,Applebot 目前尚未提供 URL 级别检查工具,但 Apple 团队已分享正在开发中的方案,目标是在明年提供。Apple 也表示,禁止训练不会影响搜索排名。

Googlebot

Googlebot 支持网站通过 robots.txt 中针对 “Google-Extended” 的 Disallow 规则退出训练。

Google 还在站长工具中提供开关,允许网站将内容排除在生成式搜索结果之外,并提供与搜索结果和 AI 摘要结果相关的指标与报告。

Cloudflare 表示,Google 已分享现有和近期推出的控制能力,并正在开发与 Google-Extended 相关的更多 URL 级透明度工具,预计将在未来数周推出。Google 也表示,禁止 Google-Extended 不会影响网站在 Google 搜索中的收录或排名信号。

仍待发展的部分:AI 摘要控制

Cloudflare 认为,AI 摘要是下一步需要解决的问题。简单地允许或拒绝并不够,因为摘要中包含多少内容同样重要。

Cloudflare 的目标是在明年初,让网站所有者可以通过 Cloudflare 一次性控制内容在 AI 摘要中的使用程度,而不必分别到不同运营方处设置。

对网站运营者的意义

这项更新对依赖搜索流量、广告、订阅或直接访问关系的网站较为重要。它提供了一种更细粒度的选择:

  • 不必为了拒绝 AI 训练而牺牲搜索发现;
  • 可以区分搜索、训练和代理访问;
  • 对混合用途爬虫有更明确的控制路径;
  • 对不遵守偏好的训练爬虫进行阻止。

不过,这一机制的实际效果仍取决于爬虫运营方是否遵守相关偏好,以及 Cloudflare 对爬虫身份和用途的识别能力。

评论

请登录后发表观点

暂无数据