The Cloudflare Blog

Say it once: introducing Bot Preference Sync

8.5内容质量

TL;DR · AI 摘要

Cloudflare推出Bot Preference Sync,同步robots.txt与AI爬虫配置,简化网站管理。

核心要点

  • Bot Preference Sync自动更新robots.txt,减少手动维护
  • 适用于所有Cloudflare用户,从免费到企业级
  • 解决robots.txt与规则不一致导致的爬虫问题

结构提纲

按章节快速跳转。

  1. 介绍网站管理员在管理AI爬虫时面临的多层配置问题

  2. Bot Preference Sync通过同步robots.txt与AI配置解决规则不一致问题

  3. 互联网面临内容被AI训练、发现率与流量统计等新问题

  4. 电商与媒体等不同业务模型对AI爬虫管理需求差异显著

  5. 功能可随时开关,无需维护静态文件

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Bot Preference Sync
    • 核心功能
      • 自动同步robots.txt与AI配置
      • 支持开关控制
    • 解决的问题
      • 规则不一致导致的爬虫冲突
      • 多层配置维护复杂
    • 适用场景
      • 电商内容训练
      • 媒体内容保护

金句 / Highlights

值得收藏与分享的关键句。

#Bot Management#AI Bots#Cloudflare#robots.txt
打开原文

一次设定:推出 Bot Preference Sync | Cloudflare 博客

post

网络服务

产品新闻

AI 机器人

机器人管理

机器人

2026年8月21日

一次设定:推出 Bot Preference Sync

Jin-Hee Lee

8分钟阅读

复制链接

我们一直在为客户的不同目标构建解决方案。有些客户希望优化发现性,而另一些客户则希望以最严格的安全策略保护其内容。在这些不同的策略中,有多种方式可以缓解机器人流量。一些机制仅陈述您的偏好,假设爬虫的最佳意图,而其他方法则通过机器人管理解决方案直接阻止内容来锁定内容。

我们认识到,在网站上维护多层保护措施很繁琐。例如,有时您的 robots.txt 文件声明爬虫被禁止访问您的网站,而您的执行规则实际上并未阻止该爬虫。当您声明的偏好与执行的规则不一致时,一些爬虫会将其视为忽视您偏好或尝试绕过执行规则的依据。

几年前,Cloudflare 宣布了一种更简单的方法来禁止 AI 训练在您的网站上进行,通过解决其中两层:一个管理的 robots.txt 值,告诉固定列表的主要训练爬虫不要在您的内容上进行训练,以及边缘强制阻止训练爬虫。2026年7月1日,我们推出了更简单的选项来管理不同类型的 AI 流量使用场景。您现在可以明确说明您对网站上搜索、代理和训练流量的处理方式。

我们宣布推出 Bot Preference Sync,该功能向所有客户开放,从免费层级到企业级客户均可使用。Bot Preference Sync 通过更新对应的 robots.txt 文件中的偏好设置,反映您在 AI 机器人配置中设定的内容,并且可以随时开启或关闭。不再需要为单一使用场景维护静态文件:我们将帮助您根据已为不同 AI 机器人分类配置的内容,定制您的 robots.txt 文件。

互联网面临的新问题

多年来,这个领域最紧迫的问题一直是:“我的内容是否在未经我许可的情况下被用于训练 AI 模型?”这是一个重要问题,不会消失。与此同时,我们越来越多地听到关于可发现性和参与度的问题。当有人向 AI 助手提问时,我如何才能被发现?我的流量中有多少来自 AI 爬虫而不是真实用户?哪些内容真正带来了引荐流量,其价值又如何?

答案因商业模式而异。可发现性和参与度是任何试图在现代网络上繁荣发展的企业都必须优先考虑的关键问题,但这些目标的实现路径不同:一个电子商务商店可能希望所有内容都被爬虫抓取和训练,以便当购物者向聊天机器人询问“适合小公寓的最佳沙发”时,其产品能被展示出来。一个通过广告盈利的出版商可能希望得到相反的结果:保持在将读者引向页面的搜索索引中,但将文章排除在模型训练之外,并且能够验证其内容确实未被未经许可地使用。

没有单一正确的答案,这正是关键所在。您的控制措施应反映您的策略,这也是我们一直在构建工具的原因,以在每一层为您提供可见性和选择权。Bot Preference Sync 将这些内容整合在一起,使您设定的偏好即为发布的偏好。

对透明度的呼吁

2026年7月1日,我们指出混合用途爬虫(即“在单一用户代理背后融合搜索、代理使用和训练的机器人”)使网站所有者处于不利地位,原因正是它们让网站所有者难以区分所需内容和非所需内容。这一观点依然成立,我们对网站所有者透明度的立场也未改变。

但实现透明度的方式不止一种。我们希望奖励那些明确自身身份并清晰说明数据使用方式的运营者。在机器人验证方面,同时执行搜索和训练的机器人所有者需要提供额外信息,以避免在设置“禁止训练”时被封锁。具体要求如下:

  • 机器人必须通过任何机制尊重robots.txt中“禁止训练”的偏好
  • 为网站所有者提供退出AI摘要的选项
  • 提供页面级可见性,明确哪些页面被用于训练,并提供搜索结果的指标,以便您查看内容如何被用于搜索和训练
  • 可公开证明禁止训练不会影响传统搜索结果

符合这些标准的领先AI模型和云服务提供商的机器人会在Cloudflare Radar的AI机器人透明度部分进行公开追踪,其中包含遵循最佳实践和未遵循的案例。不提供透明度的爬虫将不会获得任何优待——当您禁止训练时,它们仍会被封锁。换句话说,这相当于将透明度作为准入的代价。

推出机器人偏好同步功能

机器人偏好同步是一项新功能,可确保您的robots.txt文件反映在Cloudflare区域级仪表板上已为搜索、代理和训练设置的AI机器人偏好。如果网站所有者已有robots.txt文件,机器人偏好同步添加的内容将前置到现有内容之前,从而保留任何现有的禁止指令。

无需网站所有者维护单独的静态文件,Cloudflare将根据您的配置生成或更新robots.txt文件,使您向世界传达的内容与在边缘执行的规则保持一致。

对于搜索和代理,我们7月1日宣布的三个选项仍然有效:允许、在提供广告的页面上阻止或在所有页面上阻止。对于训练,我们正在细化“禁止”选项,以防止内容被用于训练模型:

禁止:将在您的robots.txt中写入“禁止训练”偏好,使采取额外透明度步骤的协作型混合用途爬虫仍可访问您的内容进行搜索索引,因为它们允许网站所有者直接验证数据使用方式。协作型爬虫会遵守robots.txt中的偏好,协作型爬虫的搜索可见性不会受到影响。

以下是一个示例,其中某人已将AI机器人策略配置为“允许搜索、允许代理、禁止训练”:

AI训练和搜索策略配置现有选项的截图,包含将robots.txt内容与这些AI机器人策略同步的新功能。

由于此示例网站已启用机器人偏好同步,其robots.txt文件将前置如下内容(为示例目的已缩短并匿名化):

code
# BEGIN Cloudflare Bot Preference Sync
User-agent: TrainingBot1
User-agent: TrainingBot2
User-agent: TrainingBot3
User-agent: MixedUseBot-Extended
Disallow: /
...
# END Cloudflare Bot Preference Sync

我们将使用 BotBase 中追踪的机器人,定期更新您在选择阻止或禁止特定类别时添加到 robots.txt 的机器人列表。您可以在我们的公共机器人目录中随时查看分类为搜索、代理和训练的已验证机器人。

对于所有新客户,Bot Preference Sync 将默认开启,以便更轻松地管理反映相同策略的阻止和偏好设置。对于使用旧版托管 robots.txt 功能的现有客户,我们将在新功能上线时提示您审核并确认偏好设置以完成过渡。

部分客户可能需要更主动地声明偏好,例如当他们与特定公司有特殊协议需要豁免时。由于 Bot Preference Sync 的设计目标是处理类别级的策略决策而非个案,它不会直接读取具有复杂逻辑的单个自定义规则。对于需要更精细安全策略的客户,始终可以选择关闭设置组策略的同步功能,并根据自定义策略调整文件。

我们还进行了调整,允许出版商或依赖广告盈利的网站拥有与其他网站所有者不同的默认设置。我们创建了新的默认设置,以帮助依赖广告并希望保留广告位仅限人类访问的出版类网站。在客户注册时,此类客户可以选择“我通过本网站的广告页面进行盈利”选项,这将把训练类机器人默认设置为禁止状态。(客户随时可以更改此设置。)这样,您仍可保持在搜索引擎的收录中,同时避免内容被用于模型训练。

对于非出版类网站,新客户在注册域名时默认不会自动添加任何阻止或禁止规则:选择权完全在客户手中。您可以在任何时候选择是否阻止搜索、代理或训练类机器人,但初始设置不会为您自动添加任何阻止规则。

下一步计划

Bot Preference Sync 将在本周内向所有客户(所有套餐均适用)开放。请关注我们的更新日志以获取可用性信息,并留意仪表盘(及收件箱)中确认偏好的提示!

这只是长期努力的第一步。我们将继续与大型机器人运营商合作,确保我们不会在熟悉的挑战(如未经同意的训练)或新兴问题(如可发现性和用户参与度)上做出妥协。从根本上说,我们致力于推动网站所有者获得更高的透明度和控制权。

目录栏

讨论栏

相关标签和社交媒体链接

相关标签

关注社交媒体

  • Cloudflare

电子邮件订阅