
Cloudflare AI 爬虫封锁:保护内容又不损失 AI 搜索可见度
了解 Cloudflare AI 爬虫封锁如何影响 AI 搜索引用、搜索与训练爬虫有何区别,以及网站应该检查哪些设置。
Cloudflare AI 爬虫封锁可以阻止不希望出现的内容抓取,但“一刀切”规则也可能 挡住用于发现页面的 AI 搜索爬虫。正确策略不是允许所有 AI Bot,也不是全部封锁, 而是分别决定搜索、训练和用户发起访问所需的权限,再逐层验证规则是否真正生效。
对正在进行 生成式引擎优化(GEO) 的品牌来说,可抓取只是获得 AI 搜索可见度与引用的必要条件,并不保证一定被引用。
直接结论:网站应不应该封锁 AI 爬虫
当爬虫用途能带来搜索引用、推荐流量或商业合作时,可以开放适合的公开页面;当其 行为不符合内容授权和保护政策时,则应封锁或限制。多数品牌都不应使用一条规则, 把搜索、训练和实时助手流量视为完全相同的访问。
一份有效的 AI 爬虫策略至少要回答四个问题:
- 哪些公开页面希望进入 AI 搜索?
- 哪些内容可以或不可以用于模型训练?
- 是否允许用户发起的 AI 助手实时读取页面?
- 哪些私有、授权或登录后路径必须保持不可访问?
Cloudflare 封锁 AI 爬虫发生了什么变化
2025 年 7 月 1 日,Cloudflare 宣布 “Content Independence Day”,表示将默认策略 转向封锁 AI 爬虫,除非内容所有者选择开放或爬虫为访问付费。这次变化把网站管理 从被动退出,推进到主动制定爬虫政策。
Cloudflare 当前 AI Crawl Control 文档提供了更细的控制方式:网站可以查看 爬虫、运营方、类别、请求量和 robots.txt 违规情况,为单个爬虫设置允许或封锁, 并通过 WAF 处理更复杂的路径规则。
不要仅根据公告推断当前站点状态。已有域名、新域名、托管 robots.txt 指令、 爬虫级操作和自定义 WAF 规则可能并不一致,实际域名的控制台与请求日志才是依据。
AI 搜索爬虫不等于训练爬虫
Cloudflare 官方 Bot 参考把常被统称为“AI Bot”的访问分成不同用途:
| 用途 | Cloudflare 列出的示例 | 应做的决定 |
|---|---|---|
| AI Search | OAI-SearchBot、Claude-SearchBot、PerplexityBot | 希望公开页面进入 AI 搜索时可考虑允许 |
| AI Assistant | ChatGPT-User、Claude-User、Perplexity-User | 判断是否允许用户发起的实时访问 |
| AI Crawler | GPTBot、ClaudeBot、CCBot | 根据训练、索引、授权和内容保护目标决定 |
| Search Engine | Googlebot | 与 AI 专用规则分开管理传统搜索 |
OpenAI 的区别最清楚。其发布者指南表示,希望内容进入 ChatGPT 搜索摘要、引用和
链接的网站不应阻止 OAI-SearchBot;如果发布者希望排除潜在训练访问,则可以
单独限制 GPTBot。
因此,品牌可以争取 ChatGPT 搜索可见度,而不必自动给予所有 OpenAI 爬虫相同 权限。
封锁如何影响 AI 搜索引用
当 AI 搜索爬虫无法读取页面时,系统可能缺少页面标题、正文和最新事实等直接证据。 URL 仍可能通过其他来源被发现,但爬虫未必能按预期使用页面内容。
这会形成两类完全不同的问题:
- 访问失败: robots.txt、Cloudflare、WAF、登录、限流或其他层级阻止抓取。
- 内容失败: 页面可以访问,但没有清晰回答问题,因此没有被选中或引用。
在确认问题类型前,不要急着重写文章。先验证访问,再比较真实 AI 回答已经引用的 页面。内容层面的诊断可参考 AI 搜索引用优化指南。
Cloudflare AI 爬虫检查清单
1. 按页面类型制定政策
列出希望被发现的公开内容,例如产品、价格、文档、比较、研究和帮助页面。账户页、 私有报告、授权文件和内部工具不应自动沿用同一规则。
2. 检查每个爬虫的操作
在 AI Crawl Control 中查看真实请求和对应操作。判断时要看用途与运营方,不要仅凭 名称中出现 “AI” 就全部允许或封锁。
3. 核对 robots.txt 与托管指令
爬虫专用指令必须与内容政策一致。AI Crawl Control 允许访问,但 robots.txt 禁止, 仍会造成阻断;robots.txt 允许访问,也无法覆盖正在执行封锁的 WAF 规则。
4. 检查 WAF 与 Bot 防护
Cloudflare 可以通过 WAF 执行爬虫封锁。自定义 Bot 防护、JavaScript Challenge、
限流、地区限制和源站安全也可能返回 403、429 或挑战页面。要检查完整请求链路,
不能只看一个开关。
5. 测试代表性 URL
确认获准爬虫访问重要公开 URL 时,能获得预期状态码和可读正文。不要只测首页,至少 覆盖一个产品页、一个文档页、一个比较或研究页,以及 robots.txt。
6. 监测修改后的结果
记录修改日期、爬虫、规则、主机名和路径范围,再用稳定 Prompt 重新比较品牌提及与 可用来源。可以先运行 免费 AI 品牌可见度检查建立基线,再用重复监测区分 策略影响与模型正常波动。
关于 Cloudflare AI 爬虫的常见问题
Cloudflare 会默认封锁 AI 爬虫吗?
Cloudflare 在 2025 年 7 月宣布把默认方向改为封锁 AI 爬虫。但具体域名的有效策略 仍取决于当前 AI Crawl Control、robots.txt、WAF 和 Bot 管理设置,不能只按公告 推断。
可以允许 ChatGPT 搜索、同时阻止 OpenAI 训练吗?
OpenAI 将 OAI-SearchBot 用于搜索发现,将 GPTBot 用于潜在训练访问。网站可以
根据法律、授权和技术要求,为两个 User Agent 设置不同规则。
允许 OAI-SearchBot 就一定会获得 AI 搜索引用吗?
不会。开放访问只让页面具备被读取的条件;是否引用仍取决于相关性、质量、证据、 新鲜度和该次回答使用的搜索系统。
AI 爬虫规则会影响 Google SEO 吗?
针对 AI 的规则不应自动封锁 Googlebot,但范围过大的 robots.txt、WAF 或 Bot
防护可能误伤传统搜索。应把 Google 与 AI 爬虫作为不同测试对象分别验证。
参考来源
作者

更多文章
邮件列表
加入我们的社区
订阅邮件列表,及时获取最新消息和更新


