
Cloudflare AI Crawler 控制:保护内容的同时不影响 AI 可见性
如何审核 Cloudflare AI 爬虫屏蔽?了解爬虫规则如何影响 AI 搜索引用、搜索爬虫与训练爬虫的区别,以及应检查哪些设置。
Cloudflare AI Crawler 屏蔽 能保护内容免受恶意抓取,但一刀切的规则也可能同时屏蔽为 AI 答案发现页面的搜索爬虫。正确的策略不是“允许所有 AI 机器人”或“屏蔽所有 AI 机器人”,而是分别决定哪些爬虫可支持搜索、训练或用户请求访问,并在每一层验证规则。
对于正在实施 生成式引擎优化(GEO) 的品牌方,爬取访问是 AI 搜索可见性与引用的先决条件——而非保证。
简短回答:该屏蔽 AI 爬虫吗?
当爬虫的访问目的与业务目标(如搜索引用、引荐流量或商业协议)一致时,允许其访问;当其行为与内容策略冲突时,则屏蔽或限制。大多数品牌应避免将搜索、训练和助手流量视为同一类别的一刀切规则。
AI 爬虫策略应回答四个问题:
- 哪些公开页面应在 AI 搜索中可被发现?
- 哪些内容(如有)可用于模型训练?
- 哪些用户发起的助手可实时抓取页面?
- 哪些私有、许可或仅账户可见的路径必须保持不可访问?
Cloudflare AI 爬虫屏蔽带来的变化
2025 年 7 月 1 日,Cloudflare 宣布“内容独立日”,表示将默认屏蔽 AI 爬虫,除非内容所有者主动选择允许或爬虫付费访问。此举将网络从被动选择退出转向显式爬虫策略。
Cloudflare 当前的 AI Crawl Control 提供了更细粒度的工具。站点所有者可查看爬虫活动、运营方、类别、请求量及 robots.txt 违规情况;为单个爬虫选择允许或屏蔽操作;并通过 WAF 规则实现更高级的路径级行为。
切勿 仅凭公告推断当前配置。现有区域、新区域、托管 robots.txt 指令、爬虫特定操作及自定义 WAF 规则可能各不相同。实际域名的仪表板与请求日志才是真相的唯一来源。
AI 搜索爬虫 ≠ 训练爬虫
Cloudflare 的机器人参考文档将“AI 机器人”这一标签下的多种目的进行了细分:
| 目的 | Cloudflare 参考中的示例 | 决策依据 |
|---|---|---|
| AI 搜索 | OAI-SearchBot、Claude-SearchBot、PerplexityBot | 若希望公开页面在 AI 搜索中被发现,则允许 |
| AI 助手 | ChatGPT-User、Claude-User、Perplexity-User | 判断用户请求的实时访问是否符合策略 |
| AI 爬虫 | GPTBot、ClaudeBot、CCBot | 评估训练、索引、许可与内容保护目标 |
| 传统搜索引擎 | Googlebot | 将传统搜索与 AI 特定规则分开管理 |
以 OpenAI 为例:其发布商指南明确指出,若希望内容在 ChatGPT 搜索中有资格成为摘要、引用或链接,网站不应屏蔽 OAI-SearchBot。而 GPTBot 则被单独标识为出版商可选择屏蔽的用户代理,以排除潜在的训练数据收集。
这意味着品牌可在不自动授予所有 OpenAI 爬虫相同访问权限的情况下,追求 ChatGPT 搜索可见性。
屏蔽对 AI 搜索引用的影响
当 AI 搜索爬虫无法读取页面时,系统可能缺少该页面主张、标题与当前内容的直接证据。URL 可能通过其他渠道被发现,但爬虫可能无法按预期使用页面正文。
这会导致两种不同的失败模式:
- 访问失败:robots.txt、Cloudflare、WAF、认证、限速或其他层级阻止了抓取。
- 内容失败:页面可访问,但内容不足以回答问题或被选中引用。
在重写页面前,先确定问题所在。先验证访问权限,再将页面与实际答案中出现的来源进行对比。我们的 AI 搜索引用指南 详细介绍了内容侧的诊断方法。
如何在 Cloudflare 中将 AI 爬虫加入允许列表
如果你在查找“如何在 Cloudflare 中允许 AI 爬虫”,应先确认爬虫用途,并使用 Cloudflare 的允许操作,而不是创建覆盖所有安全控制的绕过规则。控制台名称和套餐能力可能变化,应以自己 Zone 中实际生效的设置为准。
- 确认准确的 User-Agent 和运营方。 不要为“AI bot”这类泛称建规则,先确认它服务于搜索、训练还是用户发起的助手访问。
- 限定允许路径。 公开产品页、文档、研究和对比页可以支持发现;账号、报告、管理后台和授权内容应继续保持关闭。
- 把该爬虫操作设为允许。 在 AI Crawl Control 中找到经过验证的爬虫并检查当前动作。只有爬虫级控制无法表达路径策略时,才使用范围明确的 WAF 规则。
- 检查所有执行层。 确认
robots.txt、托管指令、自定义 WAF、Bot 防护、速率限制和源站访问没有与允许动作冲突。 - 测试代表性 URL。 分别检查公开产品页、文章、文档和一个有意保持私有的路径。允许的爬虫应获得真实公开正文,私有路径仍应关闭。
- 记录并监测修改。 保存日期、User-Agent、规则和路径范围。先查看 Cloudflare 日志,再判断后续可见度变化是否与配置有关。
允许规则只解决访问障碍,不能保证收录、排名、检索或 AI 引用。
Cloudflare AI 爬虫审核清单
1. 按页面类型定义策略
列出应支持发现的公开页面:产品页面、定价、文档、对比、研究与帮助内容。将账户页面、私有报告、许可文件与内部工具排除在外。
2. 审核爬虫级操作
在 AI Crawl Control 中,检查实际流量及分配给每个爬虫的操作。关注其目的与运营方,而非仅凭“AI”字样做决策。
3. 检查 robots.txt 与托管指令
确认爬虫特定指令与策略一致。AI Crawl Control 的宽松操作若与 robots.txt 的屏蔽指令冲突,则无效;而宽松的 robots.txt 也无法覆盖强制执行的 WAF 屏蔽。
4. 检查 WAF 与机器人缓解措施
Cloudflare 可通过 WAF 规则强制屏蔽爬虫。自定义机器人防护、JavaScript 挑战、限速、地理限制与源站安全也可能返回 403、429 或挑战页面。检查完整的请求路径,而非仅某个仪表板开关。
5. 测试代表性 URL
验证重要公开 URL 是否向已批准的爬虫返回预期状态与可读内容。测试范围应超出首页:包含一个产品页面、一个文档页面、一个对比或研究页面,以及 robots.txt。
6. 衡量结果
记录变更日期、爬虫、规则、主机名与路径范围。然后重新运行稳定的提示集,比较提及与可用来源。可通过 免费 AI 可见性检查工具 建立基线,而持续监控则有助于将策略变更与模型正常波动区分开来。
关于 Cloudflare 与 AI 爬虫的常见问题
Cloudflare 是否默认屏蔽 AI 爬虫?
Cloudflare 于 2025 年 7 月宣布默认倾向于屏蔽 AI 爬虫。但特定域名的实际策略取决于其当前的 AI Crawl Control、robots.txt、WAF 与机器人管理设置。应验证区域配置,而非假设其状态。
我能允许 ChatGPT 搜索但屏蔽 OpenAI 训练吗?
OpenAI 将 OAI-SearchBot 定义为搜索发现,GPTBot 定义为潜在训练访问。在满足法律、许可与技术要求的前提下,可为这两种用户代理定义不同的规则。
允许 OAI-SearchBot 是否能保证 AI 搜索引用?
不能。它仅允许爬虫访问符合条件的内容。引用的选择仍取决于相关性、质量、证据、时效性及用于生成答案的搜索系统。
AI 爬虫规则会损害 Google SEO 吗?
AI 特定规则不应自动屏蔽 Googlebot,但宽泛的 robots.txt、WAF 或机器人缓解规则若配置错误,可能影响传统搜索。应将 Google 爬虫与 AI 爬虫作为独立案例测试。
如果修复访问配置后页面仍未出现,可按照 Google 可见性诊断清单,区分索引、排名、搜索意图与点击率问题。
参考来源
继续阅读相关指南
作者

更多文章

ChatGPT 系统提示词泄露:AI 搜索与 GEO 的真相
ChatGPT 系统提示词泄露揭示了 AI 搜索何时触发、查询扩展机制,以及品牌如何提升 GEO 与 AI 搜索引用效果。


AI 品牌可见度波动:信号与噪音
了解 AI 品牌可见度为何会出现波动,以及如何将有意义的趋势变化与模型和采样变异区分开来。


ChatGPT、Gemini 与 Grok:品牌监控能力对比
比较 ChatGPT、Gemini 与 Grok 在 AI 品牌监控中的表现,包括品牌提及、推荐、竞品对比、引用及模型差异。

邮件列表
加入我们的社区
订阅邮件列表,及时获取最新消息和更新
