
Bloqueo de crawlers IA en Cloudflare: protege contenido y visibilidad
Audita el bloqueo de bots IA en Cloudflare y distingue sus efectos en citas, búsqueda y rastreo de entrenamiento.
El bloqueo de rastreadores de IA de Cloudflare puede proteger el contenido de extracciones no deseadas, pero una regla genérica también puede bloquear los rastreadores de búsqueda que descubren páginas para respuestas de IA. La política correcta no es "permitir todos los bots de IA" ni "bloquear todos los bots de IA". Se trata de decidir por separado qué rastreadores pueden apoyar la búsqueda, el entrenamiento y el acceso solicitado por el usuario, y luego verificar la regla en cada capa.
Para las marcas que trabajan en optimización para motores generativos (GEO), el acceso de rastreo es un requisito previo —no una garantía— para la visibilidad y las citas en búsquedas de IA.
La respuesta breve: ¿deberías bloquear los rastreadores de IA?
Permite un rastreador cuando su propósito apoya un objetivo comercial como citas en búsquedas, tráfico de referencia o un acuerdo comercial. Bloquéalo o restríngealo cuando su comportamiento entre en conflicto con la política de contenido. La mayoría de las marcas deben evitar una regla única que trate el tráfico de búsqueda, entrenamiento y asistentes como idénticos.
Una política de rastreadores de IA debe responder cuatro preguntas:
- ¿Qué páginas públicas deben ser descubribles en búsquedas de IA?
- ¿Qué contenido, si lo hay, puede usarse para el entrenamiento de modelos?
- ¿Qué asistentes iniciados por usuarios pueden obtener una página en tiempo real?
- ¿Qué rutas privadas, con licencia o exclusivas para cuentas deben permanecer inaccesibles?
¿Qué cambió con el bloqueo de rastreadores de IA de Cloudflare?
El 1 de julio de 2025, Cloudflare anunció su "Día de Independencia del Contenido" y declaró que cambiaría el valor predeterminado para bloquear los rastreadores de IA a menos que los propietarios de contenido eligieran lo contrario o un rastreador pagara por el acceso. El anuncio trasladó la web de un "opt-out" pasivo a una política explícita de rastreadores.
La documentación actual de AI Crawl Control de Cloudflare describe herramientas más granulares. Los propietarios de sitios pueden revisar la actividad del rastreador, el operador, la categoría, el volumen de solicitudes y las violaciones de robots.txt; elegir una acción de permitir o bloquear para un rastreador individual; y usar reglas de WAF para un comportamiento más avanzado a nivel de ruta.
No infieras tu configuración actual a partir del anuncio. Las zonas existentes, las zonas nuevas, las directivas de robots.txt gestionadas, las acciones específicas para rastreadores y las reglas personalizadas de WAF pueden diferir. El panel de control y los registros de solicitudes del dominio real son la fuente de verdad.
Los bots de búsqueda de IA no son lo mismo que los rastreadores de entrenamiento
La referencia de bots de Cloudflare separa varios propósitos que suelen agruparse bajo la etiqueta "bot de IA":
| Propósito | Ejemplos en la referencia de Cloudflare | Decisión a tomar |
|---|---|---|
| Búsqueda de IA | OAI-SearchBot, Claude-SearchBot, PerplexityBot | Permitir si deseas que las páginas públicas elegibles sean descubiertas para búsquedas de IA |
| Asistente de IA | ChatGPT-User, Claude-User, Perplexity-User | Decidir si el acceso en tiempo real solicitado por el usuario se ajusta a tu política |
| Rastreador de IA | GPTBot, ClaudeBot, CCBot | Evaluar objetivos de entrenamiento, indexación, licencias y protección de contenido |
| Motor de búsqueda | Googlebot | Gestionar la búsqueda convencional por separado de las reglas específicas de IA |
La distinción es especialmente clara en el caso de OpenAI. Su guía para editores indica que los sitios no deben bloquear OAI-SearchBot si desean que su contenido sea elegible para resúmenes, citas y enlaces en las búsquedas de ChatGPT. Por separado, identifica GPTBot como el agente de usuario que los editores pueden denegar cuando desean excluir páginas del posible entrenamiento.
Esto significa que una marca puede buscar visibilidad en las búsquedas de ChatGPT sin otorgar automáticamente el mismo acceso a todos los rastreadores de OpenAI.
Cómo el bloqueo afecta las citas en búsquedas de IA
Cuando un rastreador de búsqueda de IA no puede leer una página, el sistema puede tener menos evidencia directa sobre las afirmaciones, el título y el contenido actual de la página. Una URL aún podría descubrirse a través de otra fuente, pero el rastreador puede ser incapaz de utilizar el cuerpo de la página como se pretendía.
Esto crea dos modos de fallo distintos:
- Fallo de acceso: robots.txt, Cloudflare, WAF, autenticación, límites de velocidad u otra capa impiden la recuperación.
- Fallo de contenido: la página es accesible, pero no responde a la pregunta con la suficiente claridad para ser seleccionada o citada.
No reescribas una página hasta que identifiques cuál es el problema. Primero verifica el acceso; luego compara la página con las fuentes que aparecen en las respuestas reales. Nuestra guía sobre citas en búsquedas de IA cubre el aspecto de contenido de ese diagnóstico.
Cómo incluir rastreadores de IA en la lista permitida de Cloudflare
Si buscas cómo permitir rastreadores de IA en Cloudflare, empieza por la finalidad del bot y utiliza una acción de permiso con alcance definido, no una excepción general. Los nombres del panel y las funciones del plan pueden cambiar; confirma siempre el control efectivo de tu propia zona.
- Identifica el User-Agent y el operador exactos. No crees una regla para un nombre genérico como "bot de IA". Comprueba si sirve para búsqueda, entrenamiento o acceso solicitado por un usuario.
- Define las rutas permitidas. Las páginas públicas de producto, documentación, investigación y comparativas pueden apoyar el descubrimiento. Mantén fuera las cuentas, informes, administración y contenido con licencia.
- Configura la acción del rastreador como permitida. Localiza el rastreador verificado en AI Crawl Control y revisa su acción. Usa una regla WAF limitada solo si el control por rastreador no puede expresar la política de rutas.
- Revisa todas las capas. Confirma que
robots.txt, directivas gestionadas, WAF personalizado, mitigación de bots, límites de velocidad y origen no contradigan el permiso. - Prueba URL representativas. Revisa una página pública de producto, un artículo, una página de documentación y una ruta privada. El rastreador permitido debe recibir contenido público real, mientras la ruta privada sigue cerrada.
- Registra y supervisa el cambio. Guarda fecha, User-Agent, regla y alcance. Consulta los registros de Cloudflare antes de atribuir un cambio de visibilidad a la configuración.
Permitir el acceso solo elimina una barrera. No garantiza indexación, ranking, recuperación ni citas de IA.
Lista de verificación para auditar rastreadores de IA en Cloudflare
1. Define la política por tipo de página
Enumera las páginas públicas que deben apoyar el descubrimiento: páginas de productos, precios, documentación, comparativas, investigación y contenido de ayuda. Mantén fuera de esa política las páginas de cuentas, informes privados, archivos con licencia y herramientas internas.
2. Revisa las acciones a nivel de rastreador
En AI Crawl Control, inspecciona el tráfico real y la acción asignada a cada rastreador. Presta atención al propósito y al operador en lugar de tomar una decisión solo por la palabra "IA".
3. Verifica robots.txt y directivas gestionadas
Confirma que la directiva específica para el rastreador coincide con la política. Una acción permisiva en AI Crawl Control no ayuda si robots.txt deniega el mismo rastreador, y un archivo robots.txt permisivo no anula un bloqueo de WAF restrictivo.
4. Inspecciona WAF y mitigación de bots
Cloudflare puede hacer cumplir los bloqueos de rastreadores mediante reglas de WAF. La protección personalizada de bots, los desafíos de JavaScript, los límites de velocidad, las restricciones geográficas y la seguridad de origen también pueden devolver un 403, 429 o una página de desafío. Revisa la ruta completa de la solicitud, no solo un interruptor en el panel.
5. Prueba URLs representativas
Verifica que las URLs públicas importantes devuelvan el estado y el contenido de página legible previsto para los rastreadores aprobados. Prueba más que la página de inicio: incluye una página de producto, una página de documentación, una página de comparación o investigación y robots.txt.
6. Mide el resultado
Registra la fecha de cambio, el rastreador, la regla, el nombre de host y el alcance de la ruta. Luego, vuelve a ejecutar un conjunto estable de prompts y compara las menciones y las fuentes disponibles. Una verificación gratuita de visibilidad en IA puede establecer la línea base, mientras que el monitoreo repetido ayuda a separar los cambios de política de la variación normal del modelo.
Preguntas frecuentes sobre Cloudflare y los rastreadores de IA
¿Cloudflare bloquea los rastreadores de IA por defecto?
Cloudflare anunció un cambio de valor predeterminado hacia el bloqueo de rastreadores de IA en julio de 2025. Sin embargo, la política efectiva para un dominio específico depende de su configuración actual de AI Crawl Control, robots.txt, WAF y gestión de bots. Verifica la zona en lugar de asumir su estado.
¿Puedo permitir la búsqueda en ChatGPT pero bloquear el entrenamiento de OpenAI?
OpenAI documenta OAI-SearchBot para el descubrimiento en búsquedas y GPTBot para el posible acceso de entrenamiento. Puedes definir reglas diferentes para esos agentes de usuario, sujeto a tus requisitos legales, de licencia y técnicos.
¿Permitir OAI-SearchBot garantiza citas en búsquedas de IA?
No. Permite que el rastreador acceda al contenido elegible. La selección de citas sigue dependiendo de la relevancia, la calidad, las evidencias, la frescura y el sistema de búsqueda utilizado para esa respuesta.
¿Una regla de rastreador de IA puede perjudicar el SEO en Google?
Una regla específica para IA no debería bloquear automáticamente a Googlebot, pero reglas amplias en robots.txt, WAF o mitigación de bots pueden afectar la búsqueda convencional si están mal configuradas. Prueba los rastreadores de Google y de IA como casos separados.
Si la página sigue sin aparecer después de corregir el acceso, sigue la lista de diagnóstico de visibilidad en Google para distinguir problemas de indexación, posicionamiento, intención y clics.
Fuentes
Continúa con guías relacionadas
Autor

Categorías
Más publicaciones

Filtración del prompt de ChatGPT: impacto en búsqueda IA y GEO
Qué revela la filtración del prompt de ChatGPT sobre la búsqueda IA, la expansión de consultas, el GEO y las citas.


Fluctuaciones en la visibilidad de IA: Señal vs. Ruido
Entiende por qué fluctúa la visibilidad de marca en IA y cómo separar tendencias significativas de la variación normal del muestreo.


ChatGPT vs. Gemini vs. Grok para el monitoreo de marca
Comparación entre ChatGPT, Gemini y Grok para el monitoreo de marca con IA: menciones, recomendaciones, competidores, citas y diferencias entre modelos.

Newsletter
Únete a la comunidad
Suscríbete a nuestro newsletter para las últimas noticias y actualizaciones
