Dottly AI
  • Funciones
  • Precios
  • Blog
  • Documentación
  • Quiénes somos
Dottly AI
Cómo encontrar todas las páginas: inventario SEO
2026/09/09

Cómo encontrar todas las páginas: inventario SEO

Aprenda a inventariar un sitio web con sitemaps, rastreadores, enlaces, registros y Search Console sin confundir el descubrimiento con la indexación.

Análisis gratuito de visibilidad en IA

Descubre dónde la IA recomienda tu marca

Revisa las preguntas de compradores, respuestas de IA, competidores y fuentes disponibles que influyen en tu visibilidad.

Dottly AI
  • 6 preguntas de compradores
  • Respuestas y fuentes disponibles
  • Sin tarjeta para empezar
Realizar el análisis gratis

No existe una única consulta de búsqueda que devuelva de forma fiable cada página de un sitio web. Un inventario defendible combina varios conjuntos: las URL que publica el CMS, las URL enumeradas en los sitemaps, las URL a las que puede llegar un rastreador, las URL observadas en los registros y las URL que los motores de búsqueda reportan como descubiertas o indexadas. Las diferencias constituyen la parte útil de la auditoría porque revelan páginas huérfanas, rutas obsoletas, redirecciones y lagunas en su medición.

Defina «todas las páginas» antes de contar

Los equipos a menudo comparan cifras que describen cosas diferentes. Escriba el conjunto que necesita antes de abrir una herramienta:

  • Páginas publicadas: registros que el CMS o la aplicación considera públicos.
  • Rutas servidas: URL que responden desde producción, incluidas las rutas de utilidad y heredadas.
  • Páginas descubribles: URL expuestas mediante enlaces, sitemaps, feeds u otras rutas de rastreo.
  • Páginas rastreables: URL a las que llega un rastreador bajo un punto de partida, un agente de usuario y una configuración de renderizado definidos.
  • Páginas indexadas: URL que un motor de búsqueda reporta como aptas o indexadas.
  • Recursos de contenido: PDF, imágenes, vídeos y archivos que pueden no comportarse como páginas HTML.

Estos conjuntos se solapan sin ser idénticos. Es posible que un registro privado del CMS nunca se sirva. Una página de destino huérfana puede servirse pero no estar enlazada. Una URL puede rastrearse y luego excluirse de un índice. La guía de descubrimiento de páginas de Google separa explícitamente lo que contiene un sitio de lo que Google ha intentado rastrear e indexar.

Comience con datos de inventario de primera fuente

Exporte los registros canónicos desde su CMS, repositorio, manifiesto de rutas o base de datos. Incluya los campos necesarios para explicar una URL más adelante:

CampoPor qué es importante
URL y configuración regional (locale)Identifica la ruta exacta y la familia lingüística
Estado de publicaciónSepara registros en borrador, programados, privados y públicos
URL canónicaMuestra la dirección preferida cuando existen alias
Último cambio significativoRespaldan las fechas de revisión y de los sitemaps
Tipo de contenido y responsableDirige las correcciones al equipo adecuado
Archivo de origen o ID de registroHace que el inventario sea reproducible

Normalice el host, el protocolo, la barra final, el uso de mayúsculas y minúsculas y los parámetros de consulta antes de desduplicar. Mantenga la exportación sin procesar separada de la vista normalizada para que una auditoría futura pueda reproducir cómo se generó un recuento. No descarte silenciosamente las filas que no superen la normalización; etiquételas para su revisión.

Añada el conjunto del sitemap

Obtenga el sitemap público y cada archivo al que haga referencia un índice de sitemaps. Analice el conjunto de URL y luego compárelo con la exportación de primera fuente. Por lo general, el sitemap debe contener las páginas canónicas que desea que los motores de búsqueda descubran, no todas las rutas que su aplicación puede servir. La descripción general de sitemaps de Google lo describe como un archivo que proporciona información sobre páginas y otros recursos; no es un registro completo del índice.

Registre estos tipos de discrepancias:

  • URL canónica publicada que falta en el sitemap;
  • URL del sitemap no presente en el sistema de publicación;
  • URL del sitemap que redirige a otro lugar;
  • URL del sitemap bloqueada o marcada como noindex;
  • variante regional duplicada o no canónica; y
  • URL obsoleta que ya no se sirve.

Para reglas de validación más profundas, consulte el flujo de trabajo de mejores prácticas para sitemaps. Corrija el generador subyacente o la regla de publicación en lugar de editar a mano el XML generado.

Rastree desde algo más que la página de inicio

Un rastreador revela lo que es accesible bajo una configuración definida. Inicie el rastreo con la página de inicio, la navegación principal, el sitemap XML, los feeds RSS y los centros importantes de categorías o documentación. Documente los parámetros de ejecución: agente de usuario, renderizado de JavaScript, recursos bloqueados, autenticación, profundidad y exclusiones de URL.

Utilice el rastreo para recopilar el código de estado, la URL canónica, la directiva de robots, el título, los encabezados, el tipo de contenido, el idioma y los recuentos de enlaces entrantes. Un rastreo renderizado puede descubrir rutas que un rastreo de HTML sin procesar pasa por alto, mientras que un rastreo sin procesar puede exponer problemas del lado del servidor ocultos por el renderizado del cliente. Ejecute ambos cuando la aplicación dependa en gran medida del renderizado en el cliente.

El resultado es un conjunto de rastreo, no una afirmación de que todas las páginas existen. No puede encontrar una ruta huérfana sin una semilla suministrada, un registro privado del backend o una URL bloqueada antes de que el rastreador pueda inspeccionarla. Combine el trabajo con herramientas de rastreo para SEO y mantenga la configuración en el registro de auditoría.

Utilice registros para encontrar solicitudes reales

Los registros del servidor o de edge muestran qué URL recibieron solicitudes, mediante qué agente de usuario y con qué respuesta. Filtre el tráfico de bots por separado del de humanos, servicios de monitorización, previsualizaciones y ruido de ataques. Los registros pueden revelar:

  • bots de búsqueda solicitando una URL ausente de su sitemap;
  • solicitudes repetidas a parámetros obsoletos o redirecciones;
  • páginas que reciben tráfico interno pero ninguna visita de rastreo; y
  • variantes inesperadas de configuración regional, host o protocolo.

Los registros no enumeran las páginas que nunca se han solicitado. Trátelos como un comportamiento observado, no como un inventario completo. Conserve el período de recopilación y las reglas de muestreo para que las comparaciones a lo largo de los meses sigan siendo significativas.

Añada Search Console y pruebas de indexación

Los informes de Search Console son valiosos porque muestran la perspectiva de un motor de búsqueda, pero no son una exportación de base de datos de todo su sitio. Utilice las vistas de Inspección de URL y de Indexación de páginas para muestras representativas y anomalías importantes. Compare sus estados con sus conjuntos de primera fuente, sitemaps, rastreo y registros.

Una tabla de conciliación útil tiene este aspecto:

Estado de la URLInterpretaciónSiguiente acción
Publicada + enlazada + sitemap + indexadaRuta esperadaMonitorizar cambios
Publicada + sitemap, sin evidencia de rastreoBrecha de descubrimiento o prioridadComprobar enlaces, acceso y tiempos de publicación
Publicada + rastreo, no indexadaProblema de aptitud o calidadInspeccionar canónica, robots y contenido
Servida + sin registro de responsableRuta heredada o no intencionadaAsignar responsable, redirigir o eliminar
Indexada + sin registro de origen actualURL obsoleta o migradaVerificar canónica y gestión de migración

Este modelo evita que «encontramos 500 URL» se convierta en una métrica de éxito engañosa. El número solo es útil con una definición, una fuente, una marca de tiempo y las exclusiones conocidas.

Concilie y priorice las discrepancias

Después de fusionar los conjuntos, desduplique por URL canónica normalizada y conserve las columnas de procedencia como cms, sitemap, crawl, log y search-console. A continuación, clasifique cada discrepancia:

  1. Diferencia esperada: privada, noindex, de utilidad o excluida intencionadamente.
  2. Candidata a reparación: publicada pero carente de enlace, entrada en el sitemap o canónica.
  3. Riesgo de migración: host, configuración regional, parámetro o URL redirigida antiguos que aún reciben tráfico.
  4. Desconocida: evidencia insuficiente; recopile otra muestra antes de realizar cambios en producción.

Priorice según el valor para el usuario y el negocio, no por el recuento bruto de URL. Una canónica rota en una página de producto principal merece atención antes que una familia de parámetros de bajo valor. Mantenga un registro de decisiones para que la misma excepción no se vuelva a debatir en cada auditoría.

Tenga en cuenta JavaScript, los parámetros y las rutas ocultas

Las aplicaciones modernas pueden exponer varias poblaciones de URL que un rastreo de HTML simple no detecta. La navegación del lado del cliente puede crear enlaces solo después del renderizado, los filtros facetados pueden generar amplios espacios de parámetros y las API pueden servir contenido que no tiene una ruta HTML indexable. Ejecute un rastreo renderizado cuando el framework lo requiera, pero compare el resultado con la respuesta sin procesar para que pueda ver qué depende de JavaScript.

Establezca reglas de parámetros antes de rastrear. Permitir cada combinación de filtros puede convertir un ejercicio de inventario en un rastreo sin límites; excluir cada cadena de consulta puede ocultar comportamientos valiosos de campañas, búsquedas o paginación. Mantenga una muestra separada de las URL rechazadas y documente por qué el patrón queda fuera del conjunto de páginas canónicas.

Inspeccione también los manifiestos de rutas y la configuración del servidor en busca de páginas que sean difíciles de descubrir a través de enlaces de contenido: páginas de estado, redirecciones, rutas de campañas antiguas, archivos descargables y endpoints generados por frameworks. Puede que no pertenezcan al inventario SEO, pero asignarles un tipo y un responsable evita que se conviertan en una superficie de producción inexplicable.

Haga que el inventario sea reproducible

Programe las fuentes que cambian con frecuencia y conserve una instantánea fechada de cada resultado. Como mínimo, conserve:

  • la exportación de primera fuente normalizada;
  • las URL de los sitemaps obtenidos;
  • la configuración y la salida del rastreo;
  • el intervalo de registros y los filtros de bots;
  • los estados muestreados de Search Console; y
  • las reglas de fusión y las discrepancias sin resolver.

Ejecute el inventario después de una migración de dominio, enrutamiento, CMS, configuración regional o navegación. Para la publicación habitual, una comprobación más ligera diaria o basada en versiones puede detectar entradas de sitemap faltantes y enlaces rotos antes de que se acumulen.

Conecte el inventario técnico con las cuestiones de visibilidad

Encontrar una página no equivale a demostrar que es visible en las búsquedas o en las respuestas de IA. Una vez que el conjunto de URL sea de confianza, puede investigar si las páginas importantes están indexadas, citadas o representadas en respuestas muestreadas. La documentación de Dottly AI puede respaldar el traspaso a la medición, pero mantenga separadas las vías de evidencia: los datos de rastreo explican el acceso, mientras que la evidencia a nivel de respuesta explica lo que realmente devolvió un modelo.

FAQ

¿Muestra site:example.com todas las páginas?

No. Es una comprobación puntual útil, no un inventario exhaustivo. Las páginas de resultados de los motores de búsqueda son muestreadas y pueden omitir URL por muchas razones.

¿Es el sitemap la lista completa de páginas?

No. Es un conjunto de descubrimiento curado. Puede omitir intencionadamente rutas privadas, de bajo valor, duplicadas o que no sean HTML, y no puede enumerar URL que el sistema de publicación desconoce.

¿Debería rastrear primero el sitemap o la página de inicio?

Utilice ambos. La página de inicio y la navegación muestran la accesibilidad de los enlaces; el sitemap expone las URL canónicas previstas. Su diferencia suele ser la forma más rápida de encontrar páginas huérfanas u obsoletas.

¿Con qué frecuencia debería crear un inventario de páginas?

Utilice una comprobación activada por cada versión para cambios de rutas y contenido, además de una conciliación programada para registros y datos de búsqueda. Aumente la frecuencia durante migraciones o en la respuesta a incidentes.

La respuesta fiable a «¿cuántas páginas tenemos?» es una comparación documentada de conjuntos, no un número único. Cuando cada URL tiene procedencia y un responsable, el inventario se convierte en una herramienta de decisión para el mantenimiento SEO en lugar de un informe de rastreo puntual.

Continúa con guías relacionadas

  • ¿Qué es la Optimización para Motores Generativos (GEO)?
  • Cómo obtener citas en búsquedas con IA: guía práctica de fuentes
  • Métricas de informes de visibilidad en IA explicadas
Todas las publicaciones
Análisis gratuito de visibilidad en IA

Descubre dónde la IA recomienda tu marca

Revisa las preguntas de compradores, respuestas de IA, competidores y fuentes disponibles que influyen en tu visibilidad.

Dottly AI
  • 6 preguntas de compradores
  • Respuestas y fuentes disponibles
  • Sin tarjeta para empezar
Realizar el análisis gratis

Autor

avatar for Dottly AI Team
Dottly AI Team

Categorías

    Defina «todas las páginas» antes de contarComience con datos de inventario de primera fuenteAñada el conjunto del sitemapRastree desde algo más que la página de inicioUtilice registros para encontrar solicitudes realesAñada Search Console y pruebas de indexaciónConcilie y priorice las discrepanciasTenga en cuenta JavaScript, los parámetros y las rutas ocultasHaga que el inventario sea reproducibleConecte el inventario técnico con las cuestiones de visibilidadFAQ¿Muestra site:example.com todas las páginas?¿Es el sitemap la lista completa de páginas?¿Debería rastrear primero el sitemap o la página de inicio?¿Con qué frecuencia debería crear un inventario de páginas?

    Más publicaciones

    Cómo enviar tu sitio a buscadores: flujo moderno

    Cómo enviar tu sitio a buscadores: flujo moderno

    Aprende cómo enviar un sitio web a Google, Bing y motores de búsqueda participantes con verificación, sitemaps y comprobaciones posteriores al lanzamiento.

    avatar for Dottly AI Team
    Dottly AI Team
    2026/09/09
    SEO para sitemaps: marco de auditoría y mantenimiento

    SEO para sitemaps: marco de auditoría y mantenimiento

    Descubre qué debe incluir un sitemap XML, cómo auditarlo y cómo conectar sus datos con las evidencias de rastreo e indexación.

    avatar for Dottly AI Team
    Dottly AI Team
    2026/09/09
    El mejor rank tracker con API: opciones y checklist de compra
    Guías de productos

    El mejor rank tracker con API: opciones y checklist de compra

    Compara APIs de rank tracking por modelo de datos, historial, geolocalización, fallos y coste. Usa una prueba de aceptación antes de elegir proveedor.

    avatar for Dottly AI Team
    Dottly AI Team
    2026/09/23

    Newsletter

    Únete a la comunidad

    Suscríbete a nuestro newsletter para las últimas noticias y actualizaciones

    Dottly AI

    Sigue lo que ChatGPT, Gemini y Grok dicen de tu marca.

    Producto
    • Funciones
    • Precios
    • Preguntas frecuentes
    Recursos
    • Blog
    • Documentación
    Empresa
    • Quiénes somos
    • Contacto
    Legal
    • Política de cookies
    • Política de privacidad
    • Términos del servicio
    © 2026 Dottly AI. All Rights Reserved.

    DOTTLY AI