
Cómo encontrar todas las páginas: inventario SEO
Aprenda a inventariar un sitio web con sitemaps, rastreadores, enlaces, registros y Search Console sin confundir el descubrimiento con la indexación.
No existe una única consulta de búsqueda que devuelva de forma fiable cada página de un sitio web. Un inventario defendible combina varios conjuntos: las URL que publica el CMS, las URL enumeradas en los sitemaps, las URL a las que puede llegar un rastreador, las URL observadas en los registros y las URL que los motores de búsqueda reportan como descubiertas o indexadas. Las diferencias constituyen la parte útil de la auditoría porque revelan páginas huérfanas, rutas obsoletas, redirecciones y lagunas en su medición.
Defina «todas las páginas» antes de contar
Los equipos a menudo comparan cifras que describen cosas diferentes. Escriba el conjunto que necesita antes de abrir una herramienta:
- Páginas publicadas: registros que el CMS o la aplicación considera públicos.
- Rutas servidas: URL que responden desde producción, incluidas las rutas de utilidad y heredadas.
- Páginas descubribles: URL expuestas mediante enlaces, sitemaps, feeds u otras rutas de rastreo.
- Páginas rastreables: URL a las que llega un rastreador bajo un punto de partida, un agente de usuario y una configuración de renderizado definidos.
- Páginas indexadas: URL que un motor de búsqueda reporta como aptas o indexadas.
- Recursos de contenido: PDF, imágenes, vídeos y archivos que pueden no comportarse como páginas HTML.
Estos conjuntos se solapan sin ser idénticos. Es posible que un registro privado del CMS nunca se sirva. Una página de destino huérfana puede servirse pero no estar enlazada. Una URL puede rastrearse y luego excluirse de un índice. La guía de descubrimiento de páginas de Google separa explícitamente lo que contiene un sitio de lo que Google ha intentado rastrear e indexar.
Comience con datos de inventario de primera fuente
Exporte los registros canónicos desde su CMS, repositorio, manifiesto de rutas o base de datos. Incluya los campos necesarios para explicar una URL más adelante:
| Campo | Por qué es importante |
|---|---|
| URL y configuración regional (locale) | Identifica la ruta exacta y la familia lingüística |
| Estado de publicación | Separa registros en borrador, programados, privados y públicos |
| URL canónica | Muestra la dirección preferida cuando existen alias |
| Último cambio significativo | Respaldan las fechas de revisión y de los sitemaps |
| Tipo de contenido y responsable | Dirige las correcciones al equipo adecuado |
| Archivo de origen o ID de registro | Hace que el inventario sea reproducible |
Normalice el host, el protocolo, la barra final, el uso de mayúsculas y minúsculas y los parámetros de consulta antes de desduplicar. Mantenga la exportación sin procesar separada de la vista normalizada para que una auditoría futura pueda reproducir cómo se generó un recuento. No descarte silenciosamente las filas que no superen la normalización; etiquételas para su revisión.
Añada el conjunto del sitemap
Obtenga el sitemap público y cada archivo al que haga referencia un índice de sitemaps. Analice el conjunto de URL y luego compárelo con la exportación de primera fuente. Por lo general, el sitemap debe contener las páginas canónicas que desea que los motores de búsqueda descubran, no todas las rutas que su aplicación puede servir. La descripción general de sitemaps de Google lo describe como un archivo que proporciona información sobre páginas y otros recursos; no es un registro completo del índice.
Registre estos tipos de discrepancias:
- URL canónica publicada que falta en el sitemap;
- URL del sitemap no presente en el sistema de publicación;
- URL del sitemap que redirige a otro lugar;
- URL del sitemap bloqueada o marcada como
noindex; - variante regional duplicada o no canónica; y
- URL obsoleta que ya no se sirve.
Para reglas de validación más profundas, consulte el flujo de trabajo de mejores prácticas para sitemaps. Corrija el generador subyacente o la regla de publicación en lugar de editar a mano el XML generado.
Rastree desde algo más que la página de inicio
Un rastreador revela lo que es accesible bajo una configuración definida. Inicie el rastreo con la página de inicio, la navegación principal, el sitemap XML, los feeds RSS y los centros importantes de categorías o documentación. Documente los parámetros de ejecución: agente de usuario, renderizado de JavaScript, recursos bloqueados, autenticación, profundidad y exclusiones de URL.
Utilice el rastreo para recopilar el código de estado, la URL canónica, la directiva de robots, el título, los encabezados, el tipo de contenido, el idioma y los recuentos de enlaces entrantes. Un rastreo renderizado puede descubrir rutas que un rastreo de HTML sin procesar pasa por alto, mientras que un rastreo sin procesar puede exponer problemas del lado del servidor ocultos por el renderizado del cliente. Ejecute ambos cuando la aplicación dependa en gran medida del renderizado en el cliente.
El resultado es un conjunto de rastreo, no una afirmación de que todas las páginas existen. No puede encontrar una ruta huérfana sin una semilla suministrada, un registro privado del backend o una URL bloqueada antes de que el rastreador pueda inspeccionarla. Combine el trabajo con herramientas de rastreo para SEO y mantenga la configuración en el registro de auditoría.
Utilice registros para encontrar solicitudes reales
Los registros del servidor o de edge muestran qué URL recibieron solicitudes, mediante qué agente de usuario y con qué respuesta. Filtre el tráfico de bots por separado del de humanos, servicios de monitorización, previsualizaciones y ruido de ataques. Los registros pueden revelar:
- bots de búsqueda solicitando una URL ausente de su sitemap;
- solicitudes repetidas a parámetros obsoletos o redirecciones;
- páginas que reciben tráfico interno pero ninguna visita de rastreo; y
- variantes inesperadas de configuración regional, host o protocolo.
Los registros no enumeran las páginas que nunca se han solicitado. Trátelos como un comportamiento observado, no como un inventario completo. Conserve el período de recopilación y las reglas de muestreo para que las comparaciones a lo largo de los meses sigan siendo significativas.
Añada Search Console y pruebas de indexación
Los informes de Search Console son valiosos porque muestran la perspectiva de un motor de búsqueda, pero no son una exportación de base de datos de todo su sitio. Utilice las vistas de Inspección de URL y de Indexación de páginas para muestras representativas y anomalías importantes. Compare sus estados con sus conjuntos de primera fuente, sitemaps, rastreo y registros.
Una tabla de conciliación útil tiene este aspecto:
| Estado de la URL | Interpretación | Siguiente acción |
|---|---|---|
| Publicada + enlazada + sitemap + indexada | Ruta esperada | Monitorizar cambios |
| Publicada + sitemap, sin evidencia de rastreo | Brecha de descubrimiento o prioridad | Comprobar enlaces, acceso y tiempos de publicación |
| Publicada + rastreo, no indexada | Problema de aptitud o calidad | Inspeccionar canónica, robots y contenido |
| Servida + sin registro de responsable | Ruta heredada o no intencionada | Asignar responsable, redirigir o eliminar |
| Indexada + sin registro de origen actual | URL obsoleta o migrada | Verificar canónica y gestión de migración |
Este modelo evita que «encontramos 500 URL» se convierta en una métrica de éxito engañosa. El número solo es útil con una definición, una fuente, una marca de tiempo y las exclusiones conocidas.
Concilie y priorice las discrepancias
Después de fusionar los conjuntos, desduplique por URL canónica normalizada y conserve las columnas de procedencia como cms, sitemap, crawl, log y search-console. A continuación, clasifique cada discrepancia:
- Diferencia esperada: privada, noindex, de utilidad o excluida intencionadamente.
- Candidata a reparación: publicada pero carente de enlace, entrada en el sitemap o canónica.
- Riesgo de migración: host, configuración regional, parámetro o URL redirigida antiguos que aún reciben tráfico.
- Desconocida: evidencia insuficiente; recopile otra muestra antes de realizar cambios en producción.
Priorice según el valor para el usuario y el negocio, no por el recuento bruto de URL. Una canónica rota en una página de producto principal merece atención antes que una familia de parámetros de bajo valor. Mantenga un registro de decisiones para que la misma excepción no se vuelva a debatir en cada auditoría.
Tenga en cuenta JavaScript, los parámetros y las rutas ocultas
Las aplicaciones modernas pueden exponer varias poblaciones de URL que un rastreo de HTML simple no detecta. La navegación del lado del cliente puede crear enlaces solo después del renderizado, los filtros facetados pueden generar amplios espacios de parámetros y las API pueden servir contenido que no tiene una ruta HTML indexable. Ejecute un rastreo renderizado cuando el framework lo requiera, pero compare el resultado con la respuesta sin procesar para que pueda ver qué depende de JavaScript.
Establezca reglas de parámetros antes de rastrear. Permitir cada combinación de filtros puede convertir un ejercicio de inventario en un rastreo sin límites; excluir cada cadena de consulta puede ocultar comportamientos valiosos de campañas, búsquedas o paginación. Mantenga una muestra separada de las URL rechazadas y documente por qué el patrón queda fuera del conjunto de páginas canónicas.
Inspeccione también los manifiestos de rutas y la configuración del servidor en busca de páginas que sean difíciles de descubrir a través de enlaces de contenido: páginas de estado, redirecciones, rutas de campañas antiguas, archivos descargables y endpoints generados por frameworks. Puede que no pertenezcan al inventario SEO, pero asignarles un tipo y un responsable evita que se conviertan en una superficie de producción inexplicable.
Haga que el inventario sea reproducible
Programe las fuentes que cambian con frecuencia y conserve una instantánea fechada de cada resultado. Como mínimo, conserve:
- la exportación de primera fuente normalizada;
- las URL de los sitemaps obtenidos;
- la configuración y la salida del rastreo;
- el intervalo de registros y los filtros de bots;
- los estados muestreados de Search Console; y
- las reglas de fusión y las discrepancias sin resolver.
Ejecute el inventario después de una migración de dominio, enrutamiento, CMS, configuración regional o navegación. Para la publicación habitual, una comprobación más ligera diaria o basada en versiones puede detectar entradas de sitemap faltantes y enlaces rotos antes de que se acumulen.
Conecte el inventario técnico con las cuestiones de visibilidad
Encontrar una página no equivale a demostrar que es visible en las búsquedas o en las respuestas de IA. Una vez que el conjunto de URL sea de confianza, puede investigar si las páginas importantes están indexadas, citadas o representadas en respuestas muestreadas. La documentación de Dottly AI puede respaldar el traspaso a la medición, pero mantenga separadas las vías de evidencia: los datos de rastreo explican el acceso, mientras que la evidencia a nivel de respuesta explica lo que realmente devolvió un modelo.
FAQ
¿Muestra site:example.com todas las páginas?
No. Es una comprobación puntual útil, no un inventario exhaustivo. Las páginas de resultados de los motores de búsqueda son muestreadas y pueden omitir URL por muchas razones.
¿Es el sitemap la lista completa de páginas?
No. Es un conjunto de descubrimiento curado. Puede omitir intencionadamente rutas privadas, de bajo valor, duplicadas o que no sean HTML, y no puede enumerar URL que el sistema de publicación desconoce.
¿Debería rastrear primero el sitemap o la página de inicio?
Utilice ambos. La página de inicio y la navegación muestran la accesibilidad de los enlaces; el sitemap expone las URL canónicas previstas. Su diferencia suele ser la forma más rápida de encontrar páginas huérfanas u obsoletas.
¿Con qué frecuencia debería crear un inventario de páginas?
Utilice una comprobación activada por cada versión para cambios de rutas y contenido, además de una conciliación programada para registros y datos de búsqueda. Aumente la frecuencia durante migraciones o en la respuesta a incidentes.
La respuesta fiable a «¿cuántas páginas tenemos?» es una comparación documentada de conjuntos, no un número único. Cuando cada URL tiene procedencia y un responsable, el inventario se convierte en una herramienta de decisión para el mantenimiento SEO en lugar de un informe de rastreo puntual.
Continúa con guías relacionadas
Autor

Categorías
site:example.com todas las páginas?¿Es el sitemap la lista completa de páginas?¿Debería rastrear primero el sitemap o la página de inicio?¿Con qué frecuencia debería crear un inventario de páginas?Más publicaciones

Cómo enviar tu sitio a buscadores: flujo moderno
Aprende cómo enviar un sitio web a Google, Bing y motores de búsqueda participantes con verificación, sitemaps y comprobaciones posteriores al lanzamiento.


SEO para sitemaps: marco de auditoría y mantenimiento
Descubre qué debe incluir un sitemap XML, cómo auditarlo y cómo conectar sus datos con las evidencias de rastreo e indexación.

El mejor rank tracker con API: opciones y checklist de compra
Compara APIs de rank tracking por modelo de datos, historial, geolocalización, fallos y coste. Usa una prueba de aceptación antes de elegir proveedor.

Newsletter
Únete a la comunidad
Suscríbete a nuestro newsletter para las últimas noticias y actualizaciones
