
Como encontrar todas as páginas: inventário de SEO
Aprenda como fazer o inventário de um site com sitemaps, rastreadores, links, logs e Search Console sem confundir descoberta com indexação.
Não existe uma única consulta de pesquisa que retorne de forma confiável todas as páginas de um site. Um inventário defensável combina vários conjuntos: URLs que o CMS publica, URLs listadas em sitemaps, URLs que um rastreador consegue alcançar, URLs observadas em logs e URLs que os mecanismos de busca relatam como descobertas ou indexadas. As diferenças são a parte útil da auditoria, pois revelam páginas órfãs, rotas obsoletas, redirecionamentos e lacunas na sua mensuração.
Defina “todas as páginas” antes de contar
As equipes costumam comparar números que descrevem coisas diferentes. Escreva o conjunto que você precisa antes de abrir uma ferramenta:
- Páginas publicadas: registros que o CMS ou a aplicação considera públicos.
- Rotas servidas: URLs que respondem a partir da produção, incluindo rotas utilitárias e legadas.
- Páginas detectáveis: URLs expostas por links, sitemaps, feeds ou outros caminhos de rastreamento.
- Páginas rastreáveis: URLs que um rastreador alcança sob um ponto de partida, user agent e configuração de renderização definidos.
- Páginas indexadas: URLs que um mecanismo de busca relata como qualificadas ou indexadas.
- Ativos de conteúdo: PDFs, imagens, vídeos e arquivos que podem não se comportar como páginas HTML.
Esses conjuntos se sobrepõem sem serem idênticos. Um registro privado do CMS pode nunca ser servido. Uma landing page órfã pode ser servida, mas não linkada. Uma URL pode ser rastreada e depois excluída de um índice. As diretrizes de descoberta de páginas do Google separam explicitamente o que um site contém daquilo que o Google tentou rastrear e indexar.
Comece com dados de inventário de primeira parte
Exporte os registros canônicos do seu CMS, repositório, manifesto de rotas ou banco de dados. Inclua os campos necessários para explicar uma URL mais tarde:
| Campo | Por que é importante |
|---|---|
| URL e localidade | Identifica a rota exata e a família de idiomas |
| Estado de publicação | Separa registros em rascunho, agendados, privados e públicos |
| URL canônica | Mostra o endereço preferencial quando existem aliases |
| Última alteração significativa | Suporta datas de revisão e de sitemap |
| Tipo de conteúdo e responsável | Encaminha correções para a equipe certa |
| Arquivo de origem ou ID do registro | Torna o inventário reproduzível |
Normalize host, protocolo, barra final (trailing slash), maiúsculas/minúsculas e parâmetros de consulta antes de desduplicar. Mantenha a exportação bruta separada da visualização normalizada para que uma auditoria futura possa reproduzir como uma contagem foi produzida. Não descarte silenciosamente linhas que falharem na normalização; rotule-as para revisão.
Adicione o conjunto do sitemap
Busque o sitemap público e cada arquivo referenciado por um índice de sitemap. Analise o conjunto de URLs e compare-o com a exportação de primeira parte. O sitemap geralmente deve conter páginas canônicas que você deseja que os mecanismos de busca descubram, não todas as rotas que sua aplicação pode servir. A visão geral de sitemaps do Google o descreve como um arquivo que fornece informações sobre páginas e outros recursos; não é um registro completo de índice.
Registre estes tipos de divergência:
- URL canônica publicada ausente no sitemap;
- URL do sitemap não presente no sistema de publicação;
- URL do sitemap redirecionando para outro local;
- URL do sitemap bloqueada ou marcada como
noindex; - variante de localidade duplicada ou não canônica; e
- URL obsoleta que não é mais servida.
Para regras de validação mais aprofundadas, consulte o fluxo de trabalho de melhores práticas de sitemap. Corrija o gerador ou a regra de publicação subjacente em vez de editar o XML gerado manualmente.
Rastreie a partir de mais lugares além da página inicial
Um rastreador revela o que é alcançável sob uma configuração definida. Inicialize o rastreamento com a página inicial, navegação principal, sitemap XML, feeds RSS e hubs importantes de categorias ou documentação. Documente os parâmetros de execução: user agent, renderização de JavaScript, recursos bloqueados, autenticação, profundidade e exclusões de URL.
Use o rastreamento para coletar código de status, canônica, diretiva de robots, título, cabeçalho, tipo de conteúdo, idioma e contagem de links recebidos. Um rastreamento renderizado pode descobrir rotas que um rastreamento de HTML bruto perde, enquanto um rastreamento bruto pode expor problemas no lado do servidor ocultados pela renderização do cliente. Execute ambos quando a aplicação for fortemente renderizada no lado do cliente.
O resultado é um conjunto de rastreamento, não uma afirmação de que todas as páginas existem. Ele não consegue encontrar uma rota órfã sem semente fornecida, um registro privado de backend ou uma URL bloqueada antes que o rastreador possa inspecioná-la. Combine o trabalho com ferramentas de rastreamento para SEO e mantenha a configuração no registro da auditoria.
Use logs para encontrar solicitações reais
Os logs do servidor ou de borda (edge) mostram quais URLs receberam solicitações, por qual user agent e com qual resposta. Filtre o tráfego de bots separadamente de humanos, serviços de monitoramento, pré-visualizações e ruídos de ataques. Os logs podem revelar:
- bots de busca solicitando uma URL ausente do seu sitemap;
- solicitações repetidas a parâmetros obsoletos ou redirecionamentos;
- páginas recebendo tráfego interno, mas sem visitas de rastreamento; e
- variantes inesperadas de localidade, host ou protocolo.
Os logs não enumeram páginas que nunca foram solicitadas. Trate-os como comportamento observado, não como um inventário completo. Mantenha a janela de coleta e as regras de amostragem para que as comparações ao longo dos meses permaneçam significativas.
Adicione o Search Console e evidências de índice
Os relatórios do Search Console são valiosos porque mostram a perspectiva de um mecanismo de busca, mas não são uma exportação de banco de dados de todo o seu site. Use as visualizações de Inspeção de URL e Indexação de Páginas para amostras representativas e anomalias importantes. Compare seus estados com seus conjuntos de primeira parte, sitemap, rastreamento e logs.
Uma tabela de reconciliação útil se parece com isto:
| Estado da URL | Interpretação | Próxima ação |
|---|---|---|
| Publicada + linkada + sitemap + indexada | Caminho esperado | Monitorar alterações |
| Publicada + sitemap, sem evidência de rastreamento | Lacuna de descoberta ou prioridade | Verificar links, acesso e momento de lançamento |
| Publicada + rastreamento, não indexada | Problema de qualificação ou qualidade | Inspecionar canônica, robots e conteúdo |
| Servida + sem registro de responsável | Rota legada ou não intencional | Atribuir responsável, redirecionar ou remover |
| Indexada + sem registro de origem atual | URL obsoleta ou migrada | Verificar canônica e tratamento de migração |
Esse modelo evita que “encontramos 500 URLs” se torne uma métrica de sucesso enganosa. O número só é útil com uma definição, fonte, carimbo de data/hora e exclusões conhecidas.
Reconcilie e priorize as lacunas
Depois de mesclar os conjuntos, desduplique por URL canônica normalizada e mantenha colunas de proveniência como cms, sitemap, crawl, log e search-console. Em seguida, classifique cada lacuna:
- Diferença esperada: privada, noindex, utilitária ou intencionalmente excluída.
- Candidata a reparo: publicada, mas sem um link, entrada no sitemap ou canônica.
- Risco de migração: host, localidade, parâmetro antigo ou URL redirecionada ainda recebendo tráfego.
- Desconhecida: evidência insuficiente; colete outra amostra antes de alterar a produção.
Priorize por valor para o usuário e para o negócio, não pela contagem bruta de URLs. Uma canônica corrompida em uma página principal de produto merece atenção antes de uma família de parâmetros de baixo valor. Mantenha um registro de decisões para que a mesma exceção não seja discutida novamente a cada auditoria.
Leve em conta JavaScript, parâmetros e rotas ocultas
Aplicações modernas podem expor várias populações de URLs que um rastreamento simples de HTML não detecta. A navegação do lado do cliente pode criar links apenas após a renderização, filtros facetados podem gerar grandes espaços de parâmetros e APIs podem servir conteúdo que não tem uma rota HTML indexável. Execute um rastreamento renderizado quando o framework exigir, mas compare o resultado com a resposta bruta para ver o que depende de JavaScript.
Defina regras de parâmetros antes de rastrear. Permitir cada combinação de filtros pode transformar um exercício de inventário em um rastreamento sem limites; excluir cada string de consulta pode ocultar comportamentos valiosos de campanha, busca ou paginação. Mantenha uma amostra separada de URLs rejeitadas e documente por que o padrão está fora do conjunto de páginas canônicas.
Inspecione também manifestos de rota e configurações de servidor em busca de páginas difíceis de descobrir por meio de links de conteúdo: páginas de status, redirecionamentos, rotas antigas de campanha, arquivos para download e endpoints gerados por frameworks. Elas podem não pertencer ao inventário de SEO, mas atribuir a elas um tipo e um responsável evita que se tornem uma superfície de produção não explicada.
Torne o inventário reproduzível
Agende as fontes que mudam com frequência e mantenha um snapshot com data de cada resultado. No mínimo, guarde:
- a exportação de primeira parte normalizada;
- as URLs de sitemap obtidas;
- configuração e saída do rastreamento;
- a janela de logs e os filtros de bots;
- estados amostrados do Search Console; e
- as regras de mesclagem e lacunas não resolvidas.
Execute o inventário após uma migração de domínio, roteamento, CMS, localidade ou navegação. Para a publicação normal, uma verificação mais leve diária ou baseada em lançamentos pode identificar entradas ausentes no sitemap e links quebrados antes que eles se acumulem.
Conecte o inventário técnico a questões de visibilidade
Encontrar uma página não é o mesmo que provar que ela está visível na busca ou em respostas de IA. Assim que o conjunto de URLs for confiável, você poderá investigar se páginas importantes estão indexadas, citadas ou representadas em respostas amostradas. A documentação da Dottly AI pode dar suporte à transição da mensuração, mas mantenha as trilhas de evidência separadas: dados de rastreamento explicam o acesso, enquanto evidências no nível de resposta explicam o que um modelo realmente retornou.
FAQ
O comando site:example.com mostra todas as páginas?
Não. É uma verificação pontual útil, não um inventário exaustivo. As páginas de resultados dos mecanismos de busca são amostradas e podem omitir URLs por diversos motivos.
O sitemap é a lista completa de páginas?
Não. Ele é um conjunto de descoberta selecionado. Ele pode omitir intencionalmente rotas privadas, de baixo valor, duplicadas ou que não sejam HTML, e não pode listar URLs que o sistema de publicação desconhece.
Devo rastrear o sitemap ou a página inicial primeiro?
Use ambos. A página inicial e a navegação mostram a acessibilidade por links; o sitemap expõe as URLs canônicas pretendidas. A diferença entre eles costuma ser a maneira mais rápida de encontrar páginas órfãs ou obsoletas.
Com que frequência devo criar um inventário de páginas?
Use uma verificação acionada por lançamentos para alterações de roteamento e conteúdo, além de uma reconciliação agendada para logs e dados de busca. Aumente a frequência durante migrações ou resposta a incidentes.
A resposta confiável para “quantas páginas nós temos?” é uma comparação documentada de conjuntos, não um número único. Quando cada URL tem proveniência e um responsável, o inventário se torna uma ferramenta de decisão para a manutenção de SEO em vez de um relatório de rastreamento pontual.
Continue com guias relacionados
Autor

Categorias
site:example.com mostra todas as páginas?O sitemap é a lista completa de páginas?Devo rastrear o sitemap ou a página inicial primeiro?Com que frequência devo criar um inventário de páginas?Mais publicações

Como enviar seu site a buscadores: fluxo moderno
Saiba como enviar um site para o Google, Bing e mecanismos de busca participantes com verificação, sitemaps e verificações pós-lançamento.


SEO para Sitemaps: Estrutura de Auditoria e Manutenção
Aprenda o que deve constar em um sitemap XML, como auditá-lo e como conectar os dados do sitemap com evidências de rastreamento e indexação.

Melhor Rank Tracker com API: Opções e Checklist de Compra
Compare APIs de rank tracking por modelo de dados, histórico, falhas e custo. Faça um teste prático de aceitação antes de escolher um provedor.

Boletim informativo
Junte-se à comunidade
Assine nossa newsletter para as últimas notícias e atualizações
