Robôs da web · Explicador
Crawler: o que um robô faz na sua página, do primeiro pedido ao índice
Por Redação Citado pela IA · RFC 9309 e docs oficiais · Leitura de 11 minutos

Neste artigo
- O ciclo, em cinco etapas
- Orçamento de rastreio, sem misticismo
- Linha do tempo
- Quem respeita o arquivo e quem não respeita
- Como identificar um robô no seu log
- Rastreio para busca, para treino e para leitura ao vivo
- O que o robô faz com os links que encontra
- Robô útil, robô caro e robô hostil
- O que atrapalha o rastreio sem ninguém perceber
- O que fazer nesta semana
- Perguntas frequentes
Crawler é um programa que pede páginas da web, lê o conteúdo, extrai os links encontrados e volta a pedir. A definição cabe numa linha, e quase tudo que importa para quem publica está no que acontece entre um pedido e o seguinte.
O robô que alimenta um buscador, o que recolhe material para treinar modelo e o que abre uma URL porque alguém pediu executam o mesmo movimento básico com finalidades diferentes. Confundir os três é a origem da maior parte dos erros de configuração.
O ciclo, em cinco etapas
Descoberta. O robô precisa saber que a URL existe. Ele chega por link em outra página, por sitemap declarado, por link externo ou por aviso ativo de protocolos como o IndexNow. Página sem nenhum caminho até ela é órfã, e órfã demora ou nunca aparece.
Fila e prioridade. As URLs conhecidas entram numa fila ordenada por critérios do dono do robô. Página importante, atualizada com frequência e bem ligada internamente sobe na fila.
Busca. O robô faz a requisição e recebe o documento. Aqui pesam o código de resposta, o tempo de servidor e o tamanho do arquivo.
Processamento. O documento é lido, os links são extraídos e o conteúdo é preparado. Página que depende de script para exibir texto exige uma etapa extra, e nem todo robô a executa.
Indexação ou descarte. O conteúdo entra no índice ou é descartado. Ser rastreado não garante ser indexado, e é a distinção que salva muita discussão inútil.
Orçamento de rastreio, sem misticismo
Todo robô tem limite de quanto vai pedir de um mesmo servidor. O limite reage a dois fatores.
O primeiro é a saúde do servidor. Resposta rápida e estável faz o robô pedir mais. Erro 5xx e tempo esgotado fazem o robô recuar, às vezes por dias, e a recuperação é mais lenta que a queda.
O segundo é o valor percebido do site. Conteúdo que muda, que é procurado e que recebe link tende a ser revisitado com frequência maior.
Site pequeno raramente tem problema de orçamento. O problema aparece em site com dezenas de milhares de URLs, em geral geradas por filtro, busca interna e parâmetro, que consomem visita sem produzir página útil.
A correção é sempre a mesma: fechar no robots.txt o que não deve ser rastreado, evitar link interno para variação inútil de URL e manter o sitemap contendo só URLs que respondem 200 e são indexáveis.
Linha do tempo
- 1994Martijn Koster propõe o padrão de exclusão de robôs, o arquivo robots.txt, depois de um rastreador sobrecarregar servidores.
- 2005Google, Yahoo e Microsoft anunciam apoio comum ao protocolo de sitemap, publicado como versão 0.90 em sitemaps.org.
- 2019O Google anuncia que deixa de obedecer à regra de não indexação escrita dentro do robots.txt, campo que nunca foi parte do padrão.
- 2022O protocolo de exclusão de robôs vira padrão da IETF, a RFC 9309, trinta anos depois da proposta original.
- 2023A OpenAI publica o token do robô de treino e o Google publica o Google-Extended, dando ao publicador controle explícito sobre uso do conteúdo em treino de modelo.
- 2024Sai a proposta do arquivo llms.txt, em 3 de setembro, sugerindo um resumo em markdown na raiz do site para consumo por modelo.
- 2025Em 1º de julho a Cloudflare passa a bloquear robôs de IA por padrão nos sites da rede dela e abre o beta de cobrança por rastreio.
- 2026Em junho o Google lança relatórios dedicados de recursos de IA generativa no Search Console, com impressão apenas.
Quem respeita o arquivo e quem não respeita
O robots.txt é instrução, não tranca. Ele funciona por acordo, e o acordo é público desde 1994.
Robô de empresa grande costuma declarar que obedece, e a declaração é verificável no log: se o token aparece pedindo caminho fechado, a declaração falhou.
Buscador disparado por usuário é caso à parte por desenho. A doc da OpenAI diz que as regras do arquivo podem não valer quando a ação nasce de um pedido humano, e a doc da Perplexity diz que o agente de pedido geralmente ignora o arquivo.
Contra quem simplesmente ignora, o arquivo não serve. Aí o caminho é técnico: limite de taxa, bloqueio por endereço, autenticação ou serviço de borda.
A newsletter Citado pela IA está em preparação
Deixe seu email e receba o aviso quando o primeiro envio sair.
Entre antes do primeiro envio.
Você só recebe o aviso de lançamento. Cancele quando quiser.
Como identificar um robô no seu log
Cada requisição carrega um cabeçalho de user agent, e o robô educado escreve ali o token que o identifica.
O primeiro passo é filtrar o log por token e contar. O segundo é olhar o código de resposta devolvido a cada visita. O terceiro, e o que separa diagnóstico de palpite, é conferir o endereço de origem contra a lista publicada pelo dono do robô.
A conferência importa porque o cabeçalho é texto livre. Qualquer script escreve o nome de um robô conhecido e o seu log registra o nome. Em agosto de 2025, a Cloudflare acusou publicamente uma empresa de motor de resposta de usar agentes não declarados com string de navegador comum, e a empresa negou, atribuindo o tráfego a um serviço de terceiros. A disputa não se resolve pelo nome no cabeçalho, e é justamente o ponto.
A biblioteca de robôs deste site guarda, para cada agente, o token do robots.txt, o dono, a finalidade, a doc oficial lida e a data da conferência.
Rastreio para busca, para treino e para leitura ao vivo
A mesma requisição pode servir a três finalidades diferentes, e cada uma tem consequência distinta.
Rastreio para índice de busca produz a chance de aparecer em resultado ou como fonte citada, com link. É a finalidade que devolve visita.
Rastreio para treino alimenta o modelo. Não devolve visita, não aparece em relatório e tem efeito de longo prazo sobre o que o modelo sabe.
Leitura ao vivo acontece quando um agente abre a URL para responder a uma pergunta específica naquele instante. Costuma ignorar cache e pedir a versão atual da página.
Decidir as três de uma vez com uma regra genérica é o erro mais comum de robots.txt, e ele custa distribuição em troca de uma proteção que raramente era o objetivo.
O que o robô faz com os links que encontra
A extração de links é o motor do rastreio, e a arquitetura interna do site decide o que o robô alcança.
Link em texto, dentro do HTML, é o caso que sempre funciona. Link que só existe depois de um clique em menu montado por script pode não existir para o robô, e páginas alcançáveis apenas por ele viram órfãs sem ninguém perceber.
A profundidade também pesa. Página a um clique da capa recebe atenção diferente de página a seis cliques, porque a distância é lida como sinal de importância dentro da própria casa.
Existe ainda o atributo que pede para o link não passar crédito. Ele serve para conteúdo pago e para link enviado por terceiro, e usá-lo dentro do próprio site apenas atrapalha a leitura da estrutura.
O teste caseiro é direto: baixe uma página sem executar script e conte quantos endereços internos aparecem no documento. O número que sair é o que o robô enxerga, e costuma ser bem menor do que o menu do navegador sugere.
Robô útil, robô caro e robô hostil
Nem todo rastreador quer a mesma coisa, e o log mistura os três grupos.
O grupo útil reúne os robôs de busca e de motores de resposta. Eles trazem visita ou citação e merecem porta aberta, com raras exceções.
O grupo caro reúne ferramentas de análise de mercado, verificadores de link e coletores de dado comercial. Não trazem visita nenhuma e podem consumir mais requisição que os buscadores somados. Fechar ou limitar é decisão de custo, não de princípio.
O grupo hostil reúne varredura de vulnerabilidade e coleta de conteúdo para republicação. Não se identifica com honestidade, não obedece a arquivo nenhum e só responde a bloqueio técnico.
A separação prática sai de duas colunas na sua planilha de log: requisições por token e visitas humanas atribuíveis àquele produto no mesmo período. Robô que consome muito e devolve zero é candidato natural a limite de taxa.
O que atrapalha o rastreio sem ninguém perceber
Cinco defeitos comuns aparecem em quase toda auditoria.
- Recurso bloqueado no robots.txt. Fechar diretório de script ou de estilo atrapalha o processamento da página inteira.
- Cadeia de redirecionamento. Cada salto custa, e o Google segue até cinco saltos ao buscar o robots.txt antes de tratar o caso como ausência de arquivo.
- Sitemap com URL que responde 3xx ou 404. O arquivo perde confiabilidade e o robô passa a tratá-lo com menos prioridade.
- Página lenta em série. O robô reduz o ritmo quando o servidor demora, e a redução dura mais que o problema.
- Parâmetro de URL sem controle. Filtro e ordenação geram milhares de endereços com o mesmo conteúdo.
O que fazer nesta semana
Três tarefas, nenhuma delas cara.
Primeiro, abrir o robots.txt do seu domínio e ler linha por linha, conferindo se cada bloqueio é intencional.
Segundo, comparar o número de URLs do sitemap com o número de páginas indexadas no painel de cada buscador. Diferença grande é o achado que justifica a semana.
Terceiro, filtrar trinta dias de log por token de robô e anotar quatro números por agente: requisições, páginas distintas, código de resposta predominante e horário de pico.
O resultado das três cabe numa página e vira base de comparação. Repetida a cada trimestre, a mesma folha mostra se o site está sendo lido mais ou menos, por quem, e em que estado o servidor recebeu cada visita.
Perguntas frequentes
Qual a diferença entre rastrear e indexar?
Rastrear é pedir e ler a página. Indexar é guardar o conteúdo no índice do buscador. Uma página pode ser rastreada e não indexada, o que costuma ser decisão de qualidade, e pode estar indexada sem ter sido rastreada recentemente.
Bloquear no robots.txt tira a página do buscador?
Não necessariamente. O bloqueio impede o rastreio, e uma URL bloqueada ainda pode aparecer em resultado se outras páginas apontarem para ela. Para impedir a indexação, o caminho é a instrução de não indexação na própria página, que só funciona se o robô puder ler a página.
O que é orçamento de rastreio?
É o limite prático de quantas requisições um robô faz ao seu servidor em um período. Reage à velocidade e à estabilidade do servidor e ao valor percebido do site. Preocupa sites grandes com muita URL gerada automaticamente, quase nunca sites pequenos.
Como impedir um robô que ignora o robots.txt?
Com meio técnico, não com instrução: limite de taxa, bloqueio por faixa de endereços, autenticação ou serviço de borda. Desde 1º de julho de 2025 a Cloudflare bloqueia robôs de IA por padrão nos sites da rede dela, o que resolve o caso por infraestrutura.
Robô de IA e robô de busca são a mesma coisa?
Não. Uma mesma empresa costuma operar robôs separados para índice de busca, para treino de modelo e para leitura disparada pelo usuário, cada um com token próprio. A decisão sobre cada um é independente.
Preciso de sitemap se meu site é pequeno?
Não é obrigatório, e ajuda mesmo assim. O sitemap declara as URLs que você considera importantes e a data de alteração de cada uma, o que acelera a descoberta de conteúdo novo e facilita a comparação entre publicado e indexado.
Veja também
robots.txt: as regras que o robô lê e os erros que quebram o arquivo
Citado pela IA está chegando
Deixe seu email e receba o aviso quando o primeiro envio sair.
Entre antes do primeiro envio.
Você só recebe o aviso de lançamento. Cancele quando quiser.