Robôs da web · Treino de modelo

O que é o CCBot e como bloquear

Por Redação Citado pela IA · Conferido na doc oficial em 10/08/2026

Dono
Common Crawl
Token de user-agent
CCBot
Como aparece no log
CCBot/2.0 (https://commoncrawl.org/faq/)
Para que serve
Treino de modelo
Respeita robots.txt
Sim, pela doc do dono

O que o CCBot faz

Rastreia a web aberta para a Common Crawl, uma fundação sem fins lucrativos que publica o resultado como base pública, de graça. O material vira insumo de pesquisa acadêmica e de organizações, e é uma das origens mais citadas de conteúdo de treino de modelo de linguagem: quem entra na base pode acabar em modelo de qualquer empresa, sem contrato com nenhuma delas.

Como bloquear o CCBot

Duas linhas no robots.txt da raiz do domínio, em bloco próprio. O token vale por robô, então nomear um não afeta os outros:

User-agent: CCBot
Disallow: /

A Common Crawl declara na documentação que o robô honra as diretivas do robots.txt. Regra nova só passa a valer na próxima visita, e o arquivo precisa responder em /robots.txt.

O que se perde ao bloquear

É a linha de maior alcance por caractere escrito. Bloquear o CCBot não tira o site de busca nenhuma, porque ele não indexa para buscador, e ao mesmo tempo fecha a porta de entrada mais reaproveitada por quem treina modelo. O limite: a base já publicada continua existindo, então a regra vale para as coletas seguintes, e não apaga o que já saiu.

Fonte: documentação oficial da Common Crawl.

Citado pela IA está chegando

Deixe seu email e receba o aviso quando o primeiro envio sair.

Entre antes do primeiro envio.

Você só recebe o aviso de lançamento. Cancele quando quiser.