Robôs da web · Treino de modelo
O que é o CCBot e como bloquear
Por Redação Citado pela IA · Conferido na doc oficial em 10/08/2026
- Dono
- Common Crawl
- Token de user-agent
- CCBot
- Como aparece no log
- CCBot/2.0 (https://commoncrawl.org/faq/)
- Para que serve
- Treino de modelo
- Respeita robots.txt
- Sim, pela doc do dono
O que o CCBot faz
Rastreia a web aberta para a Common Crawl, uma fundação sem fins lucrativos que publica o resultado como base pública, de graça. O material vira insumo de pesquisa acadêmica e de organizações, e é uma das origens mais citadas de conteúdo de treino de modelo de linguagem: quem entra na base pode acabar em modelo de qualquer empresa, sem contrato com nenhuma delas.
Como bloquear o CCBot
Duas linhas no robots.txt da raiz do domínio, em bloco próprio. O token vale por robô, então nomear um não afeta os outros:
User-agent: CCBot
Disallow: /A Common Crawl declara na documentação que o robô honra as diretivas do robots.txt. Regra nova só passa a valer na próxima visita, e o arquivo precisa responder em /robots.txt.
O que se perde ao bloquear
É a linha de maior alcance por caractere escrito. Bloquear o CCBot não tira o site de busca nenhuma, porque ele não indexa para buscador, e ao mesmo tempo fecha a porta de entrada mais reaproveitada por quem treina modelo. O limite: a base já publicada continua existindo, então a regra vale para as coletas seguintes, e não apaga o que já saiu.
Citado pela IA está chegando
Deixe seu email e receba o aviso quando o primeiro envio sair.
Entre antes do primeiro envio.
Você só recebe o aviso de lançamento. Cancele quando quiser.