Robôs da web · Motor de resposta

Perplexity: o motor que responde citando a fonte, e como entrar na lista

Por Redação Citado pela IA · Doc de robôs da Perplexity · Leitura de 11 minutos

Mesa escura com uma folha de papel iluminada por luz verde e três marcadores numerados alinhados na margem, fundo em breu

A Perplexity montou o produto em cima de uma promessa simples: toda afirmação da resposta vem com o link da página que a sustenta. Para quem publica, a promessa muda o cálculo. A citação é a porta de entrada, e ela é visível.

O que decide se a sua página aparece nessa lista não é uma marcação nova. É a mesma coisa de sempre, com dois detalhes técnicos que quase ninguém checa: qual robô você deixou entrar e o que o robô encontrou quando entrou.

Dois agentes documentados, e só dois

A doc de robôs da Perplexity lista dois agentes, com a string completa de cada um e um endereço para conferência.

O PerplexityBot é o robô de busca. Ele percorre a web para que páginas apareçam como resultado e como fonte citada dentro do produto. A própria doc registra que ele não é usado para recolher conteúdo destinado a treino de modelo fundacional.

O Perplexity-User é o buscador acionado por pedido. Quando alguém faz uma pergunta e a resposta exige abrir um endereço específico, é ele quem visita a página naquele instante.

A diferença entre os dois muda o que o robots.txt consegue fazer. A doc afirma que o Perplexity-User geralmente ignora as regras do robots.txt, porque a visita nasce de um pedido humano, e o mesmo desenho aparece na doc de outras empresas de IA para os agentes de pedido.

Ignorar robots.txt não é falha, é categoria

A frase soa mal na primeira leitura e é padrão de mercado na segunda. Robô de arquivo e robô de índice percorrem a web por conta própria e obedecem ao arquivo. Buscador disparado por uma pessoa é tratado como extensão do navegador daquela pessoa.

A distinção existe também no Google, que separa a lista de rastreadores em robôs comuns, casos especiais e buscadores acionados pelo usuário, e na OpenAI, cuja doc diz que as regras do robots.txt podem não valer para a visita nascida de uma ação do usuário.

Quem precisa impedir a leitura ao vivo não resolve o problema no robots.txt. Resolve com autenticação, com bloqueio na borda ou com paywall, que são trancas, e não pedidos.

Verificar a visita pelo endereço, não pelo nome

A Perplexity publica um endereço com a lista de faixas de onde cada agente sai, um arquivo para o PerplexityBot e outro para o Perplexity-User.

A lista é a ferramenta central de qualquer diagnóstico honesto, porque o cabeçalho de user agent é texto livre. Qualquer script escreve PerplexityBot na requisição e o seu log vai registrar PerplexityBot.

Em agosto de 2025 o assunto virou disputa pública. A Cloudflare acusou a Perplexity de usar agentes não declarados, com string de navegador comum, para acessar conteúdo de sites que haviam bloqueado os robôs oficiais, e retirou a empresa da lista de robôs verificados dela. A Perplexity respondeu acusando a Cloudflare de erro de atribuição, dizendo que parte do tráfego apontado vinha de um serviço de navegação de terceiros, e defendendo que agente movido por pedido do usuário não deve ser tratado como robô malicioso.

O episódio não se resolve por opinião, e para quem publica ele vale como método: confie no endereço de origem, não no nome que a requisição declara. A página do PerplexityBot no acervo de robôs traz o token oficial, a doc lida e a data da conferência.

O que a página precisa ter para virar citação

Um motor que cita fonte precisa recortar uma afirmação e apontar para onde ela está. Página que dificulta o recorte perde a vaga para a que facilita.

Quatro características aparecem com constância nas páginas que viram fonte, e nenhuma delas é truque.

  • Resposta perto do topo. Um parágrafo que responde à pergunta antes da terceira rolagem é material recortável; introdução longa não é.
  • Afirmação com número e origem na mesma frase. Dado solto obriga o sistema a decidir se acredita. Dado com instituição e data resolve.
  • Estrutura de seção honesta. Título que descreve o conteúdo abaixo dele permite ao sistema achar o trecho certo sem ler a página inteira.
  • Conteúdo servido no HTML. Texto que só existe depois de o navegador executar script chega vazio para boa parte dos robôs.

A newsletter Citado pela IA está em preparação

Deixe seu email e receba o aviso quando o primeiro envio sair.

Entre antes do primeiro envio.

Você só recebe o aviso de lançamento. Cancele quando quiser.

Como a resposta é montada, em três etapas

Motor de resposta não improvisa a partir da memória do modelo quando cita fonte. Ele executa uma sequência, e saber a sequência mostra onde a sua página entra ou fica de fora.

A primeira etapa é a recuperação. A pergunta do usuário vira consulta, e o sistema busca no índice próprio um conjunto de páginas candidatas. Estar no índice é pré-requisito, e quem bloqueou o robô de busca não passa daqui.

A segunda é o recorte. Das páginas candidatas o sistema extrai trechos, não documentos inteiros. Um bloco que responde à pergunta em três frases tem vantagem estrutural sobre um texto que só chega à resposta no oitavo parágrafo.

A terceira é a atribuição. A resposta é montada e cada afirmação recebe o link da página que a sustenta. É a etapa que devolve visita, e é a única que o leitor vê.

O trecho vence o documento, e a consequência prática é editorial. Um artigo longo sobrevive bem se cada seção dele responde a uma pergunta inteira dentro dela mesma, sem depender do que ficou dez parágrafos acima.

As perguntas que a sua página deveria responder por escrito

Um exercício concreto, que leva menos de uma hora por página importante. Escreva as cinco perguntas que um leitor faria em voz alta sobre o seu assunto e confira se o texto responde a cada uma numa passagem localizável.

A checagem é dura porque a maior parte das páginas responde por implicação. O leitor humano completa o raciocínio sozinho; o sistema que recorta trecho não completa nada.

Onde faltar resposta explícita, entra uma seção nova com título que faz a pergunta e um parágrafo que a responde direto. Não é técnica de motor de busca, é redação: dizer o que se quer dizer, no lugar onde a pessoa procura.

Vale a mesma disciplina para o dado. Se a frase depende de um número, o número aparece com a instituição que o mediu e a data da medição, dentro da própria frase.

Quando a citação some

A queda de citação tem quatro causas frequentes, e três delas ficam do seu lado.

A primeira é bloqueio novo. Alguém instalou um serviço de proteção, uma regra pronta entrou junto e o robô passou a receber 403. Aparece no log em um dia.

A segunda é mudança de renderização. O site trocou de tema ou de framework, o texto passou a depender de script, e o conteúdo servido virou casca.

A terceira é envelhecimento. A página perdeu a data, o dado ficou velho e outra fonte passou a responder melhor à mesma pergunta.

A quarta está fora do seu alcance: o produto trocou de critério ou de parceiro de índice. Contra uma mudança de critério não há ajuste possível, e a conclusão prática é velha: a base de leitor por email vale mais que qualquer posição em sistema de terceiro, porque ela não depende da decisão de ninguém.

Diante da queda, a ordem de investigação segue o custo. Log primeiro, porque bloqueio aparece em minutos. Conteúdo servido depois, porque o teste é uma requisição sem script. Data e dado por último, porque a correção é editorial e leva tempo.

Medir a visita que chega de um motor de resposta

A citação não aparece em painel de webmaster nenhum. O que aparece é a visita de quem clicou nela, e ela chega ao seu analytics como origem de referência, com o domínio do produto no lugar do buscador.

Vale montar um relatório separado com as origens de produto de IA logo agora, mesmo com volume baixo. O relatório responde três perguntas ao longo do tempo: quais páginas suas são citadas, se o volume cresce e se a visita citada se comporta diferente da visita de busca.

Do lado do servidor, o log responde a outra metade: quantas vezes cada token de robô passou, em que páginas e com que código de resposta. Robô recebendo 403 em série é bloqueio de camada de proteção, e o efeito prático é sumir da fonte sem ninguém decidir.

O erro comum: fechar a porta sem querer

O erro mais frequente não é uma escolha, é um efeito colateral. Regra de firewall, serviço antifraude ou lista de bloqueio pronta barram robôs por padrão, e o site perde citação sem que ninguém tenha tomado a decisão.

O segundo erro é a regra genérica no robots.txt. Um bloco de negação para todos os agentes fecha junto o robô de busca do produto, que é o que traz visita, e não afeta em nada o buscador de pedido, que é o que costuma incomodar quem quer proteger conteúdo.

A conferência que resolve os dois cabe em dez minutos. Baixar o próprio robots.txt e ler quais tokens estão fechados, filtrar o log pelos tokens dos últimos trinta dias, e olhar o código de resposta que cada um recebeu.

Treino, busca e leitura ao vivo são decisões separadas

Fechar treino é decisão sobre propriedade do conteúdo. Fechar busca é decisão sobre distribuição. Fechar leitura ao vivo é decisão sobre acesso, e ela quase sempre exige tranca de verdade, não instrução.

A Cloudflare empurrou o assunto para o campo comercial em 1º de julho de 2025, quando passou a bloquear robôs de IA por padrão nos sites da rede dela e abriu o beta de um mercado de cobrança por rastreio, com a resposta HTTP 402 fazendo o papel de pedágio.

Para a maior parte dos sites que vivem de audiência, a conta continua simples: manter aberto o robô que cita com link e decidir treino com calma.

Perguntas frequentes

Quantos robôs a Perplexity tem?

A doc oficial documenta dois: PerplexityBot, que alimenta a busca do produto e respeita o robots.txt, e Perplexity-User, que abre páginas a pedido do usuário e, segundo a própria doc, geralmente ignora o robots.txt.

Bloquear o PerplexityBot protege meu conteúdo de treino?

A doc afirma que o PerplexityBot não é usado para recolher conteúdo destinado a treino de modelo fundacional. Bloquear o robô de busca, portanto, tira o site das respostas com link sem mexer na questão de treino.

Como sei se a visita veio mesmo da Perplexity?

Comparando o endereço de origem com as faixas publicadas pela empresa, uma lista por agente. O nome no cabeçalho de user agent é declaração, não prova, e foi exatamente o ponto da disputa pública de agosto de 2025 com a Cloudflare.

Existe alguma marcação que garanta a citação?

Não existe. Nenhuma empresa de motor de resposta publica requisito extra de marcação. O que aumenta a chance é página legível: resposta cedo, dado com fonte, seção honesta e conteúdo no HTML.

A visita vinda de um motor de resposta vale mais?

Ela costuma chegar com a pergunta já formada, o que tende a produzir sessão mais qualificada, e chega em volume menor que a busca tradicional. A conclusão só sai do seu próprio relatório, comparando as duas origens ao longo de alguns meses.

O que fazer se um robô estiver batendo demais no servidor?

Medir primeiro: filtrar o log por token, contar requisição por hora e ver quais páginas concentram o acesso. Depois decidir a resposta certa, que pode ser limitar taxa na borda, servir versão mais leve ou bloquear o token. O robots.txt não tem controle de velocidade padronizado, e o Google, por exemplo, declara que não suporta o campo crawl-delay.

Citado pela IA está chegando

Deixe seu email e receba o aviso quando o primeiro envio sair.

Entre antes do primeiro envio.

Você só recebe o aviso de lançamento. Cancele quando quiser.