Se os assistentes de IA não conseguem ler o seu site, eles não podem recomendar a sua empresa. Essa única frase explica por que o seu robots.txt — um arquivo de texto simples que a maioria dos donos de negócio nunca abriu — decide silenciosamente parte da sua visibilidade em IA. Muitos sites bloqueiam rastreadores de IA sem saber: uma configuração padrão do CDN, o botão «bloquear bots de IA» de um plugin ou uma regra de robots.txt copiada de um blog em 2023 podem torná-lo invisível justamente para os sistemas aos quais seus clientes hoje pedem recomendações.

Esta é uma lista de referência dos rastreadores de IA que importam em 2026: quem opera cada um, o que ele realmente faz com o seu conteúdo e quais uma empresa que busca visibilidade em IA deveria permitir. Cada user agent abaixo é documentado pelo operador; onde o operador não publica documentação, dizemos isso.

Primeiro: os três tipos de bot de IA

«Rastreador de IA» abrange três comportamentos bem diferentes, e a política correta varia por tipo:

  • Rastreadores de treinamento coletam conteúdo para treinar modelos futuros. Bloqueá-los limita o que os modelos de amanhã saberão sobre você; o efeito é lento e difuso.
  • Rastreadores de índice de busca constroem os índices de recuperação que os produtos de busca com IA citam ao vivo. Bloqueá-los remove você das respostas de IA ancoradas na web — um golpe rápido e direto na visibilidade.
  • Buscadores por solicitação do usuário visitam uma página porque um humano acabou de perguntar ao assistente sobre ela. Bloqueá-los significa que o assistente não consegue verificar o que você afirma — inclusive quando um cliente em potencial pergunta «essa empresa é confiável?»

Para uma empresa que quer clientes, as duas últimas categorias são quase inegociáveis. A primeira é uma escolha legítima de política.

OpenAI (ChatGPT)

A OpenAI documenta três bots (documentação oficial):

  • GPTBot — o rastreador de treinamento. Permiti-lo deixa seu conteúdo informar os futuros modelos GPT.
  • OAI-SearchBot — constrói o índice por trás da busca na web do ChatGPT. Bloqueá-lo pode deixá-lo de fora das respostas do ChatGPT que citam fontes. Se o objetivo é visibilidade em IA, permita.
  • ChatGPT-User — busca páginas quando a solicitação de um usuário exige visitar o seu site. Permita: do outro lado costuma haver um cliente em potencial real, a uma pergunta de entrar em contato.

Anthropic (Claude)

A Anthropic também documenta seus rastreadores e confirma que respeitam o robots.txt (documentação oficial):

  • ClaudeBot — o rastreador de treinamento.
  • Claude-User — busca páginas em resposta à solicitação ao vivo de um usuário.
  • Claude-SearchBot — indexa conteúdo para melhorar os resultados de busca do Claude.

Vale a mesma lógica da OpenAI: os bots de usuário e de busca determinam diretamente se o Claude pode ler e citar você hoje.

Perplexity

O Perplexity é um mecanismo de busca com IA, então seus rastreadores giram em torno de respostas ao vivo (documentação oficial):

  • PerplexityBot — constrói o índice de busca do Perplexity.
  • Perplexity-User — visita uma página quando a pergunta de um usuário exige.

Bloqueá-los remove você de uma das superfícies de IA mais ricas em citações que existem — as respostas do Perplexity exibem suas fontes com destaque, exatamente o tipo de exposição que uma empresa quer.

Google (Gemini e recursos de IA)

Google-Extended não é um rastreador separado — é um token de robots.txt que controla se o conteúdo que o Googlebot já rastreou pode ser usado para treinar os modelos Gemini (documentação oficial). Dois detalhes importam:

  • Bloquear o Google-Extended não afeta seu ranqueamento no Google nem sua presença nos AI Overviews — isso é regido pelas regras normais do Googlebot.
  • Permiti-lo não custa tráfego adicional de rastreamento, pois ele pega carona no rastreamento existente do Googlebot.

O resto da lista

  • CCBot (Common Crawl) — rastreador de uma organização sem fins lucrativos que constrói um arquivo aberto da web (documentação oficial). Não é uma empresa de IA, mas os dados do Common Crawl historicamente foram fonte importante de treinamento de muitos modelos — bloquear o CCBot reduz sua presença nos conjuntos de dados com que muitos laboratórios começam.
  • Meta-ExternalAgent (Meta) — o rastreador da Meta para treinamento de IA e melhoria de produtos (documentação oficial), relevante para a Meta AI dentro do WhatsApp, Instagram e Facebook.
  • Bytespider (ByteDance) — o rastreador da ByteDance, associado ao treinamento de seus modelos. A ByteDance não publica página de documentação oficial para ele, e ele tem fama de rastrear agressivamente; se respeita robots.txt é algo que o operador não confirma publicamente. Listamos por completude, não como endosso.

Outros agentes que você pode ver nos logs — Applebot-Extended (o token de exclusão de treinamento de IA da Apple), Amazonbot, DuckAssistBot e vários rastreadores de startups — seguem a mesma lógica de três vias: consulte a documentação do operador, identifique se é treinamento, busca ou solicitação de usuário, e decida de acordo.

Uma política padrão sensata

Para uma empresa cujo objetivo é ser encontrada e recomendada: permita todos os bots de índice de busca e de solicitação de usuário, e permita os bots de treinamento dos grandes assistentes que seus clientes usam:

  • Permitir: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-User, Claude-SearchBot, PerplexityBot, Perplexity-User, Google-Extended.
  • A seu critério: CCBot e Meta-ExternalAgent (voltados a treinamento; permiti-los é um bom padrão para visibilidade, bloqueá-los é uma escolha defensável de direitos de conteúdo).
  • A seu critério: Bytespider (sem documentação; bloqueie se o tráfego dele incomodar — para a maioria das pequenas empresas ocidentais, seu benefício de visibilidade é pequeno).

Como as regras de robots.txt permitem por padrão, o conserto mais comum não é adicionar linhas Allow — é remover um Disallow: / amplo demais que um plugin de segurança ou preset de CDN adicionou para esses user agents. Se ainda assim quiser regras explícitas, este é o padrão mínimo:

User-agent: GPTBot
Allow: /

…repetido por bot. Um aviso baseado em sites que escaneamos: alguns firewalls bloqueiam rastreadores de IA na camada de rede mesmo quando o robots.txt os permite — um robots.txt limpo não garante acesso. Teste o comportamento real, não apenas o arquivo.

Verifique seu site em 30 segundos

Você pode auditar seu robots.txt contra toda esta lista com nosso verificador de rastreadores de IA gratuito — digite seu domínio e ele mostra, bot a bot, quem está permitido, quem está bloqueado e por qual regra.

Se você prefere o terminal (ou quer isso no CI para que um deploy nunca mais bloqueie a IA silenciosamente), a mesma checagem vem na nossa CLI de código aberto (GitHub): npx rankedbyai crawlers seusite.com sai com código diferente de zero quando qualquer um dos 11 grandes rastreadores de IA está bloqueado. E para ver o que os assistentes de IA realmente dizem sobre a sua empresa depois que conseguem ler você, rode um escaneamento gratuito de visibilidade em IA.

FAQ

Devo bloquear rastreadores de IA em algum caso?

Depende do que seu conteúdo vale para você. Editoras cujo produto é o próprio conteúdo costumam bloquear rastreadores de treinamento para proteger valor de licenciamento. Uma empresa local é o caso oposto: seu conteúdo existe para ser encontrado, e bloquear os sistemas aos quais os clientes pedem recomendações prejudica principalmente você. Para um meio-termo, permita os bots de busca e de solicitação de usuário e bloqueie os de treinamento — as categorias acima tornam essa divisão fácil.

Permitir rastreadores de IA prejudica meu ranqueamento no Google?

Não. As regras para rastreadores de IA no robots.txt valem por user agent e não afetam o Googlebot. O Google-Extended, em particular, é documentado explicitamente como sem efeito no ranqueamento de busca — ele controla apenas o treinamento dos modelos Gemini.

Como sei se meu site está bloqueando rastreadores de IA agora?

Verifique no robots.txt regras Disallow direcionadas aos user agents acima (incluindo um genérico User-agent: * / Disallow: /) e confirme com o verificador de rastreadores. Cheque também as configurações do CDN ou de segurança — a Cloudflare, por exemplo, oferece um bloqueio de bots de IA de um clique que funciona independentemente do robots.txt.

Todos esses bots realmente respeitam o robots.txt?

OpenAI, Anthropic, Perplexity, Google, Common Crawl e Meta documentam que seus rastreadores listados respeitam o robots.txt. A conformidade do Bytespider não é documentada oficialmente, e administradores de sites relatam comportamento inconsistente — se bloqueá-lo é importante para você, considere uma regra de firewall em vez de confiar só no robots.txt.