Por que o acesso dos rastreadores de IA importa
Quando um assistente de IA responde a uma pergunta de compra — «melhor dentista de família em Denver», «melhor ferramenta de faturamento para freelancers» — ele usa dois tipos de conhecimento: o que o modelo aprendeu no treinamento e o que um sistema de recuperação acabou de buscar na web ao vivo. Os dois caminhos começam com rastreadores. Se os bots que coletam dados de treinamento e os que buscam páginas para recuperação não conseguem ler seu site, você está entregando toda a resposta da IA a concorrentes cujos sites eles conseguem ler.
O frustrante é que a maioria dos bloqueios a rastreadores de IA é acidental. Em 2023–2024, muitos sites (ou seus CDNs e plugins de segurança) adicionaram regras genéricas bloqueando bots como o GPTBot por precaução. Essas regras continuam hoje nos robots.txt, excluindo silenciosamente negócios das respostas de IA enquanto seus donos se perguntam por que nunca são recomendados. Uma verificação de um minuto pega essa classe de problema antes de você gastar um centavo em conteúdo.
Os rastreadores que importam em 2026
A OpenAI opera o GPTBot (coleta de dados de treinamento), o OAI-SearchBot (índice de busca para a navegação do ChatGPT) e o ChatGPT-User (buscas em tempo real quando o chat de um usuário aciona a visita a uma página). A Anthropic opera o ClaudeBot e o anthropic-ai. A Perplexity usa o PerplexityBot. O rastreamento do Google para recursos de IA está ligado ao Googlebot e ao Google-Extended — bloquear o Google-Extended tira seu conteúdo do treinamento do Gemini mantendo a busca normal. Outros que valem conhecer: Amazonbot, Applebot-Extended, Bytespider (ByteDance), CCBot (Common Crawl, com cujo corpus muitos modelos treinam) e Meta-ExternalAgent.
Cada um responde às diretivas padrão do robots.txt sob seu próprio token de user-agent. Este verificador solicita seu robots.txt e avalia as regras allow/disallow para cada um desses tokens exatamente como os próprios rastreadores fazem, incluindo bloqueios de user-agent com curinga que pegam bots de IA como dano colateral.
Como ler seus resultados
«Permitido» significa que o rastreador pode buscar suas páginas; não garante que ele o fará, nem que seu conteúdo aparecerá em algum sistema de IA — apenas remove um bloqueio rígido. «Bloqueado» significa que o rastreador é excluído por uma regra disallow correspondente. Preste atenção especial quando tudo está bloqueado por um «User-agent: *» genérico: isso geralmente indica uma configuração de staging ou um preset de segurança exagerado, não uma política deliberada.
Uma política mista deliberada é perfeitamente legítima. Alguns publishers permitem bots de recuperação (que podem citá-los e linká-los) enquanto bloqueiam bots de treinamento. Para um negócio que quer ser recomendado pela IA, porém, o padrão pragmático em 2026 é permitir os principais rastreadores de IA: a vantagem é a inclusão nas respostas; a desvantagem para um site de negócios típico é insignificante.
Corrigindo um bloqueio
O robots.txt fica na raiz do seu domínio e é texto simples. Para desbloquear um rastreador específico, remova sua regra disallow ou adicione uma seção allow explícita, por exemplo: «User-agent: GPTBot» seguido de «Allow: /». Se seu arquivo tem um «User-agent: *» genérico com «Disallow: /», restrinja-o aos caminhos que realmente precisam ficar privados. Lembre-se de que a proteção anti-bots no nível do CDN (Cloudflare, Akamai) e plugins de segurança podem bloquear rastreadores mesmo quando o robots.txt os permite — se este verificador diz que você está aberto mas os sistemas de IA ainda não conseguem resumir seu site, olhe em seguida as configurações do seu WAF.
Depois de corrigir, rode a verificação de novo para confirmar e dê tempo aos sistemas: bots de recuperação captam mudanças em dias, enquanto corpora de treinamento se atualizam em ciclos bem mais longos. Acesso de rastreadores é o passo zero da visibilidade em IA — quando estiver verde, a pergunta passa a ser se a IA realmente recomenda você, que é o que nosso escaneamento gratuito mede.