Si les assistants IA ne peuvent pas lire votre site web, ils ne peuvent pas recommander votre entreprise. Cette seule phrase explique pourquoi votre fichier robots.txt — un fichier texte que la plupart des dirigeants n'ont jamais ouvert — décide en silence d'une partie de votre visibilité IA. Beaucoup de sites bloquent des robots IA sans le savoir : un réglage par défaut du CDN, l'interrupteur « bloquer les bots IA » d'un plugin ou une règle robots.txt copiée d'un article de blog en 2023 peuvent vous rendre invisible aux systèmes auxquels vos clients demandent désormais des recommandations.

Voici la liste de référence des robots IA qui comptent en 2026 : qui exploite chacun d'eux, ce qu'il fait réellement de votre contenu, et lesquels une entreprise en quête de visibilité IA devrait autoriser. Chaque user agent ci-dessous est documenté par son exploitant ; quand un exploitant ne publie aucune documentation, nous le disons.

D'abord, comprendre les trois types de bots IA

« Robot IA » recouvre trois comportements très différents, et la bonne politique varie selon le type :

  • Les robots d'entraînement collectent du contenu pour entraîner les futurs modèles. Les bloquer limite ce que les modèles de demain sauront de vous ; l'effet est lent et diffus.
  • Les robots d'indexation de recherche construisent les index de récupération que les produits de recherche IA citent en direct. Les bloquer vous retire des réponses IA ancrées sur le web — un coup rapide et direct porté à la visibilité.
  • Les récupérateurs à la demande visitent une page parce qu'un humain vient d'interroger l'assistant à son sujet. Les bloquer signifie que l'assistant ne peut pas vérifier ce que vous affirmez — y compris quand un client potentiel demande « cette entreprise est-elle sérieuse ? »

Pour une entreprise qui veut des clients, les deux dernières catégories sont presque non négociables. La première relève d'un véritable choix de politique.

OpenAI (ChatGPT)

OpenAI documente trois bots (documentation officielle) :

  • GPTBot — le robot d'entraînement. L'autoriser permet à votre contenu de nourrir les futurs modèles GPT.
  • OAI-SearchBot — construit l'index de recherche derrière la recherche web de ChatGPT. Le bloquer peut vous exclure des réponses de ChatGPT qui citent des sources. Si la visibilité IA est l'objectif, autorisez-le.
  • ChatGPT-User — récupère des pages quand la requête d'un utilisateur nécessite de visiter votre site. Autorisez-le : de l'autre côté se trouve souvent un vrai prospect, à une question de vous contacter.

Anthropic (Claude)

Anthropic documente également ses robots et confirme qu'ils respectent robots.txt (documentation officielle) :

  • ClaudeBot — le robot d'entraînement.
  • Claude-User — récupère des pages en réponse à la requête en direct d'un utilisateur.
  • Claude-SearchBot — indexe le contenu pour améliorer les résultats de recherche de Claude.

La même logique que pour OpenAI s'applique : les bots utilisateur et recherche déterminent directement si Claude peut vous lire et vous citer aujourd'hui.

Perplexity

Perplexity est un moteur de recherche IA : ses robots sont entièrement tournés vers les réponses en direct (documentation officielle) :

  • PerplexityBot — construit l'index de recherche de Perplexity.
  • Perplexity-User — visite une page quand la question d'un utilisateur l'exige.

Les bloquer vous retire de l'une des surfaces IA les plus riches en citations — les réponses de Perplexity affichent leurs sources en évidence, exactement le type d'exposition qu'une entreprise recherche.

Google (Gemini et fonctions IA)

Google-Extended n'est pas un robot distinct — c'est un jeton robots.txt qui contrôle si le contenu déjà exploré par Googlebot peut servir à entraîner les modèles Gemini (documentation officielle). Deux détails importent :

  • Bloquer Google-Extended n'affecte ni votre classement dans Google ni votre présence dans les AI Overviews — cela relève des règles normales de Googlebot.
  • L'autoriser ne coûte aucun trafic d'exploration supplémentaire, puisqu'il s'appuie sur l'exploration existante de Googlebot.

Le reste de la liste

  • CCBot (Common Crawl) — le robot d'une organisation à but non lucratif qui constitue une archive ouverte du web (documentation officielle). Ce n'est pas une entreprise d'IA, mais les données de Common Crawl ont historiquement été une source d'entraînement majeure pour de nombreux modèles — bloquer CCBot réduit votre présence dans les jeux de données dont partent beaucoup de laboratoires.
  • Meta-ExternalAgent (Meta) — le robot de Meta pour l'entraînement de l'IA et l'amélioration des produits (documentation officielle), pertinent pour Meta AI dans WhatsApp, Instagram et Facebook.
  • Bytespider (ByteDance) — le robot de ByteDance, associé à l'entraînement de ses modèles. ByteDance ne publie aucune page de documentation officielle à son sujet, et il a la réputation d'explorer agressivement ; quant à savoir s'il respecte robots.txt, l'exploitant ne le confirme pas publiquement. Nous le listons par souci d'exhaustivité, pas comme une caution.

Les autres agents que vous pouvez voir dans vos logs — Applebot-Extended (le jeton d'exclusion d'Apple pour l'entraînement IA), Amazonbot, DuckAssistBot et divers robots de startups — suivent la même logique à trois voies : consultez la documentation de l'exploitant, identifiez s'il s'agit d'entraînement, de recherche ou de requête utilisateur, et décidez en conséquence.

Une politique par défaut raisonnable

Pour une entreprise dont l'objectif est d'être trouvée et recommandée : autorisez tous les bots d'indexation de recherche et de requête utilisateur, et autorisez les bots d'entraînement des grands assistants qu'utilisent vos clients :

  • Autoriser : GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-User, Claude-SearchBot, PerplexityBot, Perplexity-User, Google-Extended.
  • À votre appréciation : CCBot et Meta-ExternalAgent (orientés entraînement ; les autoriser est un bon réglage par défaut pour la visibilité, les bloquer est un choix défendable de droits sur le contenu).
  • À votre appréciation : Bytespider (non documenté ; bloquez-le si son trafic vous gêne — pour la plupart des petites entreprises occidentales, son bénéfice de visibilité est mince).

Comme les règles robots.txt autorisent par défaut, le correctif le plus courant n'est pas d'ajouter des lignes Allow — c'est de supprimer un Disallow: / trop large qu'un plugin de sécurité ou un préréglage CDN a ajouté pour ces user agents. Si vous tenez à des règles explicites, voici le motif minimal :

User-agent: GPTBot
Allow: /

…répété par bot. Un avertissement tiré des sites que nous avons scannés : certains pare-feux bloquent les robots IA au niveau réseau même quand robots.txt les autorise — un robots.txt propre ne garantit donc pas l'accès. Testez le comportement réel, pas seulement le fichier.

Vérifiez votre site en 30 secondes

Vous pouvez auditer votre robots.txt contre toute cette liste avec notre vérificateur de robots IA gratuit — saisissez votre domaine et il affiche, bot par bot, qui est autorisé, qui est bloqué, et par quelle règle.

Si vous préférez le terminal (ou voulez intégrer ce contrôle en CI pour qu'un déploiement ne bloque plus jamais l'IA en silence), le même contrôle est fourni dans notre CLI open source (GitHub) : npx rankedbyai crawlers votresite.com se termine avec un code d'erreur dès que l'un des 11 grands robots IA est bloqué. Et pour savoir ce que les assistants IA disent réellement de votre entreprise une fois qu'ils peuvent vous lire, lancez un scan gratuit de visibilité IA.

FAQ

Devrais-je parfois bloquer les robots IA ?

Cela dépend de la valeur de votre contenu pour vous. Les éditeurs dont le produit est le contenu lui-même bloquent souvent les robots d'entraînement pour protéger leur valeur de licence. Une entreprise locale est le cas inverse : votre contenu existe pour être trouvé, et bloquer les systèmes auxquels les clients demandent des recommandations vous nuit surtout à vous. Pour une voie médiane, autorisez les bots de recherche et de requête utilisateur et bloquez les bots d'entraînement — les catégories ci-dessus rendent cette séparation facile.

Autoriser les robots IA nuit-il à mon classement Google ?

Non. Les règles pour robots IA dans robots.txt s'appliquent par user agent et n'affectent pas Googlebot. Google-Extended, en particulier, est explicitement documenté comme sans effet sur le classement dans la recherche — il ne contrôle que l'entraînement des modèles Gemini.

Comment savoir si des robots IA sont bloqués en ce moment ?

Cherchez dans votre robots.txt des règles Disallow visant les user agents ci-dessus (y compris un User-agent: * / Disallow: / général), puis vérifiez avec le vérificateur de robots. Contrôlez aussi vos réglages CDN ou de sécurité — Cloudflare, par exemple, propose un blocage des bots IA en un clic qui fonctionne indépendamment de robots.txt.

Tous ces bots respectent-ils vraiment robots.txt ?

OpenAI, Anthropic, Perplexity, Google, Common Crawl et Meta documentent tous que leurs robots listés respectent robots.txt. La conformité de Bytespider n'est pas documentée officiellement, et des administrateurs de sites indépendants signalent un comportement irrégulier — si son blocage compte pour vous, envisagez une règle de pare-feu plutôt que de vous fier au seul robots.txt.