Ce qu'est vraiment llms.txt
llms.txt est un fichier texte brut (Markdown) servi à /llms.txt qui donne aux systèmes d'IA un résumé organisé de votre site : ce qu'il est, et quelles pages comptent le plus, avec de courtes descriptions. La convention a été proposée par Jeremy Howard (Answer.AI) en septembre 2024 comme pendant de robots.txt — robots.txt dit aux robots ce qu'ils peuvent lire, llms.txt dit aux modèles de langage ce qu'ils devraient lire et comment le comprendre.
Le format est volontairement simple : un H1 avec le nom de votre site ou produit, un résumé d'un paragraphe en blockquote, puis des sections de liens avec des descriptions d'une ligne. Comme c'est du Markdown court et propre à une URL prévisible, un système d'IA (ou un agent naviguant pour le compte d'un utilisateur) peut l'ingérer en une seule requête au lieu de crawler des dizaines de pages HTML pleines de navigation et de bannières de cookies.
État honnête en 2026 : prometteur, pas garanti
Méfiez-vous de quiconque vend llms.txt comme un levier de classement magique. Les grandes entreprises d'IA ne se sont pas formellement engagées à le consommer comme les moteurs de recherche se sont engagés sur les sitemaps, et les preuves publiques d'impact direct sur les classements sont minces. Ce qui est vrai : l'adoption s'est répandue chez les entreprises d'outils de développement et de SaaS, le fichier est récupéré par un ensemble croissant d'agents et d'outils de dev IA, et son entretien ne coûte presque rien.
Le cadre raisonnable est celui d'un pari asymétrique : cinq minutes de travail, zéro inconvénient, un gain plausible à mesure que la navigation agentique se développe. C'est aussi un artefact réellement utile — un résumé canonique et auto-audité de vos pages les plus importantes. Beaucoup d'équipes découvrent en l'écrivant que leurs propres « pages qui rapportent » sont difficiles à décrire, un problème de contenu bon à connaître.
Écrire un bon llms.txt
Commencez par la clarté, pas le marketing. Le résumé en blockquote doit dire ce que vous faites, pour qui, dans un langage déclaratif simple — le même registre que pour expliquer votre activité à un inconnu compétent. Chaque lien devrait répondre à une question dont une IA pourrait avoir besoin : combien coûte ce produit (page tarifs), comment ça marche (docs ou méthodologie), où est la preuve (études de cas), qu'est-ce qui a changé récemment (changelog).
Restez sous quelques centaines de lignes et mettez à jour quand la structure de votre site change. Ne listez pas chaque article de blog ; listez les pages que vous voudriez voir citées. Si vous maintenez à la fois llms.txt et un llms-full.txt plus complet, le fichier court doit rester réellement court. Et assurez-vous que les pages liées sont elles-mêmes crawlables — un llms.txt pointant vers des pages bloquées aux bots se sabote lui-même (vérifiez avec notre AI Crawler Checker).
Au-delà du fichier : être lisible par les machines
llms.txt est une pièce d'une discipline plus large parfois appelée GEO (generative engine optimization) : structurer votre site pour que les machines puissent le comprendre et le citer avec confiance. Le reste de la checklist : HTML rendu côté serveur pour les pages clés, données structurées JSON-LD (Organization, Product, FAQPage), nom/adresse/téléphone cohérents sur tout le web, citations tierces réelles (annuaires, avis, presse), et un contenu qui répond directement aux questions que les acheteurs posent aux assistants.
La mesure boucle la boucle. Après avoir publié llms.txt et vos correctifs de contenu, la question est de savoir si les réponses de l'IA changent vraiment. C'est ce que donne le scan gratuit de Geovory : une base de référence de la fréquence à laquelle l'IA vous recommande aujourd'hui, et un suivi hebdomadaire pour voir si vos changements la font bouger.