Summer Compound Install · 1/3 slots · Book by July 27

llms.txt : à quoi ça sert vraiment (le guide honnête)

Le llms.txt est un fichier Markdown à la racine d'un site qui liste aux IA ses contenus importants. Attention à deux idées reçues : ce n'est pas un robots.txt pour l'IA (il ne bloque rien), et aucun grand fournisseur d'IA n'a confirmé l'utiliser. Google (John Mueller) dit qu'aucun système d'IA ne l'exploite, et les données montrent que ces fichiers sont quasi jamais consultés. Utile surtout pour la documentation technique. Ailleurs : à poser à faible coût, sans en attendre de gain de visibilité.

On vous vend le fichier llms.txt comme le nouveau levier pour être visible dans ChatGPT. La réalité est plus nuancée, et plus honnête. Ce guide explique ce qu'est vraiment llms.txt, pourquoi ce n'est pas ce qu'on en dit souvent, ce que les données montrent de son adoption réelle, et s'il vaut la peine d'en créer un.

Qu'est-ce que le fichier llms.txt ?

Le fichier llms.txt est un fichier Markdown placé à la racine d'un site (à l'adresse /llms.txt), qui propose aux IA un index clair des contenus les plus importants du site. Au lieu de laisser un modèle deviner quelles pages comptent en avalant tout le HTML, on lui fournit une carte : voici qui nous sommes, voici les pages qui font foi.

Il a été proposé en septembre 2024 par Jeremy Howard, cofondateur d'Answer.AI. Le problème d'origine était technique : la fenêtre de contexte d'un modèle est limitée, et transformer une page web (avec sa navigation, ses publicités, son JavaScript) en texte propre est laborieux. Le cas d'usage initial visait surtout la documentation technique pour les assistants de code.

llms.txt n'est pas un robots.txt pour l'IA

C'est la confusion la plus répandue, y compris dans des guides français, et elle est trompeuse. llms.txt ne contrôle rien. Il ne contient aucune directive, ne bloque aucun robot, n'autorise ni n'interdit l'accès à votre contenu. C'est une aide à la lecture, pas un gardien.

Pour contrôler l'accès des robots d'IA, l'outil reste le robots.txt, que tous les crawlers d'IA majeurs respectent (GPTBot pour OpenAI, ClaudeBot pour Anthropic, Google-Extended, PerplexityBot). Les deux fichiers agissent à des niveaux différents. Pour situer les trois fichiers de la racine d'un site : robots.txt dit qui peut crawler, sitemap.xml dit quelles URL existent, et llms.txt dit quel contenu compte.

À retenir : robots.txt gère l'accès, llms.txt gère la compréhension. Aucun des deux ne remplace l'autre, et surtout, aucun fournisseur d'IA n'a dit d'utiliser llms.txt à la place de robots.txt pour bloquer un crawler.

À quoi ressemble un fichier llms.txt

C'est un simple fichier texte au format Markdown. Sa structure est légère : un titre, un résumé, puis des sections qui listent des liens vers vos contenus importants, chacun avec une courte description.

Dans les grandes lignes :

  • un titre (H1) avec le nom du site ou de la marque,
  • un court paragraphe de résumé, souvent en citation, qui explique ce que fait le site,
  • des sections (H2) regroupant des liens : documentation, pages clés, ressources, avec une phrase de contexte par lien.

Concrètement, quelques lignes suffisent. Voici à quoi correspondent les parties d'un fichier :

Une variante existe, le llms-full.txt, qui ne se contente pas de lister des liens mais rassemble tout le contenu du site en un seul document Markdown, prêt à être ingéré. La proposition d'origine suggère aussi de servir une version Markdown de chaque page, à la même adresse avec un suffixe .md.

Est-ce que ça marche ? l'état honnête en 2026

C'est la question qui fâche, et la réponse mérite d'être franche : aucun grand fournisseur d'IA n'a confirmé utiliser llms.txt dans ses systèmes de production. Ni OpenAI, ni Google, ni Anthropic, ni Meta. Anthropic en publie un, mais ne dit nulle part que ses robots le lisent.

Du côté de Google, la position est nette. Son porte-parole John Mueller a écrit qu'aucun système d'IA n'utilise llms.txt aujourd'hui, et l'a comparé à l'ancienne balise meta keywords, abandonnée depuis longtemps. Le guide officiel de Google sur l'IA générative précise même, dans une section anti-idées-reçues, qu'aucun fichier de ce type n'est nécessaire pour apparaître dans ses réponses IA.

Les données confirment ce tableau. Une étude d'Ahrefs a montré que 97 pour cent des fichiers llms.txt d'un large échantillon n'avaient reçu aucune requête sur un mois. Une expérience d'OtterlyAI sur 90 jours a compté 84 requêtes vers le fichier sur plus de 62 000 visites de robots d'IA, soit 0,1 pour cent.

Soyons complets, car il y a une nuance en sens inverse. Des acteurs comme Profound ont observé que les robots d'OpenAI et de Microsoft vont chercher le fichier, en particulier le llms-full.txt, et Google a intégré llms.txt dans son protocole de communication entre agents (A2A). Il y a donc un usage, côté agents et outils de développement, mais pas de valeur prouvée pour la visibilité ou le classement.

Faut-il créer un fichier llms.txt ?

La réponse dépend de votre site, mais elle tient en une phrase : c'est une brique d'infrastructure à faible coût, pas une stratégie de visibilité.

  • Documentation technique ou SaaS : oui, c'est le cas d'usage d'origine. Les assistants de code (Cursor, Claude, Copilot) profitent d'un index propre de votre documentation.
  • Site vitrine ou e-commerce : un llms.txt ne fera pas de mal, se pose en moins de trente minutes, et n'entraîne aucune pénalité. Mais n'en attendez pas de gain de classement ni de citations en plus.
  • Petite entreprise locale : à mettre en bas de liste. Votre fiche Google Business, vos avis et un bon contenu comptent bien davantage.

Le vrai levier de visibilité dans les IA n'est pas ce fichier. Ce sont un contenu clair et bien indexé, une réputation de marque citée ailleurs, et des bases techniques solides.

Pour le fond du sujet, voyez notre pilier sur le référencement IA (GEO), et le rôle des données structurées, bien plus établies que llms.txt pour aider les machines à comprendre un site.

Comment créer un fichier llms.txt

Si vous voulez en poser un, la démarche est simple et rapide.

  1. Rédiger le fichier en Markdown : un titre, un résumé, puis des sections listant vos pages clés avec une courte description chacune.
  2. Le placer à la racine du site, accessible à l'adresse votre-domaine.fr/llms.txt.
  3. Le garder à jour : un index qui pointe vers des pages disparues ou périmées dessert plus qu'il ne sert.
  4. Éviter son indexation si besoin (en-tête X-Robots-Tag : noindex), pour que le fichier lui-même ne remonte pas dans les résultats de recherche.

Des générateurs existent (Firecrawl, entre autres) et des extensions comme Yoast ou Rank Math le produisent automatiquement sur WordPress. Deux points de vigilance : ce fichier décrit publiquement la structure de votre site, donc n'y exposez pas de contenu sensible ; et un fichier généré automatiquement peut devenir une cible d'injection pour des agents, à surveiller.

Vérifiez-le vous-même dans vos logs

Vous n'êtes pas obligé de nous croire sur parole. La meilleure preuve, c'est votre propre serveur. Filtrez vos journaux (logs), ou un outil d'analyse de robots, sur les requêtes vers /llms.txt, et regardez qui vient : un robot d'IA nommé (GPTBot, ClaudeBot), un outil d'audit, ou personne.

Dans la grande majorité des cas, vous verrez très peu de trafic, souvent seulement des scanners qui étudient le fichier plutôt que des IA qui l'exploitent. C'est le moyen le plus honnête de juger, sur vos propres données, si l'effort en vaut la peine pour votre site.

llms.txt : à poser sans en attendre des miracles

Le fichier llms.txt est une idée intéressante, honnête dans son intention : rendre un site plus lisible par les machines. Pour de la documentation technique, il a une vraie utilité. Pour le reste, c'est une brique de préparation à l'avenir, à faible coût, sans garantie. Se méfier des promesses de visibilité miraculeuse est ici le meilleur réflexe : personne ne peut garantir ce que les grandes IA feront demain d'un fichier qu'elles ignorent aujourd'hui.

Chez Krylli, nous le posons quand il a du sens, dans le cadre plus large d'un site prêt pour les agents IA, sans le survendre. La visibilité IA se gagne d'abord sur le contenu et les bases techniques. Envie d'un site pensé pour être compris par les moteurs comme par les IA ? Réservez un appel avec le fondateur.

Questions

Le fichier llms.txt, c'est quoi ?

C'est un fichier Markdown placé à la racine d'un site (/llms.txt) qui propose aux IA un index des contenus importants du site, avec des liens et de courtes descriptions. Proposé en 2024 par Jeremy Howard (Answer.AI), c'est une aide à la lecture, pas un standard officiel.

llms.txt est-il un robots.txt pour l'IA ?

Non, c'est une confusion fréquente. llms.txt ne contient aucune directive et ne bloque aucun robot : il ne fait que guider l'IA vers vos contenus clés. Pour contrôler l'accès des robots d'IA, c'est le robots.txt (avec GPTBot, ClaudeBot, Google-Extended) qu'il faut utiliser.

Est-ce que les IA utilisent vraiment llms.txt ?

Aucun grand fournisseur (OpenAI, Google, Anthropic, Meta) n'a confirmé l'utiliser en production. John Mueller, chez Google, a dit qu'aucun système d'IA ne l'exploite. Des études montrent que la quasi-totalité de ces fichiers ne reçoivent aucune requête. Quelques robots vont chercher le llms-full.txt, sans valeur prouvée pour la visibilité.

Faut-il créer un fichier llms.txt pour son site ?

Pour de la documentation technique, oui : c'est son cas d'usage d'origine. Pour un site vitrine ou e-commerce, il se pose vite et sans risque, mais n'en attendez pas de gain de classement. Le vrai levier de visibilité IA reste un bon contenu et des bases SEO solides.

Quelle différence entre llms.txt et llms-full.txt ?

Le llms.txt liste des liens vers vos contenus importants. Le llms-full.txt va plus loin : il rassemble tout le contenu du site en un seul document Markdown, prêt à être ingéré. Certains robots d'IA vont chercher davantage ce second fichier.

Créer un llms.txt améliore-t-il le référencement Google ?

Non. John Mueller a confirmé qu'aucun système de recherche Google ne lit ni n'exploite llms.txt. Il n'a aucun effet sur le classement. Son intérêt éventuel se situe du côté des outils d'IA et des agents, pas du référencement classique.