Que sont les fichiers « llms.txt » ? Format, mise en œuvre et évaluation des résultats.
`llms.txt` est un format de fichier proposé par la communauté en 2024, utilisant une syntaxe Markdown concise pour permettre aux systèmes d'IA de comprendre rapidement la structure et le contenu important d'un site web. Nous avons mis en œuvre ce format sur ce site, mais il est important de préciser ceci : Google a indiqué qu'il ne l'utiliserait pas, et qu'il ne s'agit pas d'un moyen d'être inclus ou cité. Cet article vous explique comment l'utiliser, et vous donne également une idée de ce que vous pouvez en attendre.
·Quels sont les critères à prendre en compte pour décider de sa mise en œuvre ?
·Vérification après déploiement
D'où proviennent les fichiers « llms.txt » ? Quelle est leur fonction ?
Jeremy Howard d’Answer.AI a proposé llms.txt en 09/2024 pour une raison pratique : navigation, publicités et scripts encombrent les pages et compliquent leur traitement par des modèles de langage au contexte limité. Un résumé clair en Markdown peut présenter le site et ses pages essentielles. Son statut est déterminant : c’est une proposition communautaire, pas une norme officielle d’un moteur de recherche ou d’une plateforme IA. Cela doit guider l’effort à y consacrer.
Quelle est la structure attendue ?
La structure est volontairement simple : un fichier Markdown placé dans le répertoire racine du site web. La structure est la suivante : Un titre H1 pour le nom du site web.; Un bloc de citation (blockquote) contenant un résumé du site web.; Des titres H2 pour organiser les liens, avec une brève description pour chaque lien. Il existe également un fichier optionnel, "llms-full.txt", qui contient le contenu complet de la page, destiné aux systèmes capables de traiter de longs documents. Les deux fichiers sont au format texte brut et ne nécessitent aucune balise spéciale.
H1 : Nom du site web ou du projet (obligatoire)
Citation : Résumé d'un texte extrait d'un site web.
Section H2 : Liste des liens classés, avec une description pour chaque lien.
llms-full.txt (facultatif) : version complète du contenu
Fonctionnalité de ce site : génération dynamique, sans saisie manuelle.
Nous utilisons le Route Handler dans Next.js App Router pour fournir les fichiers `/llms.txt` et `/llms-full.txt`. Ces fichiers ne sont pas des fichiers statiques écrits manuellement, mais sont générés dynamiquement à partir d'une même source de données (fichiers TypeScript contenant des informations sur les services, les cas et les prix). Ils sont ensuite exportés en utilisant la fonctionnalité "force-static" lors de la construction. Cette approche résout le principal problème associé aux fichiers manuels : la désynchronisation du contenu. Si les prix ou les services sont modifiés, le fichier `llms.txt` est automatiquement mis à jour lors de la prochaine construction, évitant ainsi les situations où le contenu du site web et celui de `llms.txt` sont différents. Cela évite que le système d'IA ne produise des informations obsolètes, ce qui serait pire que de ne pas avoir ce fichier.
Une évaluation honnête des résultats : Google n'en a pas besoin.
C'est une partie que la plupart des formations ne vous apprennent pas. Les documents officiels de Google précisent clairement que les fonctionnalités d'IA ne nécessitent pas de compétences techniques supplémentaires, et que les membres de l'équipe de recherche ne l'utilisent pas non plus. De même, il n'y a pas d'engagement officiel concernant la lecture ou l'impact de llms.txt par d'autres plateformes d'IA. En examinant nos propres enregistrements de serveur, nous constatons que certains robots d'IA ont récupéré ces deux fichiers, mais "être récupéré" et "avoir un impact sur les citations" sont deux choses distinctes, et la seconde est impossible à vérifier. Par conséquent, notre conclusion est que llms.txt est une mesure complémentaire à faible coût, et non une tâche centrale de GEO — la tâche centrale réelle reste le contenu indexable et les preuves originales.
Quels sont les critères à prendre en compte pour décider si une mesure doit être mise en œuvre ou non ?
Raisons pour lesquelles cela vaut la peine : coût très faible (un seul fichier), pas de risques connus, et si la plateforme adopte officiellement votre solution à l'avenir. Raisons pour lesquelles cela ne vaut pas la peine : si quelqu'un vous demande de facturer des honoraires pour cela, ou de le présenter comme un "élément indispensable pour les plateformes d'IA" – ce qui contredit la position officielle de la plateforme, et peut être utilisé comme un indicateur de la crédibilité du fournisseur. Notre position auprès des clients est la même : c'est une bonne chose, mais elle doit être considérée après le SEO technique, les preuves de contenu et les mesures.
Comment vérifier que le déploiement a réussi ?
Trois points à vérifier : 1. Utiliser `curl` ou un navigateur pour accéder directement à `llms.txt` et vérifier que la réponse est 200 et que le contenu est à jour. 2. Vérifier que le contenu filtré et le sitemap sont cohérents : les pages marquées avec "noindex" ne doivent pas apparaître dans `llms.txt`. Cela revient à communiquer activement le contenu que vous ne souhaitez pas rendre public à l'IA. 3. Consulter régulièrement les logs du serveur pour enregistrer quelles sont les URL qui ont été réellement récupérées par les robots. C'est la seule source d'information pour déterminer si "quelqu'un lit" ou non.
Quelles sont les différences entre les fichiers « llms.txt » et « sitemap.xml » ?
`sitemap.xml` est un standard officiellement supporté par les moteurs de recherche, qui liste toutes les URL indexables pour faciliter leur découverte par les robots. `llms.txt` est une proposition de la communauté, qui décrit les points clés du site web sous forme de texte Markdown lisible par l'homme. Le premier a un usage officiel clairement défini, tandis que le second n'a pas encore de promesse d'utilisation de la part d'une plateforme – les deux ne se substituent pas mutuellement.
Est-il absolument nécessaire d'avoir le fichier « llms-full.txt » ?
Ce n'est pas toujours le cas. `llms-full.txt` est la version complète, conçue pour les sites web avec un volume de contenu contrôlé. Pour les sites web avec de nombreuses pages, l'affichage intégral peut entraîner un contenu trop volumineux et diluer les informations importantes. Notre approche consiste à utiliser `llms.txt` pour les listes structurées et `llms-full.txt` pour les paragraphes complets contenant des informations et des exemples.
L'existence de fichier nommé « llms.txt » a-t-elle un impact sur les références utilisées par l'IA ?
D'après les documents publics disponibles sur les différentes plateformes, ce n'est pas le cas. Google l'utilise explicitement, et aucune autre plateforme ne le considère comme une condition obligatoire. La décision de citer une source dépend toujours de la possibilité de la récupérer et de sa crédibilité. Il s'agit d'un avantage, mais pas d'une exigence.