Académie · Audit

Comment vérifier la couverture Robots.txt et Sitemap dans AmICited

Utilisez la vérification Robots.txt et Sitemaps dans l'audit Accessibilité des Agents d'AmICited pour confirmer que les robots d'IA et de recherche peuvent lire votre site et que vos sitemaps sont déclarés et complets.

8 min read · Medium priority

Comment vérifier la couverture Robots.txt et Sitemap dans AmICited — video walkthrough

Si les robots d’IA ne peuvent pas lire votre site, aucune de vos autres optimisations n’a d’importance.

Qu’est-ce que le robots.txt, et pourquoi détermine-t-il si l’IA peut vous voir ?

Le robots.txt est un fichier texte brut situé à la racine de votre domaine (votresite.com/robots.txt) qui indique aux robots quelles parties de votre site ils sont autorisés à consulter. Il précède le boom de l’IA de plusieurs décennies : il a été conçu à l’origine pour que des robots de moteurs de recherche comme Googlebot ne perdent pas de temps à explorer des pages d’administration, des environnements de préproduction ou du contenu dupliqué. Mais ce même mécanisme régit aujourd’hui une décision bien plus lourde de conséquences : celle de savoir si GPTBot, ClaudeBot, PerplexityBot, Google-Extended et les autres robots d’IA qui alimentent les moteurs de réponse actuels sont autorisés à récupérer vos pages, tout simplement.

Tout robot bien élevé consulte le robots.txt avant de faire quoi que ce soit d’autre. Le fichier est organisé en blocs, chacun commençant par une ligne User-agent qui nomme un robot précis (ou * pour tous les robots), suivie de règles Allow et Disallow précisant les chemins que ce robot peut ou ne peut pas récupérer. Une seule règle générale comme Disallow: / sous User-agent: GPTBot suffit à exclure ce robot de l’intégralité de votre site — et il n’apparaîtra alors dans aucune citation de ChatGPT, aussi bon que soit votre contenu. C’est pourquoi la crawlabilité — la propriété générale d’un site à être techniquement accessible aux robots — est considérée comme la couche fondatrice de la visibilité en recherche IA, et non comme un détail secondaire.

Le robots.txt a aussi un second rôle : c’est généralement là que les robots cherchent un pointeur vers votre sitemap, via une directive Sitemap:. Un sitemap XML est une liste structurée des URL de votre site que vous souhaitez faire connaître aux robots, incluant souvent des métadonnées comme les dates de dernière modification. Là où le robots.txt contrôle la permission, le sitemap contrôle la découverte — c’est la carte qui indique aux robots ce qui existe, pour qu’ils n’aient pas à trouver chaque page uniquement en suivant des liens. Un site peut avoir des règles robots.txt parfaitement permissives et être malgré tout sous-indexé par les systèmes d’IA, simplement parce que son sitemap est absent, non référencé ou incomplet.

Ces deux fichiers comptent aujourd’hui davantage pour la visibilité en IA qu’ils n’ont jamais compté pour le SEO traditionnel. Les moteurs de recherche explorent le web depuis plus de 25 ans et ont construit d’immenses graphes de liens qui permettent à Googlebot de découvrir des pages même sans sitemap. Les robots d’IA sont plus récents, souvent plus prudents sur la quantité de pages qu’ils vont récupérer, et plus susceptibles d’être bloqués purement et simplement par des règles robots.txt écrites en ne pensant qu’à Googlebot. Une règle qui exclut discrètement les bots « inconnus » ou à l’apparence agressive peut prendre GPTBot ou ClaudeBot en dommage collatéral. C’est précisément ce type de défaillance que la vérification Robots.txt et Sitemaps est conçue pour détecter — et c’est pourquoi c’est l’un des tout premiers points que tout audit d’accessibilité IA devrait vérifier, avant même de consacrer du temps au contenu, aux données structurées ou à quoi que ce soit d’autre.

La section Robots.txt et Sitemaps de l’audit Accessibilité des Agents

Important
Une seule règle trop stricte dans robots.txt peut bloquer un robot d’IA sur l’ensemble de votre site. Cette vérification vous permet de détecter cela avant qu’il ne vous coûte silencieusement des citations.

Où la trouver

Il s’agit de la section Robots.txt et Sitemaps de Audit → Accessibilité des Agents. Accessibilité des Agents est la partie de l’audit AmICited qui se concentre spécifiquement sur la capacité technique des systèmes d’IA à atteindre et analyser votre contenu, par opposition aux volets qualité du contenu et suivi des citations du produit. Robots.txt et Sitemaps est généralement la première vérification de cette section, car tout ce que mesure le reste de l’audit part du principe que les robots peuvent d’abord franchir la porte d’entrée.

Ce qu’elle vérifie

Comme la section l’explique, elle examine « si les robots d’IA et de recherche importants sont autorisés à lire le site, si des sitemaps sont déclarés dans robots.txt et combien d’URL ces sitemaps listent au total. » En résumé :

  • Accès des robots — les principaux bots d’IA et de recherche sont-ils autorisés (non interdits) dans robots.txt ? AmICited évalue vos règles robots.txt réelles par rapport aux chaînes user-agent des robots qui comptent pour la visibilité en recherche IA, afin que vous voyiez, robot par robot, s’il est autorisé, bloqué, ou simplement non mentionné par aucune règle (ce qui revient généralement à une autorisation par défaut via le bloc générique).
  • Déclaration du sitemap — un sitemap est-il référencé depuis robots.txt pour que les robots puissent le trouver ? Un sitemap qui existe mais n’est pas relié depuis robots.txt (et n’a pas été soumis ailleurs) a beaucoup moins de chances d’être détecté automatiquement.
  • Couverture du sitemap — combien d’URL vos sitemaps listent au total, ce qui vous donne un contrôle de cohérence rapide pour vérifier que vos pages publiées sont réellement signalées aux robots.

Ensemble, ces trois vérifications répondent aux deux questions qui déterminent si un système d’IA peut même commencer à évaluer votre contenu : ce robot est-il autorisé à entrer, et sait-il ce qu’il doit récupérer une fois sur place. Une marque peut faire tout ce qu’il faut côté contenu — des réponses claires, des signaux d’entité solides, des pages bien structurées — et rester malgré tout invisible dans les réponses IA simplement parce que l’une de ces deux conditions échoue silencieusement en arrière-plan.

Comment l’utiliser

  1. Confirmez que les robots sont autorisés. Si un bot d’IA important est bloqué, corrigez la règle dans robots.txt — c’est le problème à la plus haute priorité sur la page. Vérifiez chaque robot bloqué à l’aune de votre intention réelle : une règle qui bloque GPTBot a probablement été écrite volontairement si vous ne voulez pas que votre contenu serve à l’entraînement des modèles d’OpenAI, mais si elle bloque aussi silencieusement OAI-SearchBot ou PerplexityBot — les robots qui alimentent réellement les citations en direct, par opposition à l’entraînement des modèles — vous perdez de la visibilité sans aucune raison stratégique. Mieux vaut décider délibérément quels robots vous souhaitez autoriser à explorer votre site plutôt que d’hériter d’un réglage par défaut qui bloque tout sans distinction.
  2. Déclarez votre sitemap. Assurez-vous que robots.txt pointe vers votre sitemap afin que les agents puissent découvrir toutes vos pages. Il s’agit d’une seule ligne — Sitemap: https://votresite.com/sitemap.xml — mais c’est l’un des détails les plus fréquemment absents sur des sites par ailleurs bien construits, en particulier lorsque le sitemap a été généré automatiquement par un CMS mais jamais relié au robots.txt.
  3. Vérifiez le nombre d’URL. Un sitemap listant beaucoup moins d’URL que vous n’en avez publiées signifie que des pages ne sont pas signalées aux robots. C’est généralement le signe d’un sitemap obsolète (généré une fois et jamais régénéré depuis), d’un index de sitemaps qui ne relie pas tous ses sitemaps enfants, ou d’un plugin CMS qui exclut silencieusement un type de contenu — les articles de blog récemment publiés et les pages générées dynamiquement en sont souvent les victimes.
  4. Revérifiez après les modifications et confirmez que les tuiles Accès des robots et URL du sitemap dans le résumé de préparation deviennent vertes.

L’accès des robots est le fondement : faites-le correctement en premier, car tout le reste suppose que les bots peuvent effectivement atteindre votre contenu. Une fois l’accès et la découverte confirmés comme sains, le reste de l’audit Accessibilité des Agents — rendu, données structurées, temps de réponse — commence à avoir de l’importance, car ces vérifications ne portent leurs fruits que si le robot a d’abord été autorisé à atteindre la page.

Il est également utile de garder à l’esprit que la couverture robots.txt et sitemap n’est pas une correction ponctuelle. De nouvelles sections sont lancées, les migrations de CMS régénèrent des sitemaps avec des réglages par défaut différents, et des règles de CDN ou de WAF sont ajoutées bien après la rédaction du robots.txt d’origine — autant d’événements qui peuvent réintroduire silencieusement un robot bloqué ou un sitemap incomplet. Certaines équipes associent cette vérification à une analyse des journaux serveur pour confirmer que les robots visitent effectivement les pages qu’ils sont autorisés à consulter, ainsi qu’à un fichier llms.txt dédié, qui offre aux systèmes d’IA un résumé sélectionné de votre contenu le plus important en complément du sitemap brut. Si vous ne savez pas où situer la couverture robots.txt et sitemap par rapport au reste de votre travail technique, un audit de visibilité IA plus large parcourt l’ensemble des vérifications d’accessibilité dans l’ordre, et l’outil visibilité IA d’AmICited permet de suivre si la correction de ces problèmes se traduit réellement par davantage de citations au fil du temps — associant ainsi la correction technique au résultat qu’elle est censée produire, plutôt que de considérer « robots autorisés » comme la ligne d’arrivée. Pour les équipes qui gèrent cela sur des dizaines de sites clients, ces mêmes vérifications d’accès et de sitemap font partie des points récurrents couverts par AmICited pour les agences , car une règle robots.txt mal configurée a tendance à se répéter d’un modèle à l’autre et doit être détectée tôt dans l’intégration, avant qu’un client ne demande pourquoi sa marque n’apparaît jamais dans ChatGPT.

← Tous les tutoriels de l'Académie

Prêt à le mettre en pratique ?

Vérification gratuite · Essai de 14 jours · sans carte de crédit