Notre scan ne lit qu'une page de votre site : pourquoi ce choix, et ce qu'il coûte
Un scan de visibilité IA Biencité lit votre page d'accueil et quelques fichiers publics placés à la racine de votre domaine : robots.txt, le plan de site, llms.txt, les fichiers destinés aux agents. Rien d'autre. Ce périmètre est étroit, il tient en une trentaine de secondes, il ne demande aucun compte et ne modifie rien chez vous. Il voit donc une partie de votre site, et cet article dit précisément laquelle.
Ce choix repose sur une propriété du web, pas sur une facilité technique. Le protocole d'exclusion des robots, normalisé par l'IETF sous la référence RFC 9309 en septembre 2022, impose que les règles destinées aux robots soient accessibles dans un fichier nommé /robots.txt placé au sommet du service. Un fichier racine ne décrit jamais une page isolée : il engage tout l'hôte, d'un seul coup.
Pourquoi lire la racine du domaine plutôt que l'ensemble des pages ?
La racine du domaine concentre les décisions qui s'appliquent à toutes vos pages simultanément. Un robots.txt qui refuse GPTBot le refuse sur les quatre mille fiches de votre catalogue exactement comme sur votre accueil. Un llms.txt absent est absent pour le domaine entier. La norme RFC 9309 ajoute que les robots ne devraient pas conserver une version en cache de robots.txt au delà de 24 heures, sauf si le fichier est injoignable : ce que votre racine déclare aujourd'hui est relu très vite, et il s'applique partout.
Le fichier llms.txt suit la même logique de portée. Jeremy Howard a proposé ce format en septembre 2024, et la spécification publiée sur llmstxt.org, mise à jour le 10 août 2026, prévoit que le fichier soit placé à la racine du site ou à la racine d'un chemin, pour couvrir les pages situées en dessous. Lire la racine d'un domaine, c'est lire ses fondations.
Que lit exactement le scanner, et en combien de temps ?
Le scanner Biencité consulte la page d'accueil telle que votre serveur la renvoie, puis une poignée de fichiers publics du domaine, et le rapport arrive en une trentaine de secondes. Aucun compte n'est nécessaire pour un scan gratuit. Voici ce qui entre dans le périmètre.
- Le HTML de votre page d'accueil, tel qu'un robot le reçoit, avant toute exécution de JavaScript dans un navigateur.
- robots.txt, qui dit quels robots d'IA vous laissez entrer et lesquels vous refusez.
- Le plan de site, qui dit aux moteurs quelles adresses existent chez vous.
- llms.txt, le guide de lecture destiné aux modèles de langage.
- Les fichiers destinés aux agents, qui décrivent ce qu'une IA peut comprendre et déclencher chez vous.
Pourquoi la lecture seule est-elle une contrainte, et pas une précaution commerciale ?
La lecture seule signifie que rien n'est installé, rien n'est écrit et aucun accès ne vous est demandé, et cette règle coûte de l'information. Le scanner n'a pas de compte chez vous : il ne voit ni vos statistiques d'audience, ni votre back office, ni les pages protégées par un mot de passe. Un audit qui exige un accès administrateur en verrait davantage.
La contrepartie de cette contrainte est vérifiable par vous. Tout ce qu'affiche le rapport, vous pouvez le contrôler vous même depuis un navigateur, en ouvrant les mêmes adresses. Une mesure qu'aucune donnée privée ne vient étayer est une mesure que vous pouvez contredire, et c'est la seule raison sérieuse d'accepter d'en voir moins.
Que ce périmètre ne voit-il pas ?
Ce périmètre ne voit pas vos pages profondes, et c'est précisément là que les IA vont chercher leurs citations. Similarweb a publié le rapport « The 2026 Generative AI Landscape », établi sur des données de juin 2025 à mai 2026 : 65 % des adresses citées par ChatGPT se situent à deux ou trois dossiers de profondeur dans un site, la profondeur deux comptant à elle seule pour 41,7 % des citations. Le même rapport relève que 58,8 % du trafic de référence renvoyé par ChatGPT atterrit, lui, sur une page d'accueil.
Cet écart dessine exactement la limite du diagnostic. Un scan qui lit l'accueil et la racine mesure les conditions d'entrée du domaine, pas la citabilité de chacune de vos fiches produit ni de chacun de vos articles. Les signaux racine valent pour tout le site, le balisage et la structure d'une page de catalogue ne valent que pour elle. Un site dont l'accueil coche tous les signaux peut parfaitement publier huit cents fiches produit sans la moindre donnée structurée.
La réponse honnête n'est pas de promettre un scan exhaustif de votre site. C'est de dire ce que la mesure couvre, puis de traiter le reste comme un travail éditorial continu, page par page, qui n'obéit pas au même calendrier. L'article « Combien de temps avant de voir un effet sur sa visibilité IA ? » détaille ces deux horloges, celle du correctif technique et celle des citations régulières.
Que se passe-t-il quand un fichier ne répond pas ?
Un signal que le scanner n'a pas réussi à vérifier est déclaré non mesuré et sort du calcul, au lieu de compter zéro. Chaque signal a donc trois états possibles, acquis, manquant ou non mesuré, et le rapport indique combien de signaux ont réellement été vérifiés sur les 19 du référentiel. Un fichier injoignable, un délai dépassé, une erreur serveur momentanée : un échec de mesure n'est pas une absence constatée.
Cette distinction change la lecture d'un rapport. Une note obtenue sur seize signaux vérifiés ne se compare pas à la même note obtenue sur dix neuf : la première est une photographie partielle, à refaire quand votre serveur va mieux. Confondre les deux produit un score faux, toujours dans le sens qui arrange celui qui vend l'audit.
Pourquoi un signal impossible chez vous ne compte-t-il pas contre vous ?
Shopify, Wix, Webflow et Framer verrouillent certains fichiers à la racine du domaine, et aucun réglage client ne les déverrouille. Ces signaux sont marqués hors de portée sur votre plateforme au lieu d'être comptés comme des manques, et ils n'apparaissent jamais dans votre plan d'action. Le principe tient en une phrase : vous ne recevez jamais un conseil que votre site ne peut pas appliquer. L'article « Shopify, Wix, Webflow, Framer : ce que votre plateforme vous autorise face aux IA » détaille ce qui reste ouvert chez chacun.
Dans quels cas ce diagnostic ne vous apprendra rien ?
Ce diagnostic ne vous apprendra rien tant que le problème de votre site n'est pas un problème de fondations. Quatre situations reviennent souvent, et dans chacune votre budget est mieux placé ailleurs.
- Votre site tient en trois pages de présentation. Les fondations seront vite en ordre, et il ne restera rien à citer. Écrivez d'abord, mesurez ensuite.
- Vous savez déjà que votre contenu n'apparaît qu'après exécution du JavaScript. Le verdict est joué d'avance, et la dépense utile est chez votre développeur.
- Votre difficulté est éditoriale, pas technique : vos pages sont lisibles, structurées, et personne ne les lit. Un scan de racine ne dira rien de ce problème là.
- Vous cherchez à savoir ce que les IA racontent aujourd'hui de votre entreprise. C'est une mesure différente, hebdomadaire et répétée, décrite dans l'article « Pourquoi demander à ChatGPT s'il vous connaît ne mesure rien ».
La liste complète des 19 signaux et la façon dont le score se lit sont publiées sur la page méthode de Biencité, à l'adresse https://www.biencite.fr/fr/methode. Le poids de chaque signal n'y figure pas : ces poids évoluent avec les pratiques des moteurs génératifs, et les publier inviterait à optimiser un score plutôt qu'une visibilité réelle.
Questions fréquentes
Le scan modifie-t-il mon site ?
Non. Le scanner lit votre page d'accueil et quelques fichiers publics du domaine, exactement comme le ferait un robot d'IA. Rien n'est installé, rien n'est écrit, et aucun compte n'est nécessaire pour lancer un scan gratuit.
Pourquoi ne pas scanner toutes les pages de mon site ?
Parce que les décisions mesurées se prennent à la racine du domaine et valent pour toutes les pages à la fois. Un scan de racine mesure les fondations. La qualité page par page relève d'un travail éditorial continu, qui n'obéit pas au même calendrier.
Un bon score sur l'accueil suffit-il à être cité ?
Non. Le score mesure une éligibilité technique, jamais une citation. Similarweb relève que 65 % des adresses citées par ChatGPT se trouvent à deux ou trois dossiers de profondeur : vos pages profondes doivent aussi mériter la citation.
Que signifie un signal non mesuré dans mon rapport ?
Que le scanner n'a pas pu vérifier ce signal, à cause d'un fichier injoignable, d'un délai dépassé ou d'une erreur serveur. Le signal sort du calcul au lieu de compter zéro, et le rapport indique le nombre de signaux réellement vérifiés.
- scan visibilite ia
- lecture seule
- robots txt
- llms txt
- geo