Guide · moteurs de réponse
Être cité par un moteur de réponse.
ChatGPT, Gemini, Claude et Perplexity ne classent pas dix résultats : ils rédigent une réponse et n’y nomment qu’une poignée d’entreprises. Voici ce qui se joue vraiment, ce que les documentations officielles disent, et ce qu’aucune technique ne garantit.
Aucun fichier spécial ne rend visible dans les IA : Google écrit lui-même qu’aucun n’est nécessaire pour apparaître dans ses fonctionnalités génératives. Ce qui compte est plus ordinaire et plus exigeant : être lisible par un robot, dire clairement qui vous êtes, dire la même chose partout, et exister ailleurs que sur votre propre site. Le reste est de la mesure, et elle est moins précise qu’un classement Google.
Trois promesses qui circulent, et ce qu’elles valent
Je commence par là parce que c’est ce qu’on vous vendra, et parce que la suite de cette page n’a de valeur que si vous savez d’abord ce que je ne prétends pas faire.
« Un fichier llms.txt vous rend visible »
Faux pour Google, qui écrit que vous n’avez besoin d’aucun fichier lisible par machine, d’aucun fichier texte destiné à l’IA ni d’aucun balisage particulier pour apparaître dans ses fonctionnalités génératives, et qu’aucune exigence technique ne s’ajoute à celles de la recherche. Ce site publie un llms.txt malgré tout, parce que d’autres systèmes savent en lire et qu’il coûte une minute. Il ne rend rien visible.
Source : Google Search, fonctionnalités d’IA.
« Le balisage garantit la citation »
Non. Les données structurées aident une machine à comprendre sans deviner. Ce site en porte donc sur chaque page. Mais Google précise qu’aucun balisage schema.org particulier n’est nécessaire pour ses fonctionnalités d’IA. Un balisage qui décrit une page vide décrit une page vide.
Même source : Google Search, fonctionnalités d’IA.
« On vous met premier dans ChatGPT »
Il n’y a pas de première place dans une réponse rédigée. Il n’y a pas de classement stable non plus : la même question posée deux fois peut donner deux réponses. Quiconque vend une position vend quelque chose qui n’existe pas.
Comment un moteur de réponse trouve une information
Trois chemins, et ils n’ont pas du tout le même intérêt pour vous.
- 01
Ce que le modèle a appris
Figé à la date de son entraînement, et sans garantie qu’une entreprise donnée y figure. Vous n’avez aucune prise dessus. C’est le chemin sur lequel travailler sert le moins.
- 02
Ce qu’il va chercher au moment de la question
C’est celui qui compte. L’assistant lance une recherche, lit des pages, et cite. Tout ce qui empêche un robot de lire votre site vous exclut ici, exactement comme pour un moteur de recherche.
- 03
Ce qu’il trouve pour recouper
Une information présente seulement chez vous est une information invérifiable. Les mentions par des tiers, les annuaires sérieux et la presse locale font le travail que votre site ne peut pas faire tout seul.
Ce qui est réellement sous votre contrôle
Sept points, dans l’ordre où je les traite. Aucun n’est spectaculaire. Plutôt bon signe : ce sont ceux qui tiendront encore quand les produits auront changé de nom.
- Être lisible par un robotC’est la condition d’entrée, et la plus souvent manquée. Un moteur de réponse qui va chercher l’information au moment de la question passe par les mêmes tuyaux qu’un moteur de recherche : si vos pages sont bloquées, lentes ou vides sans JavaScript, la question ne se pose même pas.
- Mettre le texte dans le texteCe qui est écrit dans une image, dans un PDF scanné ou construit par un script après le chargement n’est pas lu de manière fiable. Le contenu qui compte doit être dans le HTML servi, en toutes lettres.
- Rendre l’entité claireQui vous êtes, ce que vous faites, pour qui, et où. Écrit une fois, complètement, à un endroit stable du site. C’est le travail qui ressemble le moins à du référencement et qui compte le plus ici.
- Dire partout la même choseNom, adresse, téléphone, périmètre d’activité doivent être identiques sur votre site, votre fiche Google, vos réseaux et les annuaires. Un moteur de réponse ne cite pas volontiers ce qu’il n’arrive pas à recouper.
- Exister ailleurs que chez vousUne information qui n’apparaît que sur votre propre site n’est pas recoupable. Les mentions par des tiers, la presse locale, les annuaires sérieux et les partenaires font le travail que votre site ne peut pas faire seul.
- Écrire des passages extractiblesUne réponse d’assistant reprend des fragments. Un paragraphe qui répond à une question précise, en entier, sans dépendre des trois paragraphes précédents, se reprend ; une phrase à tiroirs ne se reprend pas.
- Relever, et garder les tracesSans relevé daté avant l’intervention, il n’existe aucun moyen honnête de dire si quelque chose a changé. C’est la partie la moins spectaculaire du travail et celle qui rend le reste vérifiable.
01 La politique d’exploration
Les robots ne décident pas tous la même chose.
On vous parlera des « robots d’IA » comme d’un bloc. Ils ne le sont pas, et la confusion coûte cher dans les deux sens : on bloque ce qu’il fallait laisser passer, ou l’inverse. Voici ce que chacun fait, et surtout ce que le bloquer décide.
| Robot | Maison | Ce qu’il fait | Ce que le bloquer décide |
|---|---|---|---|
| OAI-SearchBot | OpenAI | Alimente la recherche de ChatGPT. | Le bloquer retire vos pages des réponses de recherche de ChatGPT. OpenAI précise que le site peut encore apparaître comme lien de navigation. |
| GPTBot | OpenAI | Collecte du contenu susceptible de servir à l’entraînement des modèles. | Le bloquer indique que votre contenu ne doit pas servir à l’entraînement. C’est une décision sur l’entraînement, pas sur la visibilité. |
| ChatGPT-User | OpenAI | Va chercher une page à la demande explicite d’un utilisateur, pendant une conversation. | OpenAI indique qu’il n’entre pas dans la décision d’afficher un contenu dans la recherche. |
| Google-Extended | Décide deux choses : si le contenu exploré par Google peut servir à l’entraînement des futures générations de modèles Gemini, et s’il peut servir à l’ancrage, c’est-à-dire à la fourniture de contenu de l’index Google au modèle au moment de la question, dans les applications Gemini. | Google écrit qu’il n’a aucun effet sur l’inclusion dans la recherche Google, et qu’il n’y est pas un signal de classement. Mais le bloquer retire aussi votre contenu de l’ancrage dans les applications Gemini : c’est la seule ligne de ce tableau où refuser l’entraînement coûte une visibilité. C’est précisément pourquoi « les robots d’IA » ne se traitent pas en bloc. | |
| Google-CloudVertexBot | Explore les sites à la demande de leur propriétaire, pour construire des agents Vertex AI. | Google écrit qu’il n’a aucun effet sur la recherche Google ni sur ses autres produits. Il ne concerne que les agents que vous faites construire vous-même. | |
| PerplexityBot | Perplexity | Fait apparaître et lie les sites dans les résultats de Perplexity. Perplexity précise qu’il ne sert pas à collecter du contenu d’entraînement. | Perplexity ne dit pas ce qui arrive si on le bloque : il recommande de l’autoriser pour apparaître dans ses résultats. Le reste serait une déduction de ma part. |
| Perplexity-User | Perplexity | Va chercher une page quand un utilisateur pose une question, comme son équivalent chez OpenAI. | Rien, et c’est le cas le plus instructif du tableau : Perplexity écrit que cette requête étant demandée par un utilisateur, elle ignore généralement les règles du fichier robots.txt. |
Sources : documentation OpenAI sur ses robots, documentation Perplexity et, chez Google, la documentation sur les fonctionnalités d’IA ainsi que la liste de ses robots d’exploration, qui est la page portant la phrase sur Google-Extended. Chaque ligne vient de l’éditeur du robot concerné, et quand l’éditeur ne dit rien, le tableau le dit aussi. Ce tableau ne dit pas ce que vous devez décider : c’est votre contenu et votre arbitrage.
Ce que fait ce site, et pourquoi
Un cabinet qui vend de la visibilité dans les moteurs de réponse devrait pouvoir montrer ses propres réglages. Les voici, sans mystère.
Le fichier robots.txt de ce site autorise tout le monde, y compris les robots d’entraînement, et n’interdit rien. C’est un choix assumé, pas un oubli : le contenu de ce site est fait pour être lu, cité et recoupé. Il ne comporte aucune ligne d’interdiction, et ce n’est pas anodin non plus : un Disallow est public, donc interdire un chemin revient à le publier.
Le texte est dans le HTML servi, y compris les questions fréquentes, qui restent lisibles sans JavaScript. Chaque page porte un balisage qui décrit ce qu’elle montre réellement, et rien de plus. Le llms.txt existe, et je viens d’écrire plus haut qu’il ne rend rien visible.
Sur une mission, le travail se mesure : un jeu de questions suivi sur les quatre moteurs, relevé et daté, les concurrents nommés à votre place, et ce qui bouge d’un mois sur l’autre. C’est le sixième axe du diagnostic, et il figure dans les trois offres de la page devis.
Les limites de cette mesure, et il faut les connaître
Une réponse d’assistant n’est pas reproductible comme un classement. Elle varie d’une fois sur l’autre, elle peut dépendre de la formulation de la question, et aucun de ces produits ne publie d’interface de mesure. Un relevé dit donc une fréquence sur un échantillon, pas une position : sur dix relevés, combien de fois êtes-vous nommé. C’est utile, c’est comparable dans le temps, et ce n’est pas une science exacte. Je préfère l’écrire ici que de vous vendre un tableau de bord qui aurait l’air plus sûr qu’il ne l’est.
Questions fréquentes
Un fichier llms.txt rend-il visible dans les IA ?
Non, et c’est la promesse la plus vendue du moment. Google écrit noir sur blanc que vous n’avez besoin d’aucun fichier lisible par machine, d’aucun fichier texte destiné à l’IA ni d’aucun balisage particulier pour apparaître dans ses fonctionnalités génératives, et qu’aucune exigence technique ne s’ajoute à celles de la recherche. Ce site en publie un quand même, parce que d’autres systèmes que Google savent en lire, et parce qu’il coûte une minute à produire. Mais il ne rend rien visible, et personne ne devrait vous le facturer comme tel. Source : documentation Google Search sur les fonctionnalités d’IA.
Pouvez-vous me garantir d’être cité par ChatGPT ?
Non. Personne ne le peut, et il faut se méfier de qui l’affirme. Une réponse d’assistant n’est pas un classement stable : elle est rédigée à chaque fois, et deux personnes qui posent la même question le même jour peuvent obtenir deux réponses différentes. Ce sur quoi je m’engage, c’est un travail précis livré à une date, et une mesure honnête de ce qui est dit de vous avant et après.
En quoi est-ce différent du référencement classique ?
Moins qu’on ne le prétend, sur les fondations. Un moteur de réponse qui va chercher une information au moment de la question passe par un index et par des pages : si votre site est illisible pour un robot, il l’est pour lui aussi. La différence est ailleurs. Un moteur de recherche vous classe parmi dix résultats ; un moteur de réponse rédige une réponse et n’y nomme qu’une poignée d’entreprises. Il faut donc qu’il comprenne ce que vous faites, pour qui et où, et qu’il trouve de quoi le recouper ailleurs que chez vous.
Faut-il bloquer les robots d’IA pour protéger son contenu ?
C’est une décision qui vous appartient, et elle n’est pas binaire, parce que les robots ne font pas tous la même chose. Chez OpenAI, bloquer GPTBot, qui ne sert qu’à l’entraînement, n’empêche pas d’apparaître dans les réponses de ChatGPT ; bloquer OAI-SearchBot, qui alimente sa recherche, si. Chez Google, le piège est ailleurs : le même jeton gouverne l’entraînement et l’ancrage dans les applications Gemini, donc le bloquer coûte bien une visibilité. Aucune règle générale ne tient : il faut lire robot par robot. Je ne modifie jamais une politique d’exploration sans vous montrer ligne par ligne ce qui change et ce que chaque ligne décide.
Comment mesure-t-on quelque chose d’aussi mouvant ?
En posant toujours les mêmes questions, sur les mêmes moteurs, à intervalles réguliers, et en gardant la trace datée de chaque réponse. On ne mesure pas une position, on mesure une fréquence : sur dix relevés, combien de fois êtes-vous nommé, et qui l’est à votre place. C’est moins précis qu’un classement Google, et je préfère le dire plutôt que d’habiller une incertitude avec un tableau de bord.