
Par Louise Linehan
Expert marketing de contenu chez Ahrefs
Votre contenu peut être excellent et ne jamais apparaître dans une réponse de l’IA.
Chaque tactique d’optimisation pour l’IA part du principe que les systèmes d’IA peuvent atteindre vos pages, les lire et comprendre qui vous êtes. Rien de tout cela n’est garanti. Environ 5,89 % des sites web bloquent GPTBot purement et simplement, ChatGPT semble abandonner les pages qui mettent plus d’environ deux secondes à répondre, et la plupart des crawlers d’IA n’exécutent pas JavaScript du tout.
La bonne nouvelle, c’est que c’est la partie la plus facile à corriger de l’AEO. Rien ici ne vous fait gagner une citation à lui seul, mais un seul de ces problèmes peut discrètement vous coûter toutes les citations que vous auriez autrement obtenues.
Continuez à apprendre sur YouTube
Aucun des conseils de ce guide n’a d’importance si les crawlers d’IA ne peuvent pas lire vos pages. Les pages bloquées ne peuvent pas être citées, et cela arrive souvent par accident.
Nous avons analysé environ 140 millions de sites web et constaté que GPTBot est désormais le bot d’IA le plus bloqué (5,89 % des sites), ClaudeBot arrivant juste derrière.
Cloudflare bloque par défaut les plateformes d’IA, alors vérifiez que votre CDN ne vous a pas discrètement exclu.
« Autoriser les crawlers IA » n’est pas une décision unique, car chaque plateforme exploite plusieurs bots qui font des choses différentes.
OpenAI à elle seule en exploite trois :
Les compromis ne sont pas les mêmes. Bloquer GPTBot empêche votre contenu d’alimenter les données d’entraînement du prochain modèle — c’est généralement ce que les éditeurs mettent en balance. Bloquer OAI-SearchBot vous retire de l’index que ChatGPT explore, ce qui vous coûte aujourd’hui des citations et du trafic de référence. De nombreux sites bloquent le second par accident alors qu’ils ne voulaient bloquer que le premier.
Le moyen le plus rapide de voir où vous en êtes, c’est d’utiliser un outil comme AI Crawler Access Checker, qui lit votre robots.txt et vous indique quels crawlers sont autorisés à passer.

Pour voir quels bots se présentent réellement — plutôt que ceux qui sont autorisés — consultez Bot Analytics d’Ahrefs. Il suit les visites sur 12 catégories de bots, dont un filtre IA dédié, à partir de données côté serveur via Cloudflare ; il fonctionne donc sans ajouter de JavaScript à votre site.
Les crawlers d’IA ont tendance à lire le HTML brut et, la plupart du temps, n’exécutent pas le JavaScript comme le ferait un navigateur.
Cela signifie que tout ce qui n’apparaît qu’après exécution de JS côté client peut leur être invisible.
Pour jouer la carte de la prudence, tenez-vous-en au rendu côté serveur afin de donner à votre page les meilleures chances de visibilité dans l’IA.
Les pages qui se chargent lentement peuvent nuire à vos performances dans la recherche traditionnelle, mais il semble que la pénalité soit encore plus forte dans les moteurs de réponse. La vitesse de page semble aider à déterminer si vous apparaissez ou non dans la fenêtre de contexte du modèle.1
Vérifiez la vitesse de votre page (appelée time-to-first-byte) dans Site Audit :
llms.txt est une proposition de standard pour un fichier Markdown à la racine de votre domaine (p. ex. website.com/llms.txt) qui indique aux LLM où se trouve votre meilleur contenu : documentation, politiques, taxonomies de produits. En principe, c’est comme robots.txt pour les modèles de langage.
Mais en pratique, aucun grand fournisseur de LLM ne s’est engagé à le lire. Ni OpenAI, ni Anthropic, ni Google.
Nous avons vérifié ce qui se passe réellement lorsqu’un site web ajoute llms.txt. Sur 137 000 domaines utilisant Ahrefs Web Analytics, 28 % publient un fichier llms.txt. Sur les ~38 000 qui en ont un valide, 97 % ont reçu zéro requête pour celui-ci durant le mois que nous avons mesuré.
97 % des fichiers llms.txt ne sont jamais demandés
Étude Ahrefs portant sur 137 000 domaines avec Ahrefs Web Analytics.

Parmi la faible part de fichiers qui ont tout de même été récupérés, 96 % des requêtes provenaient de bots. Slackbot, le bot d’aperçu de lien, a récupéré llms.txt plus souvent que PerplexityBot. En clair, les moteurs de recherche d’IA les plus importants ne semblent pas l’utiliser.
Google a été très clair à ce sujet. Son guide sur l’optimisation pour les fonctionnalités d’IA générative comporte une section intitulée littéralement « mythbusting », qui explique aux propriétaires de sites que les fichiers lisibles par machine comme llms.txt ne sont pas nécessaires pour apparaître dans la recherche générative basée sur l’IA. John Mueller est allé plus loin, en comparant cela à l’ancienne balise meta keywords :
À ma connaissance, aucun des services d’IA n’a dit qu’il utilisait LLMs.TXT (et vous pouvez voir, en consultant les logs de votre serveur, qu’ils ne le vérifient même pas). Pour moi, c’est comparable à la balise meta keywords : c’est ce qu’un propriétaire de site affirme à propos de son site… (Le site est-il vraiment comme ça ? Eh bien, vous pouvez vérifier. À ce stade, pourquoi ne pas simplement vérifier le site directement ?)
John Mueller, Search Advocate, Google
Alors, faut-il en créer un ? Si vous publiez de la documentation pour développeurs, cela prend environ dix minutes et il existe un cas d’usage plausible. Mueller l’a décrit comme une « béquille temporaire, peut-être pour économiser des jetons » pour les outils de codage par IA qui analysent les docs. Pour tout le reste, c’est un effort sans retour mesuré, avec en plus un petit inconvénient : rendre votre contenu plus facile à aspirer en bloc par vos concurrents.
Les assistants IA inventent des liens vers votre site web, et ils le font souvent. Nous avons vérifié le statut HTTP de 16 millions d’URL citées par ChatGPT, Perplexity, Copilot, Gemini, Claude et Mistral, et nous avons constaté que les assistants IA envoient des visiteurs vers des pages 404 2,87 fois plus souvent que Google Search.
ChatGPT est de loin le pire contrevenant. 1,01 % de ses URL cliquées renvoient une erreur 404, contre une référence Google de 0,15 %.
Taux de 404 par canal de référence
Données d’Analyse web – 16 000 000 URL analysées.

Perplexity (0,87 %) et Gemini (0,86 %) se situent presque exactement au niveau du taux de 0,84 % de Google pour les URL citées. C’est logique, puisque tous deux récupèrent des données depuis l’index Google : ils héritent donc de ses liens brisés au lieu d’inventer les leurs.
Les URL inventées sont déduites de vos schémas existants. Une URL fréquemment hallucinée pour notre site était ahrefs.com/keywords, parce que nous parlons constamment de mots-clés et que le modèle a supposé qu’une page de ce type devait exister. Ce n’est pas le cas.
C’est l’un des rares avantages vraiment gratuits en AEO. Une personne avec une intention réelle a posé une question sur votre produit, a été envoyée vers votre site… et s’est retrouvée dans une impasse. Vous rencontrerez trois types différents :
C’est pourquoi nous avons ajouté un filtre à Analyse web qui vous aidera à trouver des URL hallucinées en seulement deux clics. Si vous cherchez une alternative simple à Google Analytics, gratuite jusqu’à 1 million d’événements par mois, allez y jeter un œil :
Si une URL hallucinée continue d’être demandée, le modèle vous indique quelle page vos visiteurs s’attendent à trouver sur votre site.
Chaque tactique de ce guide dépend au final d’une seule chose : la question de savoir si les systèmes d’IA reconnaissent votre marque comme une entité distincte.
Le saviez-vous ?
Une entité est toute chose distincte du monde réel qu’un moteur de recherche ou l’IA peut reconnaître et distinguer de tout le reste — une personne, un lieu, une entreprise, un produit ou un concept précis (comme « Dmytro Gerasymenko », « Ahrefs » ou « Singapour ») — plutôt que les simples mots utilisés pour la décrire.

Le Knowledge Graph de Google — une base de données de 54 milliards d’entités et de plus de 1,6 billion de faits sur leurs relations — n’est plus seulement le moteur derrière les Knowledge Panels.
C’est désormais l’infrastructure centrale pour AI Overviews, AI Mode et Gemini.
Si votre marque n’est pas clairement établie en tant qu’entité, avec des signaux cohérents sur votre site, des données structurées et des sources tierces faisant autorité, vous risquez d’être invisible dans les réponses de l’IA — pas seulement dans les links bleus.
Le schéma est souvent présenté comme un moyen rapide d’améliorer la visibilité dans l’IA, et la corrélation superficielle semble convaincante : les pages citées par l’IA ont presque trois fois plus de chances d’avoir du JSON-LD.
Le schéma est bien plus fréquent sur les pages citées par l’IA
Étude Ahrefs sur 6 M de pages (2 M de pages par groupe).

Mais corrélation ne veut pas dire causalité. Nous avons suivi 1 885 pages ayant ajouté du JSON-LD par rapport à 4 000 pages témoins et n’avons constaté aucune amélioration significative dans AI Mode ou ChatGPT, ainsi qu’une légère baisse dans AI Overview que nous n’avons pas pu attribuer au schéma.
Alors, le schéma est-il inutile ? Non, mais son rôle est lent et indirect, ce n’est pas une tactique de gain rapide.
Vous pouvez vérifier si Google vous reconnaît déjà via l’API Knowledge Graph de Google ou un outil gratuit afin de voir quel type d’entité il vous a attribué et si les attributs sont corrects.
Par exemple, Knowledge Graph Tool de Carl Hendy vous montre des résultats pour les personnes, les entreprises, les produits, les lieux et d’autres entités.

Ensuite, essayez d’obtenir des mentions de publications faisant autorité et veillez à garder vos informations cohérentes partout : le même nom, la même description et la même catégorie sur votre site, vos profils et les annuaires tiers.
Ajoutez ensuite du schéma là où c’est naturel, en priorisant les types qui définissent votre entité et ses relations :
Schéma Organization et sameAs reliant à vos profils Wikipedia, Wikidata et réseaux sociaux
Schéma Person pour les auteurs de votre site
Schéma Product pour vos offres
Astuce
Trouvez vos pages avec la plus forte autorité et assurez-vous qu’elles contiennent un balisage de schéma propre.
Pour cela, accédez au rapport Page Explorer dans Site Audit, puis triez par « Note de page ».
La métrique Page Rating (PR) indique la force du profil de backlinks interne et externe de votre URL par rapport aux autres URL incluses dans l’exploration du web.
Puis vérifiez la colonne « Éléments de schéma » pour auditer votre schéma existant, et la colonne « Problèmes de données structurées » pour repérer les données structurées manquantes ou non valides.
Je vous laisse sur cette dernière réflexion : un nombre croissant de « lecteurs » que vous cherchez à influencer sont en réalité des agents IA qui naviguent et achètent au nom de votre audience.
En juin 2026, le CEO de Cloudflare, Matthew Prince, a révélé que le trafic agentique (bot/crawler/agent) avait dépassé pour la première fois la barre des 50 % dans l’histoire d’internet.2, 3

Loin d’être un cas marginal ou une nouveauté, les recherches sur « l’IA agentique » ont été multipliées par 84 en trois ans, tandis que le coût d’exécution d’un agent est passé de quelques dollars à quelques centimes.
Vous n’avez pas encore besoin de reconstruire votre site web uniquement pour les agents IA. Mais l’ancien conseil consistant à créer du contenu uniquement pour les humains sans se soucier des robots tient probablement un peu moins la route qu’avant.
Ce chapitre porte sur l’influence de l’IA à laquelle l’humain fait confiance, et le marketing d’agent à agent, c’est justement ça — en allant un cran plus loin.

Louise est spécialiste en marketing de contenu chez Ahrefs. Au cours des dix dernières années, elle a occupé des postes seniors dans le domaine du contenu au sein de marques SaaS : Pi Datametrics, BuzzSumo et Cision. Durant cette période, elle a publié des centaines d’articles de blog, mené des recherches de référence dans le secteur et développé des programmes de webinaires animés par des experts.
Louise a d’abord appris les bases du SEO lors de son passage chez Pi, une société spécialisée dans le SEO pour grandes entreprises. Quelques semaines après son arrivée, elle avait publié un article sur la cannibalisation qui a attiré l’attention de la plus grande figure du SEO à l’époque : Rand Fishkin. Depuis, elle a écrit sur des sujets allant du netlinking manipulateur à la syndication de contenu, en passant par la prévision de la demande de recherche. Pendant son temps libre, elle a approfondi sa compréhension pratique du SEO en créant des sites web pour deux entreprises locales.
Vous pouvez lire les propos de Louise dans des publications du secteur comme Search Engine Watch, The Drum, The Telegraph et Spin Sucks.
Commencez ici : définition de l’AEO, sa différence avec le SEO et les sept étapes pour démarrer.
Ce qui se passe réellement entre un prompt et une réponse ; et à quel moment votre marque peut entrer dans le processus.
Vous ne pouvez pas optimiser ce que vous ne voyez pas. Voici sept façons de mesurer la présence de votre marque dans les réponses de l’IA.
Suivez des groupes de prompts, et non des réponses ponctuelles. Onze sources où trouver les requêtes qui valent la peine d’être surveillées.
Un bon classement vous permet d’être pris en considération. Voici comment vous faire citer : les sujets, les formats et les modifications on-page qui fonctionnent.
L’IA recommande les marques dont elle a entendu parler sur d’autres sites. Voici comment surveiller ces mentions et en obtenir davantage.
Les correctifs techniques qui déterminent si l’IA peut atteindre vos pages, les lire et comprendre qui vous êtes.