
Par Patrick Stox
SEO technique chez Ahrefs
Chrome/W.X.Y.Z est un espace réservé qui correspond à la dernière version de Chrome utilisée par Googlebot.
Googlebot tourne sur des milliers de machines, qui déterminent la vitesse et le contenu à crawler sur les sites web. Il ralentit toutefois son activité pour ne pas surcharger les serveurs.
Googlebot est le crawler le plus rapide du web selon Cloudflare Radar, Ahrefsbot arrivant en deuxième position.


Google a partagé plusieurs versions de son pipeline par le passé. Voici la plus récente.

Google part d'une liste d'URL collectées depuis diverses sources : pages web, sitemaps, flux RSS, et URL soumises via Google Search Console ou l'Indexing API. Il priorise ce qu'il souhaite crawler, récupère les pages et en stocke des copies.
Ces pages sont ensuite traitées pour y trouver de nouveaux liens, notamment vers des requêtes API, du JavaScript et des fichiers CSS dont Google a besoin pour restituer la page. Toutes ces ressources supplémentaires sont crawlées et mises en cache. Google utilise un service de rendu qui s'appuie sur ces ressources mises en cache pour voir les pages comme le ferait un utilisateur.
Le contenu est traité une nouvelle fois pour détecter d'éventuels changements ou de nouveaux liens. C'est le contenu de la version mobile des pages rendues qui est stocké et consultable dans l'index de Google. Tout nouveau lien trouvé rejoint le réservoir d'URL à crawler.
Pour en savoir plus sur ce processus, consultez notre article sur le fonctionnement des moteurs de recherche. Si vous vous intéressez aux aspects liés au rendu, lisez notre article sur le JavaScript SEO.
Google vous propose plusieurs façons de contrôler ce qui est crawlé et indexé.
Si vous ne savez pas quel dispositif de contrôle de l'indexation utiliser, consultez notre organigramme dans notre article sur la suppression d'URL des résultats Google.
Pour plus de détails sur la façon dont Googlebot détermine ce qu'il crawle et à quelle vitesse, consultez notre article sur le crawl budget.
Voici quelques informations techniques sur Googlebot qui peuvent vous aider à résoudre divers problèmes.
Googlebot crawle principalement depuis Mountain View, en Californie, sur la côte Pacifique des États-Unis. Google dispose néanmoins d'options de crawl spécifiques à certaines zones géographiques, qui peuvent être utilisées dans des situations particulières, par exemple lorsque des sites web bloquent le crawl depuis les États-Unis.
Pour la plupart des types de fichiers, Google récupère les 15 premiers Mo de chaque fichier. Pour les fichiers robots.txt, la taille maximale est de 500 kibioctets (Kio).
Googlebot prend en charge HTTP/1.1 et HTTP/2, et choisit celui qui offre les meilleures performances de crawl pour votre site. Il peut également crawler via FTP et FTPS, mais c'est rare.
Googlebot prend en charge gzip, deflate et Brotli (br).
Google prend en charge les standards de mise en cache tels que les réponses ETag et Last-Modified, ainsi que les en-têtes de requête If-None-Match et If-Modified-Since.
De nombreux outils SEO et certains bots malveillants se font passer pour Googlebot. Cela peut leur permettre d'accéder à des sites web qui tentent de les bloquer.
Par le passé, il fallait effectuer une recherche DNS pour vérifier Googlebot. Récemment, Google a simplifié la démarche en fournissant une liste d'adresses IP publiques permettant de vérifier que les requêtes proviennent bien de Google. Vous pouvez comparer ces données avec celles de vos logs serveur.

Vous avez également accès au rapport « Statistiques de crawl » dans Google Search Console. En allant dans Paramètres > Statistiques de crawl, vous trouverez de nombreuses informations sur la façon dont Google crawle votre site. Vous pouvez voir quel Googlebot crawle quels fichiers et à quel moment.

Le web est un endroit vaste et complexe. Googlebot doit naviguer parmi toutes sortes de configurations, de pannes et de restrictions pour collecter les données dont Google a besoin pour faire fonctionner son moteur de recherche.
Pour finir sur une note légère : Googlebot est généralement représenté sous la forme d'un robot et porte logiquement le nom de « Googlebot ». Il existe aussi une mascotte araignée appelée « Crawley ». D'après Lizzi Harvey de Google, cette araignée a également un nom non officiel : « Dex », diminutif d'Index.
Des questions ? N'hésitez pas à les poser sur Twitter.

Patrick Stox est conseiller produit, professionnel du SEO technique et ambassadeur de marque chez Ahrefs. Il a été l’auteur principal du chapitre sur le SEO du Web Almanac 2021 et relecteur pour le chapitre sur le SEO 2022. Il a également coécrit le Livre SEO pour les débutants d’Ahrefs et a été relecteur technique pour The Art of SEO, 4ᵉ édition. Il est organisateur du Triangle SEO Meetup et de la conférence Tech SEO Connect. Il anime également un groupe Slack dédié au SEO technique et est modérateur de /r/TechSEO sur Reddit.