
Nach Autor Patrick Stox
Technisches SEO bei Ahrefs
Es gibt mehrere Crawler, die Google für bestimmte Aufgaben einsetzt, und jeder Crawler identifiziert sich selbst mit einer anderen Textzeichenfolge, die "User Agent" genannt wird. Googlebot ist Evergreen, d.h. er sieht Websites so, wie Nutzer sie im neuesten Chrome-Browser sehen würden.
Googlebot läuft auf Tausenden von Rechnern. Sie bestimmen, wie schnell und was auf Websites gecrawlt werden soll. Aber er verlangsamt sein Crawling, um Websites nicht zu überfordern.
Schauen wir uns an, wie Googlebot einen Index des Webs erstellt.
Google hat in der Vergangenheit einige Versionen seiner Pipeline veröffentlicht. Die untenstehende ist die aktuellste.

Er verarbeitet diese Daten erneut und sucht nach Änderungen auf der Seite oder neuen Links. Der Inhalt der gerenderten Seiten wird in Googles Index gespeichert und durchsuchbar gemacht. Alle neuen Links, die gefunden werden, wandern zurück zur Sammlung der URLs, die gecrawlt werden sollen.
Mehr Details zu diesem Prozess findest du in unserem Artikel über die Funktionsweise von Suchmaschinen.
Google gibt dir ein paar Möglichkeiten, um zu kontrollieren, was gecrawlt und indexiert wird.
Wenn du dir nicht sicher bist, welche Indexierungskontrolle du verwenden solltest, schau dir unser Flussdiagramm in unserem Beitrag über das Entfernen von URLs aus der Google-Suche an.
Viele SEO-Tools und einige bösartige Bots geben sich als Googlebot aus. Dadurch können sie auf Websites zugreifen, die versuchen, sie zu blockieren.
In der Vergangenheit musstest du einen DNS-Lookup durchführen, um Googlebot zu verifizieren. Kürzlich hat Google es aber noch einfacher gemacht und eine Liste mit öffentlichen IPs zur Verfügung gestellt, mit der du überprüfen kannst, ob die Anfragen von Google stammen. Du kannst sie mit den Daten in deinen Serverprotokollen vergleichen.
Du hast auch Zugang zu einem "Crawl-Statistik"-Bericht in der Google Search Console. Wenn du zu Einstellungen > Crawl-Statistiken gehst, enthält der Bericht eine Menge Informationen darüber, wie Google deine Website crawlt. Du kannst sehen, welcher Googlebot welche Dateien crawlt und wann er auf sie zugegriffen hat.

Das Internet ist ein großer und unübersichtlicher Ort. Der Googlebot muss sich durch all die verschiedenen Setups, Ausfallzeiten und Einschränkungen bewegen, um die Daten zu sammeln, die Google für seine Suchmaschine benötigt.
Zum Schluss noch ein lustiger Fakt: Googlebot wird normalerweise als Roboter dargestellt und treffend als "Googlebot" bezeichnet. Es gibt auch ein Spinnenmaskottchen, das "Crawley" heißt.
Noch Fragen? Schreib mir auf Twitter.

Patrick Stox ist Product Advisor, Technisches SEO, & Brand Ambassador bei Ahrefs. Er war der Hauptautor für das SEO-Kapitel des Web Almanac 2021 und Reviewer für das SEO-Kapitel 2022. Außerdem hat er das „SEO Book For Beginners“ von Ahrefs mitverfasst und war Technical Review Editor für „The Art of SEO“, 4. Auflage. Er ist Organisator des Triangle SEO Meetup, der Konferenz Tech SEO Connect, betreibt eine Technisches-SEO-Slack-Gruppe und ist Moderator für /r/TechSEO auf Reddit.