SEO

Was ist Googlebot? Funktionsweise und Verifizierung

Talha Aslan 16 Minuten Lesezeit 1 Aufrufe

Was ist Googlebot und was macht er in der Google Suche?

Googlebot ist der Sammelname für die Webcrawler, mit denen die Google Suche Webseiten findet, lädt und verarbeitet. Es handelt sich nicht um einen einzelnen Roboter, sondern um zwei: einen Smartphone Crawler und einen Desktop Crawler. Die geladenen Seiten durchlaufen danach Rendering, Indexierung und Ranking.

In diesem Beitrag zeigen wir das Vorgehen, das unser Team in technischen SEO Audits nutzt. Zudem stützen wir die technischen Aussagen auf die Dokumentation von Google Search Central. Folglich lässt sich jede Angabe auf Veröffentlichungen von Google zurückführen.

Stellen Sie sich Googlebot als Kurier vor, nicht als Richter. Er holt Ihre Seiten ab, entscheidet also nicht über deren Ranking. Allerdings kann kein Ranking System mit Ihren Inhalten arbeiten, wenn der Kurier Ihre Tür nicht erreicht. Deshalb ist der Zugriff für Crawler die erste Voraussetzung für SEO.

Was ist Googlebot genau, und welche Typen gibt es?

Laut Google Dokumentation steht der Name Googlebot für zwei Crawler Typen. Konkret ahmt Googlebot Smartphone einen mobilen Nutzer nach, Googlebot Desktop einen Desktop Nutzer. Beide nutzen dasselbe Produkt Token, daher gelten Ihre robots.txt Regeln für beide gleichermaßen.

Google betreibt außerdem weitere Crawler für andere Produkte. Zum Beispiel gibt es eigene Varianten für Bilder, Videos und Nachrichten. Google Storebot besucht Shopping Seiten, und Google InspectionTool steckt hinter den Testtools der Search Console.

Diese Unterscheidung hat konkrete Folgen. Deshalb stammt nicht jede Anfrage mit Google Kennung in Ihren Server Logs stammt vom Crawler, der Ihr Ranking prägt. Deshalb sollten Sie die Crawler Typen trennen, bevor Sie Schlüsse aus Logdaten ziehen.

  • Smartphone Crawler: der Hauptcrawler für Mobile First Indexierung.
  • Desktop Crawler: der Crawler für die Desktop Version einer Seite.
  • Varianten für Bilder, Videos und News: Crawler, die Inhalte für diese Suchtypen sammeln.
  • Google Storebot: der Crawler für Shopping und Produktseiten.
  • Google InspectionTool: der Crawler hinter Search Console und Tests für Rich Results.

Was ist Googlebot im Vergleich zu anderen Google Crawlern?

Zunächst teilt Google seine Crawler in drei Gruppen ein. Gängige Crawler füttern den Suchindex und befolgen robots.txt Regeln immer. Dann arbeiten Crawler für Sonderfälle nach Vereinbarungen mit Website Betreibern. Nutzerausgelöste Abrufer stellen eine einzelne Anfrage, wenn eine Person das auslöst.

Daher zeigt die Tabelle die drei Gruppen nebeneinander. Besonders AdsBot lohnt einen Blick. Er prüft Ihre Anzeigen Landingpages und kann die Regeln für den allgemeinen User Agent (*) ignorieren, wenn Sie dem zugestimmt haben. Darum wundern sich viele Betreiber, warum ihre robots.txt Sperre nicht greift.

GruppeBeispieleVerhalten bei robots.txt
Gängige CrawlerGooglebot, Storebot, Google InspectionToolBefolgen die Regeln bei automatischen Abrufen immer
Crawler für SonderfälleAdsBot, Google-ExtendedKönnen nach vereinbarten Regeln statt nach globalen arbeiten
Nutzerausgelöste AbruferGoogle Site VerifierLaufen einmalig, wenn ein Nutzer eine Aktion startet

Quelle: Googles Übersicht zu Crawlern und Abrufern.

Wie entdeckt Googlebot neue Seiten?

Konkret findet Googlebot Seiten auf zwei Hauptwegen. Zunächst folgt er Links auf Seiten, die er schon kennt. Außerdem liest er die URLs in den Sitemaps, die Sie einreichen. Ihre interne Verlinkung und Ihre Sitemap bestimmen also direkt, wie schnell neue Inhalte auffallen.

Nehmen wir zum Beispiel einen neuen Blogartikel, den Sie von nirgendwo verlinken. Dann kann Googlebot ihn nur über die Sitemap finden. Zudem garantiert ein Eintrag in der Sitemap weder Crawling noch Indexierung. Kurz gesagt: Eine Sitemap ist eine Empfehlungsliste, kein Befehl.

Bei neuen Inhalten geht unser Team in dieser Reihenfolge vor:

  1. Wir verlinken den Beitrag von mindestens einer passenden Leistungs oder Kategorieseite.
  2. Danach tragen wir ihn in die Sitemap ein und setzen lastmod auf das echte Änderungsdatum.
  3. Anschließend prüfen wir in der URL Prüfung der Search Console, ob die Seite erreichbar ist.
  4. Schließlich kontrollieren wir einige Tage später den Crawling und Indexstatus.

Zur Sitemap Seite lesen Sie unseren Beitrag zu lastmod richtig setzen. Eine Sitemap von Grund auf erstellen Sie mit unserem XML Sitemap Generator.

Was ist der Unterschied zwischen Crawling, Rendering und Indexierung?

Zunächst bedeutet Crawling, dass Googlebot die Seite von Ihrem Server lädt. Dann bedeutet Rendering, dass eine Browser Engine die Seite samt JavaScript ausführt. Schließlich bedeutet Indexierung, dass Google den Inhalt der Seite in seiner Datenbank speichert. Allerdings kann jeder Schritt einzeln scheitern, und jeder braucht eine andere Lösung.

Der häufigste Fehler in der Praxis ist, diese drei Begriffe zu vermischen. Wenn die Search Console zum Beispiel gecrawlte, aber nicht indexierte Seiten zeigt, liegt das Problem nicht beim Crawling. Googlebot hat die Seite geladen und sie nur nicht aufgenommen. Folglich suchen Sie die Antwort bei Inhaltsqualität und Signalen, nicht bei Servereinstellungen.

Umgekehrt zeigen Seiten, die Google gefunden, aber noch nicht gecrawlt hat, meist ein Problem auf der Crawling Seite. Um beide Fälle zu trennen, hilft unsere Anleitung zu nicht indexierten Seiten in der Search Console.

Was ist Googlebot bei JavaScript Seiten, und wie verarbeitet er sie?

Google verarbeitet JavaScript Seiten in drei Phasen: Crawling, Rendering und Indexierung. Zunächst lädt Googlebot das HTML und liest die Links aus. Danach kommen Seiten mit dem Statuscode 200 in eine Render Queue. Dort führt eine aktuelle Chromium Version das JavaScript aus und gibt das fertige HTML an die Indexierung weiter.

Die Wartezeit in der Render Queue kann wenige Sekunden betragen, sie kann aber auch länger dauern. Deshalb kann sich die Indexierung verzögern, wenn Sie kritische Inhalte nur per JavaScript nachladen. Server Side Rendering oder statische Generierung beseitigt diese Verzögerung.

Zwei Regeln sind hier wichtig:

  • Sperrt robots.txt eine URL, fordert Googlebot sie nie an und rendert sie darum nicht. Außerdem bleiben Inhalte aus gesperrten JavaScript Dateien unsichtbar.
  • Steht im ursprünglichen HTML ein noindex Tag, kann Google das Rendering und die JavaScript Ausführung überspringen.

Wer CSS und JavaScript Dateien in der robots.txt sperrt, lässt eine Seite für Googlebot unvollständig aussehen. Die Geschwindigkeitsseite behandeln wir außerdem im Beitrag zu JavaScript und Ladezeit. Quelle: Googles Grundlagen zu JavaScript SEO.

Wie verändert Mobile First Indexierung, was Googlebot sieht?

Mobile First Indexierung heißt, dass Google die mobile Version Ihrer Seiten für Indexierung und Ranking nutzt. Der Hauptcrawler auf Ihrer Website ist daher meist Googlebot Smartphone. Inhalte, die nur am Desktop existieren, können für Google praktisch verschwinden.

Die Folgen sind einfach, aber dennoch hart. Eine Produkttabelle, die Sie mobil ausblenden, ein gekürzter Kategorietext oder ein fehlender Schema Block erreicht den Index nicht. Ebenso erschweren gesperrte Ressourcen in der mobilen Version, dass Googlebot die Seite korrekt sieht.

In jedem Audit öffnet unser Team zuerst die mobile Version und vergleicht sie dann mit dem Desktop. Die Denkweise dahinter erklärt unser Beitrag zu Mobile First Design.

Was ist das Crawl Budget von Googlebot, und wen betrifft es?

Das Crawl Budget ist die Zahl der URLs, die Googlebot auf Ihrer Website crawlen kann und will. Es besteht aus zwei Teilen: Crawl Kapazität und Crawl Bedarf. Konkret zeigt die Kapazität, wie viel Last Ihr Server trägt. Der Bedarf zeigt dagegen, wie stark sich Google für Ihre Seiten interessiert.

Laut Google betrifft dieses Thema nicht jeden. Es gilt vor allem für diese Websites:

  • Große Websites mit über einer Million einzigartiger Seiten, deren Inhalt sich etwa wöchentlich ändert.
  • Mittlere und größere Websites mit über 10.000 einzigartigen Seiten, deren Inhalt sich täglich ändert.
  • Websites, die in der Search Console viele URLs als gefunden, aber noch nicht indexiert sehen.

Betreiben Sie eine kleine Unternehmensseite, ist das Crawl Budget selten Ihr Alltagsproblem. Dann ist Ihre Priorität, Seiten sauber aufzubauen und klar zu verlinken. Für einen tieferen Fall lesen Sie warum Googlebot weniger crawlt.

Wovon hängen Crawl Kapazität und Crawl Bedarf ab?

Die Crawl Kapazität folgt der Gesundheit Ihres Servers. Steigen die Antwortzeiten oder liefert der Server 5xx Fehler und 429 Signale, drosselt Googlebot sein Tempo. Antwortet der Server schnell und stabil, kann die Kapazität steigen.

Der Crawl Bedarf hängt vom wahrgenommenen Bestand, der Beliebtheit und der Aktualität Ihrer Inhalte ab. Das heißt, Seiten mit häufigen Änderungen und vielen Links crawlt Googlebot öfter. Unveränderte Seiten besucht er seltener.

FaktorWas das Crawling steigertWas das Crawling senkt
ServerzustandSchnelle, stabile Antworten5xx Fehler, 429 Signale, langsame Antworten
AktualitätEchte Änderungen und ehrliche lastmod DatenUnveränderte Seiten, die immer neu wirken
SeitenstrukturKlare interne Links und zusammengeführte DuplikateViele Parameter und Duplikat URLs
BeliebtheitLinks von anderen WebsitesSeiten ohne jeden Link

Kurz gesagt, es gibt keinen Zauberschalter für das Crawl Budget. Sie beschleunigen den Server, reduzieren Duplikat URLs und rücken wertvolle Seiten nach vorn. Quelle: Googles Leitfaden zum Crawl Budget.

Welche Fehler verschwenden Crawl Budget?

Die Zeit von Googlebot ist begrenzt, denn jeder Abruf kostet Kapazität. Lassen Sie ihn diese Zeit an wertlosen URLs verbrauchen, warten Ihre wichtigen Seiten länger. Das sind die häufigsten Quellen der Verschwendung, die wir in der Praxis sehen.

  • Endlose URL Kombinationen aus Filter und Sortierparametern.
  • Duplikat URLs mit Session IDs oder Tracking Parametern.
  • Entfernte Seiten, die weiter den Code 200 liefern und so Soft 404 Fehler erzeugen.
  • Lange Weiterleitungsketten und Weiterleitungsschleifen.
  • Tag und Archivseiten, die überall verlinkt sind, aber keinen Wert bieten.

Googles Empfehlung ist klar. Liefern Sie für dauerhaft entfernte Seiten 404 oder 410. Beheben Sie Soft 404 Fehler und halten Sie Ihre Sitemaps aktuell. Beantwortet Ihr Server bedingte Anfragen außerdem mit dem Code 304, lädt Googlebot denselben Inhalt nicht erneut.

Seien Sie hier vorsichtig. Versuchen Sie nicht, das Problem durch kurzfristige Änderungen an der robots.txt zu lösen. Laut Google verlagert sich der Crawl Anteil, den Sie dort freigeben, nicht auf andere Seiten, solange Ihre Website nicht am Kapazitätslimit ist.

Wie steuert die robots.txt den Googlebot?

Die robots.txt liegt im Stammverzeichnis Ihrer Website und sagt Crawlern, welche Pfade sie besuchen dürfen. Googlebot liest sie, bevor er eine Seite anfordert, und ruft gesperrte Pfade nicht ab. Eine einzige falsche Zeile kann also große Teile Ihrer Website aus dem Crawling nehmen.

Die Datei steuert also das Crawling, nicht die Indexierung. Diesen Unterschied übersehen viele.

Diese Grundpunkte prüft unser Team:

  • Liegt die Datei im Stammverzeichnis der Domain und heißt sie richtig?
  • Sperrt eine Regel versehentlich CSS oder JavaScript Dateien?
  • Steht die Adresse Ihrer Sitemap in der Datei?
  • Ist eine pauschale Disallow Regel aus der Testumgebung in die Live Version gelangt?

Starten Sie bei null, hilft unser robots.txt Generator. Die Logik erklärt was ist robots.txt, typische Fehler beschreibt der Beitrag zu robots.txt Fehlern.

Was ist der Unterschied zwischen robots.txt und noindex?

Die robots.txt steuert das Crawling, noindex steuert die Indexierung. Googlebot sieht ein noindex Tag nur, wenn er die Seite crawlen und lesen darf. Eine Seite gleichzeitig in der robots.txt zu sperren und mit noindex zu markieren, ist deshalb eine widersprüchliche Kombination.

Laut Google nutzen Sie noindex, um eine Seite aus der Suche herauszuhalten. Wollen Sie Nutzer und Crawler gleichermaßen aussperren, brauchen Sie einen Passwortschutz. Für das Crawl Budget ist noindex keine Lösung, denn Google fordert die Seite trotzdem weiter an.

ZielRichtiges MittelWorauf Sie achten sollten
Seite soll nicht gecrawlt werdenrobots.txtDie Seite kann über Links trotzdem in den Index kommen
Seite soll nicht in der Suche erscheinennoindex TagDie Seite muss fürs Crawling offen bleiben
Niemand soll die Seite aufrufenPasswortschutzSperrt Nutzer und Crawler gleichermaßen

Mehr Details finden Sie in unserem Vergleich zu noindex und nofollow.

Wie viel einer Datei liest Googlebot?

Googlebot verarbeitet bei unterstützten Dateitypen die ersten 2 MB und bei PDF Dateien die ersten 64 MB. Zudem folgen Ressourcen wie CSS und JavaScript denselben Grenzen. Google rechnet diese Grenzen auf unkomprimierte Daten. Für die Crawler und Abrufer von Google insgesamt nennt die Dokumentation eine Obergrenze von 15 MB.

In der Praxis kommen die meisten Seiten diesen Grenzen nie nahe. Allerdings können Seiten mit riesigem Inline JavaScript, großen JSON Blöcken oder eingebetteten Base64 Bildern wichtige Inhalte über die Grenze schieben. Was dahinter liegt, erreicht den Index nicht.

Wir raten daher, wichtige Texte, Überschriften und Schema Daten weit oben im HTML zu platzieren. Große Skripte in eigene Dateien auszulagern, hilft zudem bei Tempo und Wartung.

Wie prüfen Sie, ob ein Besucher der echte Googlebot ist?

Der User Agent Header von Googlebot wird oft gefälscht. Ein Blick auf diesen Header allein genügt daher nicht. Google empfiehlt zwei Prüfungen: eine Reverse DNS Abfrage und den Abgleich mit veröffentlichten IP Bereichen.

Für eine einmalige Prüfung gehen Sie manuell so vor:

  1. Nehmen Sie die anfragende IP Adresse aus Ihren Server Logs.
  2. Führen Sie eine Reverse DNS Abfrage durch und prüfen Sie, ob die Domain googlebot.com, google.com oder googleusercontent.com lautet.
  3. Führen Sie dann eine Forward DNS Abfrage für diesen Domainnamen durch.
  4. Bestätigen Sie schließlich, dass das Ergebnis zur ursprünglichen IP Adresse passt.

Viele Anfragen prüfen Sie am besten per Abgleich mit den IP Bereichsdateien, die Google veröffentlicht. Für gängige Crawler gibt es eine eigene JSON Datei, für Crawler mit Sonderfällen eine zweite. Quelle: Googles Anleitung zur Überprüfung von Googlebot.

Wie gehen Sie mit gefälschtem Googlebot Traffic um?

Schädliche Bots geben sich oft als Googlebot aus, damit niemand sie sperrt. Dieser Traffic kann daher Ihren Server belasten, Inhalte kopieren oder nach Schwachstellen suchen. Vertrauen Sie darum nie einer Anfrage, nur weil sie sich Googlebot nennt.

Unser empfohlener Ansatz ist einfach. Zunächst automatisieren Sie die obige Prüfung. Dann begrenzen oder blockieren Sie Anfragen, die durchfallen. Anfragen, die bestehen, sperren Sie dagegen nie.

Bei Firewall Regeln lauert eine häufige Falle. Setzen Sie Ratenlimits und nehmen die echten Googlebot IP Bereiche nicht aus, drosseln Sie das Crawling unbemerkt. Somit bleibt Ihr Server sicher, während Ihre Indexierung leidet. Beobachten Sie deshalb nach jeder neuen Regel den Bericht zu den Crawling Statistiken.

Wie testen Sie, was Googlebot auf Ihrer Website sieht?

Am verlässlichsten ist das Tool URL Prüfung in der Search Console. Es zeigt, wie Googlebot die Seite abgerufen hat, das gerenderte HTML und gesperrte Ressourcen. Ein Live Test zeigt außerdem den aktuellen Zustand der Seite.

Vergleichen Sie zudem den Seitenquelltext mit dem DOM in den Entwicklertools. Existiert ein kritischer Inhalt nur im DOM, sieht Googlebot ihn erst nach dem Rendering. Dann sollten Sie das Risiko einer Verzögerung abwägen.

Bedenken Sie auch, dass Googlebot nicht ewig wartet wie Sie im Browser. Sehr spät ladende Inhalte, lange laufende Skripte oder Bereiche, die einen Klick brauchen, können leer wirken. Text, der zum Beispiel erst nach einem Klick auf Mehr anzeigen erscheint, bleibt für Googlebot wahrscheinlich unsichtbar.

  • URL Prüfung: Crawling, Rendering und Indexstatus einer einzelnen Seite.
  • Bericht zu den Crawling Statistiken: Gesamtanfragen, Antwortzeit, Host Probleme und Dateityp Verteilung.
  • Server Logs: die Rohdaten dazu, welche URLs wie oft angefordert wurden.
  • Bericht zur Seitenindexierung: welche Seiten draußen bleiben und warum.

Sind Sie neu in der Oberfläche, helfen die ersten Schritte in unserer Google Search Console Anleitung. Für Rohdaten probieren Sie unsere Logfile Analyse.

Wie reagiert Googlebot auf HTTP Statuscodes?

Der Statuscode Ihres Servers ist die erste und klarste Nachricht, die Googlebot über eine Seite erhält. Der richtige Code prägt also Crawling und Indexierung. Ein falscher Code lässt Google die Seite missverstehen.

StatuscodeBedeutungFolge für Sie
200Die Seite lud ohne ProblemeSie kommt in die Render Queue und kann in den Index
301 und 302Die Seite ist umgezogenGooglebot folgt der Weiterleitung; lange Ketten erhöhen die Crawl Kosten
304Der Inhalt hat sich nicht geändertGooglebot lädt nichts neu und spart Ressourcen
404 und 410Die Seite existiert nicht mehrGooglebot nimmt sie mit der Zeit aus dem Index
429 und 5xxDer Server ist ausgelastet oder fehlerhaftGooglebot drosselt sein Crawl Tempo

Bei Wartungsarbeiten ist eine Wartungsseite mit Code 200 eine riskante Gewohnheit. Denn Googlebot kann sie für echten Inhalt halten. Stattdessen ist ein passender 5xx Code für vorübergehende Zustände sicherer.

Dasselbe gilt für Weiterleitungen. Leiten Sie Besucher von der alten URL in einem einzigen Schritt auf die neue. Außerdem bremsen verkettete Weiterleitungen Nutzer und kosten Googlebot Zeit.

Was ist Googlebot im Unterschied zu AdsBot in Google Ads?

Beide sind nicht dasselbe. AdsBot gehört zu den Crawlern für Sonderfälle und prüft die Qualität Ihrer Anzeigen Landingpages. Googlebot arbeitet dagegen für den Suchindex. Folglich unterscheiden sich ihre Regeln und ihr Verhalten bei robots.txt.

Laut Google kann AdsBot die Regeln für den allgemeinen User Agent (*) ignorieren, wenn der Website Betreiber zustimmt. Selbst wenn Ihre robots.txt alle Bots sperrt, kann AdsBot also Ihre Anzeigenseite erreichen. Für Werbetreibende ist das ein wichtiges Detail.

Haben Sie Zugriffsprobleme auf einer Landingpage, machen Sie zwei getrennte Prüfungen. Erstens, ob Googlebot sie crawlen kann. Zweitens, ob AdsBot sie erreicht. Möchten Sie beides gemeinsam klären, betrachtet unsere Google Ads Verwaltung beide Bereiche.

Was ist Googlebot nicht? Welche Irrtümer gibt es?

Hier sind die Irrtümer, die wir in der Praxis am häufigsten hören, mit kurzen Antworten. Jeder erzeugt zusätzliche technische Arbeit oder eine falsche Erwartung.

  • "Wenn ich eine Sitemap einreiche, wird meine Seite indexiert." Nein. Eine Sitemap hilft nämlich nur bei der Entdeckung.
  • "Mit robots.txt nehme ich eine Seite aus der Suche." Nein. Die Datei steuert das Crawling, und die Seite kann über Links trotzdem in den Index kommen.
  • "Googlebot crawlt meine Website täglich." Das hängt ab. Das Tempo folgt dem Serverzustand und den Änderungen am Inhalt.
  • "Steht im User Agent Googlebot, ist es Googlebot." Nein. Der Header wird oft gefälscht, daher ist eine Prüfung Pflicht.
  • "Crawl Budget ist das Problem jeder Website." Nein. Laut Google betrifft es vor allem große, schnell wechselnde Websites.

Wer diese Irrtümer früh ausräumt, verkürzt unsere Audits. Denn wer die richtige Frage stellt, öffnet sofort den richtigen Bericht.

Wie sieht eine Googlebot freundliche Seitenstruktur aus?

Eine Googlebot freundliche Website hat Seiten nur wenige Klicks entfernt, konsistente Links und schnelle Antworten. Diese Struktur erleichtert dem Crawler die Arbeit und nützt zudem den Nutzern. Technisches SEO und Nutzererlebnis weisen daher oft in dieselbe Richtung.

Bei der Bewertung einer Struktur achten wir auf diese Grundsätze:

  • Wichtige Seiten liegen nur wenige Klicks von der Startseite entfernt.
  • Jede Seite erhält einen Link von mindestens einer verwandten Seite, damit keine verwaisten Seiten bleiben.
  • Beschreibende Ankertexte sagen Googlebot, worum es auf der Zielseite geht.
  • Kategorie, Tag und Filterseiten bleiben für das Crawling geschlossen, wenn sie keinen Wert bieten.
  • Zuletzt hat jeder Inhalt genau eine kanonische URL.

Bei Online Shops erzeugen Filter zum Beispiel tausende URLs. Denn die meisten zeigen Nutzern nichts Neues. An dieser Stelle schützt eine bewusste Entscheidung, welche Kombinationen gecrawlt werden, Ihr Crawl Budget.

Welche praktische Checkliste gibt es für Googlebot?

Die folgende Liste fasst zusammen, was unser Team am ersten Tag eines technischen Audits prüft. Daher empfehlen wir, sie regelmäßig durchzugehen, etwa einmal im Monat.

  1. Ist die robots.txt erreichbar, und enthält sie eine unerwartete pauschale Sperre?
  2. Ist die Sitemap aktuell, und listet sie nur die URLs, die Sie indexiert haben möchten?
  3. Erreichen interne Links jede wichtige Seite?
  4. Enthält die mobile Version denselben Hauptinhalt wie der Desktop?
  5. Sind CSS und JavaScript Dateien für Googlebot offen?
  6. Sind die Antwortzeiten des Servers stabil und die 5xx Fehler niedrig?
  7. Liefern gelöschte Seiten 404 oder 410, und gibt es Soft 404 Fehler?
  8. Zeigt der Bericht zu den Crawling Statistiken einen ungewöhnlichen Anstieg oder Einbruch?

Die Antwort auf die Frage, was ist Googlebot, läuft am Ende auf diese Liste hinaus. Somit muss Googlebot Ihre Website erreichen, die Seite richtig sehen und Ihre wichtigen URLs leicht finden. Erfüllen Sie diese drei Bedingungen, zahlt sich der Rest Ihrer SEO Arbeit deutlich stärker aus.

Die Liste ist eine Zusammenfassung des Rahmens aus unserem Beitrag zu technischem SEO, ausgerichtet auf das Crawling.

In welcher Reihenfolge prüft unser Team den Zugriff von Googlebot?

Jedes Projekt ist anders, allerdings unsere Reihenfolge ändert sich selten. Zuerst prüfen wir den Zugriff, dann die Crawlbarkeit und zuletzt die Indexierbarkeit. So suchen wir das Problem in der richtigen Ebene und vermeiden unnötige Änderungen.

  • Zugriff: Serverantworten, Weiterleitungen, Firewall und CDN Regeln.
  • Crawlbarkeit: robots.txt, interne Links, Sitemap und Parameter URLs.
  • Rendering: JavaScript Abhängigkeit, gesperrte Ressourcen und Inhaltsgleichheit auf Mobilgeräten.
  • Indexierung: noindex, Canonical, doppelte Inhalte und Seitenqualität.

Danach ordnen wir die Befunde nach Wirkung und Aufwand. Möchten Sie Unterstützung bei der Technik, sehen Sie sich unsere SEO Beratung an. Den Umfang erklärt der Beitrag was eine SEO Beratung umfasst.

Häufig gestellte Fragen

Was ist Googlebot in einfachen Worten?
Googlebot ist die Crawler Software, mit der die Google Suche Webseiten findet und lädt. Es gibt zwei Typen: Konkret ahmt Googlebot Smartphone einen mobilen Nutzer nach, Googlebot Desktop einen Desktop Nutzer. Die geladenen Seiten durchlaufen Rendering, Indexierung und Ranking. Damit Ihre Website in der Suche erscheint, muss sie für Googlebot zugänglich sein.
Was passiert, wenn ich Googlebot in der robots.txt sperre?
Googlebot crawlt eine in der robots.txt gesperrte Seite nicht und kann ihren Inhalt daher nicht lesen. Die URL kann aber trotzdem in den Index gelangen, wenn andere Websites sie verlinken, nur eben ohne Inhalt. Um eine Seite aus der Suche zu nehmen, nutzen Sie noindex und lassen sie crawlbar. Kombinieren Sie beide Methoden nicht auf einer Seite.
Wie erkenne ich den echten Googlebot?
Der User Agent Header lässt sich leicht fälschen und genügt allein nicht. Führen Sie für die anfragende IP eine Reverse DNS Abfrage durch und prüfen Sie, ob die Domain googlebot.com, google.com oder googleusercontent.com lautet. Bestätigen Sie per Forward Abfrage, dass sie zur selben IP zurückführt. Für große Mengen nutzen Sie die IP Bereichsdateien von Google.
Muss sich jede Website um das Crawl Budget kümmern?
Nein. Laut Google betrifft das Crawl Budget vor allem große Websites mit über einer Million Seiten und wöchentlichen Änderungen oder Websites mit über 10.000 Seiten und täglichen Änderungen. Bei kleinen und mittleren Websites liegt das Problem meist bei Inhaltsqualität oder interner Verlinkung. Wir empfehlen, zuerst diese Punkte zu prüfen.
Kann Googlebot JavaScript ausführen?
Ja. Googlebot schickt Seiten mit Code 200 in eine Render Queue und führt JavaScript mit einer aktuellen Chromium Version aus. Das Rendering geschieht jedoch, wenn die Queue es zulässt, nicht beim Crawling. Liefern Sie kritische Inhalte daher nach Möglichkeit serverseitig aus. Sperren Sie außerdem keine JavaScript Dateien in der robots.txt.
Wie oft crawlt Googlebot meine Website?
Eine feste Frequenz gibt es nicht. Google passt das Crawl Tempo an Serverzustand, Beliebtheit der Seiten und Änderungshäufigkeit an. Grundsätzlich soll Googlebot im Durchschnitt nicht öfter als alle paar Sekunden auf eine Website zugreifen. Ihre echte Frequenz sehen Sie im Bericht zu den Crawling Statistiken der Search Console und in Ihren Server Logs.
  • googlebot
  • crawl budget
  • robots.txt
  • technisches seo
  • rendering
  • search console
  • indexierung
Teilen:
Talha Aslan

Google Partner und Experte für digitales Marketing. Seit 2012 praktisch in SEO, Google Ads, Webdesign und E-Commerce Projekten; jeder Beitrag hier stammt aus dieser Erfahrung.

Nächstes Projekt

Sprechen wir über Ihr Projekt.

Ihre Anfrage geht direkt an Talha Aslan und Team: Strategie von Talha, Umsetzung durch ein erfahrenes Team. Das Erstgespräch ist kostenlos, wir hören zu und melden uns mit einer klaren Roadmap.