Tools
Logfile Analyse für SEO
Mit dieser Logfile Analyse sehen Sie, was Googlebot und KI Crawler wirklich von Ihrem Server abrufen und wie oft. Gefälschte Bots erkennen Sie über die offiziellen IP Listen, dazu verschwendetes Crawl Budget und Lücken zur Sitemap. Das Log bleibt in Ihrem Browser.
Ergebnis
Logfile Analyse für SEO: So funktioniert es
- Access Logs herunterladen
Laden Sie bei Ihrem Hoster, auf Ihrem Server oder beim CDN mindestens 7, besser 30 Tage Access Logs herunter. Rohdateien, ältere .gz Archive und mehrere Dateien auf einmal funktionieren.
- Dateien ablegen
Ziehen Sie die Dateien auf das Upload Feld oder wählen Sie sie aus. Das Tool liest sie Stück für Stück in Ihrem Browser, deshalb bleiben auch sehr große Logs auf Ihrem Gerät.
- Format und Prüfung kontrollieren
Das Tool erkennt das Format selbst. Lassen Sie die IP Prüfung an. Dann lädt das Tool nur die offiziellen IP Listen und markiert jeden Bot als bestätigt, gefälscht oder nicht prüfbar.
- Die vier Reiter lesen
Beginnen Sie mit der Übersicht. Danach zeigt der Reiter Googlebot Statuscodes und Verschwendung, der Reiter KI Crawler Training, Suche und Nutzeragenten und der Reiter Sitemap die Lücken.
- Exportieren und handeln
Laden Sie jede Tabelle als CSV. Beheben Sie Weiterleitungen und Fehler, auf die Googlebot immer wieder trifft, und wiederholen Sie die Analyse nach jedem Release.
Wie berechnet das Tool seine Werte?
Jede Zahl stammt aus den Zeilen Ihres Logs. Das Tool entfernt gefälschte Bots, bevor es die Werte für Googlebot und KI Crawler zählt.
Botanfragen / alle AnfragenIP Adresse liegt in der veröffentlichten CIDR Liste des BetreibersBotname im User Agent, IP außerhalb jeder Liste dieses Betreibersder Betreiber veröffentlicht keine IP Liste, oder die Prüfung ist aus(3xx ohne 304 + 4xx + 5xx) / Anfragen von GooglebotAnfragen von Googlebot mit ? in der URL / Anfragen von GooglebotEine 304 Antwort zählt nicht als Verschwendung: Der Leitfaden von Google zum Crawl Budget empfiehlt 304, damit Googlebot die Kopie aus dem Cache nutzen kann.
Was schließt das Tool aus einzelnen Logzeilen?
Die Zeilen stammen aus den Beispieldaten. Jede zeigt eine Anfrage, das Ergebnis des Tools und den nächsten Schritt.
| Logzeile (kurz) | Ergebnis | Was tun |
|---|---|---|
| 66.249.66.1, User Agent Googlebot Smartphone | Bestätigt: Die IP liegt in der Liste der Google Crawler | Nichts; echte Crawling Aktivität |
| 192.0.2.44, User Agent Googlebot | Gefälscht: Keine Liste von Google enthält die IP | In der Firewall begrenzen oder sperren, nicht per robots.txt |
| 20.171.207.12, User Agent GPTBot | Bestätigt: Trainingscrawler von OpenAI | GPTBot in der robots.txt nach Ihrer Richtlinie erlauben oder sperren |
| 104.210.139.200, User Agent ChatGPT-User | Bestätigt: Abruf im Auftrag eines Nutzers | Die Seite als Thema sehen, zu dem Menschen ChatGPT fragen |
| 198.51.100.5, User Agent YandexBot | Nicht prüfbar: Yandex veröffentlicht keine IP Liste | Bei Bedarf per Reverse DNS prüfen |
| Googlebot GET /alte-seite/ mit Status 301 | Crawl Verschwendung | Interne Links und Sitemap auf die Ziel URL umstellen |
Das Beispiellog ist erfunden. Besucher und Nachahmer stammen aus Dokumentationsbereichen (RFC 5737, RFC 3849) und gehören keiner realen Person.
Welche KI Crawler und Tokens sollten Sie kennen?
Die Tabelle zeigt die KI Crawler, die das Tool erkennt. Zwei Zeilen sind reine Tokens für die robots.txt: Google-Extended und Applebot-Extended erscheinen nie als User Agent in Ihrem Log.
| Name | Betreiber | Kategorie | Token in robots.txt | IP Liste |
|---|---|---|---|---|
| GPTBot | OpenAI | KI Training | GPTBot | Ja |
| OAI-SearchBot | OpenAI | KI Suche | OAI-SearchBot | Ja |
| ChatGPT-User | OpenAI | Vom Nutzer ausgelöst | ChatGPT-User (greift eventuell nicht) | Ja |
| ClaudeBot | Anthropic | KI Training | ClaudeBot | Ja |
| Claude-SearchBot | Anthropic | KI Suche | Claude-SearchBot | Ja |
| Claude-User | Anthropic | Vom Nutzer ausgelöst | Claude-User | Ja |
| PerplexityBot | Perplexity | KI Suche | PerplexityBot | Ja |
| Perplexity-User | Perplexity | Vom Nutzer ausgelöst | Perplexity-User (meist ignoriert) | Ja |
| CCBot | Common Crawl | KI Training | CCBot | Ja |
| Meta-ExternalAgent | Meta | KI Training | meta-externalagent | Nein |
| Amazonbot | Amazon | KI Training | Amazonbot | Nur als Webseite |
| Google-Extended | Nur Token | Google-Extended | Kein Crawler | |
| Applebot-Extended | Apple | Nur Token | Applebot-Extended | Kein Crawler |
Talha Aslan und das Team haben Namen, Rollen und Listen am 29. September 2026 mit den offiziellen Seiten von OpenAI, Anthropic, Perplexity, Google, Apple, Common Crawl, Meta und Amazon abgeglichen. ByteDance veröffentlicht zu Bytespider keine Dokumentation, deshalb führt das Tool ihn unter anderen Bots.
Was ist eine Logfile Analyse und warum zählt sie für SEO?
Eine Logfile Analyse liest das Access Log Ihres Webservers und zeigt, welcher Bot welche URL wann und mit welchem Ergebnis abgerufen hat. Die Search Console zeigt nur einen Ausschnitt der Crawling Aktivität. Ihr Server Log dagegen hält jede einzelne Anfrage fest, auch jene ohne Spur in den Berichten von Google.
Deshalb ist das Log die ehrlichste Quelle für technisches SEO. Zum Beispiel sehen Sie, ob Googlebot seine Besuche in Produktseiten investiert oder in Filter URLs, Weiterleitungen und Fehler. Außerdem zeigt das Log, welche KI Crawler Ihre Inhalte lesen und ob ein Besucher, der sich Googlebot nennt, wirklich von Google kommt.
Talha Aslan und das Team nutzen Logdateien in jedem technischen Audit unserer SEO Beratung. Dieses Tool bringt den ersten Blick in Ihren Browser. Es lädt die Datei nirgendwohin hoch. Die Analyse läuft auf Ihrem Gerät, also können Sie auch vertrauliche Logs prüfen.
Woher bekommen Sie Ihre Server Logs?
Die meisten Hoster speichern ein Access Log pro Website. Im Shared Hosting mit cPanel öffnen Sie unter Metrics den Bereich Raw Access und laden dort das aktuelle Log oder die .gz Archive herunter. Schalten Sie zuerst die Archivierung ein, denn sonst löscht cPanel alte Daten nach jedem Statistiklauf.
Auf einem eigenen Server schreibt Apache meist nach /var/log/apache2/access.log und Nginx nach /var/log/nginx/access.log. Ältere Tage enden auf .1 oder .gz, und Sie können alle zusammen ablegen. Hinter einem CDN sieht Ihr Server allerdings nur den Verkehr, der durchkommt. Nutzen Sie dann die Logs am Edge: Cloudflare Logpush schreibt JSON Zeilen, und AWS legt Logs von ALB und CloudFront in S3 ab.
Das Tool erkennt combined und common, IIS W3C, ALB, CloudFront, Cloudflare und Caddy selbst. Halten Sie zudem mindestens eine Woche an Daten bereit. Ein einzelner Tag verdeckt Muster wie das wöchentliche Crawling Ihrer Sitemap.
Wie erkennt die Logfile Analyse gefälschte Googlebots?
Jeder kann Googlebot in einen User Agent schreiben. Scraper und Schwachstellenscanner tun genau das, weil viele Websites Google ohne Limit durchlassen. Der User Agent allein beweist also nichts.
Google beschreibt auf seiner Seite zur Verifizierung zwei Wege. Erstens muss ein Reverse DNS Lookup der IP einen Host unter googlebot.com, google.com oder googleusercontent.com liefern. Der Forward Lookup dieses Hosts muss dann dieselbe IP ergeben. Zweitens veröffentlicht Google für große Logs JSON Dateien mit seinen IP Bereichen; Sie gleichen jede Adresse damit ab.
Diese Logfile Analyse nutzt den zweiten Weg. Unser Server lädt täglich die offiziellen Listen von Google, Bing, OpenAI, Anthropic, Perplexity, Apple, DuckDuckGo, Common Crawl und Ahrefs. Ihr Browser gleicht dann jede Botadresse damit ab, für IPv4 und IPv6. Ein Treffer heißt bestätigt. Ein Botname von einer Adresse außerhalb der Listen des Betreibers heißt gefälscht. Nicht prüfbar gilt für Betreiber ohne Liste wie Yandex, Baidu oder Meta; dort hilft Reverse DNS.
Welche KI Crawler tauchen in Ihren Logs auf?
KI Bots fallen in drei Gruppen, und jede Gruppe verlangt eine eigene Entscheidung. Trainingscrawler wie GPTBot, ClaudeBot und CCBot sammeln Seiten für das Modelltraining. Suchcrawler wie OAI-SearchBot, Claude-SearchBot und PerplexityBot bauen den Index hinter KI Antworten auf. Nutzeragenten wie ChatGPT-User, Claude-User und Perplexity-User rufen eine Seite ab, weil eine Person gerade eine Frage stellt.
Die letzte Gruppe verdient besondere Aufmerksamkeit. Ein Abruf durch ChatGPT-User ist kein Crawling, sondern Nachfrage. Daher listet der Reiter KI Crawler die Seiten, die diese Agenten am häufigsten öffnen. OpenAI und Perplexity weisen zudem darauf hin, dass solche Anfragen die robots.txt nicht immer beachten, denn eine Person hat sie ausgelöst.
Zwei Namen tauchen nie im Log auf. Google-Extended und Applebot-Extended sind reine Tokens für die robots.txt; laut Apple crawlt Applebot-Extended nicht. Ihre Regeln schreiben Sie mit unserem robots.txt Generator, und unser Ratgeber zu KI Crawlern, robots.txt und llms.txt erklärt die Hintergründe.
Was zählt als verschwendetes Crawl Budget?
Laut dem Leitfaden von Google zum Crawl Budget bestimmen Crawling Kapazität und Crawling Bedarf, wie viel Google crawlt. Der Leitfaden richtet sich an große Websites; trotzdem profitiert jede Website, wenn Googlebot seine Besuche auf wichtige Seiten lenkt. Ihr Log zeigt, wohin diese Besuche gehen.
Das Tool zählt Weiterleitungen (3xx), Clientfehler (4xx) und Serverfehler (5xx) als Verschwendung und zeigt ihren Anteil an allen Anfragen von Googlebot. Eine 304 Antwort ist die Ausnahme: Sie sagt Google, dass es die Kopie aus dem Cache nutzen kann, und spart so Ressourcen. Serverfehler haben noch eine zweite Wirkung; laut Google bremsen 5xx Antworten und 429 Signale den Googlebot.
In der Praxis schauen Sie in der Tabelle pro URL auf die Spalte Verschwendung. Alte URLs, die Googlebot weiter abruft, stehen meist noch in internen Links oder in der Sitemap; korrigieren Sie zuerst diese Links. Prüfen Sie danach Weiterleitungsketten mit unserem Redirect Checker und schauen Sie auf URLs mit Parametern, weil Filter und Sortierungen dieselbe Seite vervielfachen können.
Wie vergleichen Sie das Log mit Ihrer Sitemap?
Ihre Sitemap nennt die URLs, die in den Index sollen, während das Log die URLs zeigt, die Googlebot tatsächlich abruft. Der Reiter Sitemap stellt beides nebeneinander und liefert zwei Listen.
Die erste Liste enthält URLs aus der Sitemap, die Googlebot im Logzeitraum nie abgerufen hat. Diese Seiten sind vielleicht neu, schwach verlinkt oder aus Sicht von Google wenig wertvoll. Setzen Sie interne Links und prüfen Sie den Status im Tool zur URL Prüfung; unsere Search Console Anleitung erklärt die Schritte.
Die zweite Liste zeigt HTML Seiten mit Status 200, die Googlebot abruft, obwohl die Sitemap sie nicht enthält. Manche gehören in die Sitemap; andere, etwa interne Suchergebnisse, sollten eher aus dem Crawling verschwinden. Ist Ihre Sitemap veraltet, erstellen Sie mit unserem XML Sitemap Generator eine saubere Version. Das Tool liest über unseren Server bis zu 5.000 URLs der Sitemap und vergleicht Pfade, der Hostname spielt also keine Rolle.
Dürfen Sie Logs mit IP Adressen analysieren?
Access Logs enthalten IP Adressen, und nach der DSGVO kann eine IP Adresse als personenbezogenes Datum gelten. Deshalb verarbeitet dieses Tool die Datei nur in Ihrem Browser. Das Log erreicht unseren Server nie; nach außen gehen nur die Abrufe der offiziellen Bot Listen und, wenn Sie es wünschen, Ihrer Sitemap.
Gehen Sie trotzdem sorgsam mit Logdateien um. Geben Sie sie nur an Personen weiter, die sie brauchen. Bewahren Sie sie nicht länger auf, als Ihre Datenschutzerklärung nennt. Kürzen Sie außerdem Besucheradressen vor dem Versand an eine Agentur. Zum Beispiel machen Sie aus 203.0.113.25 die Adresse 203.0.113.0. Bot Adressen aus den offiziellen Listen gehören zu Firmennetzen; für die Prüfung können Sie diese unverändert lassen.
Wenn Sie die Ergebnisse mit Fachleuten lesen möchten, verbindet unser Team die Logdaten mit der Search Console und einem Crawl der Website. Am Ende steht so eine kurze Liste konkreter Korrekturen statt eines weiteren Berichts.
Häufige Fehler bei der Logfile Analyse
- ✕FehlerNur dem User Agent vertrauen✓Besser soPrüfen Sie die IP Adresse mit der offiziellen Liste oder per Reverse DNS; gefälschte Googlebots sind häufig.
- ✕Fehler304 Antworten als Verschwendung zählen✓Besser soFühren Sie 304 getrennt: Googlebot nutzt so die Kopie aus dem Cache und spart Ressourcen.
- ✕FehlerChatGPT-User sperren, um ChatGPT zu verlassen✓Besser soEntscheiden Sie pro Bot: GPTBot steuert das Training, OAI-SearchBot die Suche, und Abrufe im Nutzerauftrag beachten die robots.txt eventuell nicht.
- ✕FehlerNach einem einzigen Tag urteilen✓Besser soWerten Sie mindestens 7, besser 30 Tage aus, damit Wochenmuster und Effekte von Releases sichtbar sind.
- ✕FehlerRohe Logs per E-Mail verschicken✓Besser soKürzen Sie zuerst die IP Adressen der Besucher und teilen Sie nur den Zeitraum und die Felder, die jemand braucht.
Häufig gestellte Fragen
Zeigen Ihre Logs ein Crawling Problem?
Talha Aslan und das Team prüfen Logs, Search Console Daten und Seitenstruktur gemeinsam und lenken das Crawl Budget auf die wichtigen Seiten.





