Tools

Logfile Analyse für SEO

Mit dieser Logfile Analyse sehen Sie, was Googlebot und KI Crawler wirklich von Ihrem Server abrufen und wie oft. Gefälschte Bots erkennen Sie über die offiziellen IP Listen, dazu verschwendetes Crawl Budget und Lücken zur Sitemap. Das Log bleibt in Ihrem Browser.

Server Access LogApache, Nginx, IIS, Cloudflare, AWS, Caddy; .log und .gz
Wird in Ihrem Browser verarbeitet; das Log wird nicht hochgeladen.

Die Beispieldaten sind erfunden: ein Log über 14 Tage eines fiktiven Schuhgeschäfts, erzeugt in Ihrem Browser. Bot Adressen stammen aus den offiziellen Listen, Besucher und Nachahmer aus Dokumentationsbereichen.

Einstellungen
Die meisten Logs werden automatisch erkannt. Falls nicht, wählen Sie das Format hier.

Ein einzelner Tag sagt wenig; laden Sie mindestens 7, besser 30 Tage hoch.

Ergebnis

Log Bericht Wartet
Anfragen gesamt0-
Botanteil0-
Eindeutige URLs0-
Googlebot0-
Gefälschte Bots0-
Laden Sie eine Logdatei hoch oder öffnen Sie die Beispieldaten; Bots, das Crawling von Googlebot und KI Crawler erscheinen hier.
Verfasst von
  • Online Marketing Berater
  • Google Partner
  • Full Stack Developer
Zuletzt aktualisiert
Grundlage
5 Quellen

Logfile Analyse für SEO: So funktioniert es

  1. Access Logs herunterladen

    Laden Sie bei Ihrem Hoster, auf Ihrem Server oder beim CDN mindestens 7, besser 30 Tage Access Logs herunter. Rohdateien, ältere .gz Archive und mehrere Dateien auf einmal funktionieren.

  2. Dateien ablegen

    Ziehen Sie die Dateien auf das Upload Feld oder wählen Sie sie aus. Das Tool liest sie Stück für Stück in Ihrem Browser, deshalb bleiben auch sehr große Logs auf Ihrem Gerät.

  3. Format und Prüfung kontrollieren

    Das Tool erkennt das Format selbst. Lassen Sie die IP Prüfung an. Dann lädt das Tool nur die offiziellen IP Listen und markiert jeden Bot als bestätigt, gefälscht oder nicht prüfbar.

  4. Die vier Reiter lesen

    Beginnen Sie mit der Übersicht. Danach zeigt der Reiter Googlebot Statuscodes und Verschwendung, der Reiter KI Crawler Training, Suche und Nutzeragenten und der Reiter Sitemap die Lücken.

  5. Exportieren und handeln

    Laden Sie jede Tabelle als CSV. Beheben Sie Weiterleitungen und Fehler, auf die Googlebot immer wieder trifft, und wiederholen Sie die Analyse nach jedem Release.

Wie berechnet das Tool seine Werte?

Jede Zahl stammt aus den Zeilen Ihres Logs. Das Tool entfernt gefälschte Bots, bevor es die Werte für Googlebot und KI Crawler zählt.

BotanteilBotanfragen / alle Anfragen
BestätigtIP Adresse liegt in der veröffentlichten CIDR Liste des Betreibers
Gefälscht (UA Imitat)Botname im User Agent, IP außerhalb jeder Liste dieses Betreibers
Nicht prüfbarder Betreiber veröffentlicht keine IP Liste, oder die Prüfung ist aus
Crawl Verschwendung(3xx ohne 304 + 4xx + 5xx) / Anfragen von Googlebot
Anteil URLs mit ParameternAnfragen von Googlebot mit ? in der URL / Anfragen von Googlebot

Eine 304 Antwort zählt nicht als Verschwendung: Der Leitfaden von Google zum Crawl Budget empfiehlt 304, damit Googlebot die Kopie aus dem Cache nutzen kann.

Was schließt das Tool aus einzelnen Logzeilen?

Die Zeilen stammen aus den Beispieldaten. Jede zeigt eine Anfrage, das Ergebnis des Tools und den nächsten Schritt.

Logzeile (kurz)ErgebnisWas tun
66.249.66.1, User Agent Googlebot SmartphoneBestätigt: Die IP liegt in der Liste der Google CrawlerNichts; echte Crawling Aktivität
192.0.2.44, User Agent GooglebotGefälscht: Keine Liste von Google enthält die IPIn der Firewall begrenzen oder sperren, nicht per robots.txt
20.171.207.12, User Agent GPTBotBestätigt: Trainingscrawler von OpenAIGPTBot in der robots.txt nach Ihrer Richtlinie erlauben oder sperren
104.210.139.200, User Agent ChatGPT-UserBestätigt: Abruf im Auftrag eines NutzersDie Seite als Thema sehen, zu dem Menschen ChatGPT fragen
198.51.100.5, User Agent YandexBotNicht prüfbar: Yandex veröffentlicht keine IP ListeBei Bedarf per Reverse DNS prüfen
Googlebot GET /alte-seite/ mit Status 301Crawl VerschwendungInterne Links und Sitemap auf die Ziel URL umstellen

Das Beispiellog ist erfunden. Besucher und Nachahmer stammen aus Dokumentationsbereichen (RFC 5737, RFC 3849) und gehören keiner realen Person.

Welche KI Crawler und Tokens sollten Sie kennen?

Die Tabelle zeigt die KI Crawler, die das Tool erkennt. Zwei Zeilen sind reine Tokens für die robots.txt: Google-Extended und Applebot-Extended erscheinen nie als User Agent in Ihrem Log.

NameBetreiberKategorieToken in robots.txtIP Liste
GPTBotOpenAIKI TrainingGPTBotJa
OAI-SearchBotOpenAIKI SucheOAI-SearchBotJa
ChatGPT-UserOpenAIVom Nutzer ausgelöstChatGPT-User (greift eventuell nicht)Ja
ClaudeBotAnthropicKI TrainingClaudeBotJa
Claude-SearchBotAnthropicKI SucheClaude-SearchBotJa
Claude-UserAnthropicVom Nutzer ausgelöstClaude-UserJa
PerplexityBotPerplexityKI SuchePerplexityBotJa
Perplexity-UserPerplexityVom Nutzer ausgelöstPerplexity-User (meist ignoriert)Ja
CCBotCommon CrawlKI TrainingCCBotJa
Meta-ExternalAgentMetaKI Trainingmeta-externalagentNein
AmazonbotAmazonKI TrainingAmazonbotNur als Webseite
Google-ExtendedGoogleNur TokenGoogle-ExtendedKein Crawler
Applebot-ExtendedAppleNur TokenApplebot-ExtendedKein Crawler

Talha Aslan und das Team haben Namen, Rollen und Listen am 29. September 2026 mit den offiziellen Seiten von OpenAI, Anthropic, Perplexity, Google, Apple, Common Crawl, Meta und Amazon abgeglichen. ByteDance veröffentlicht zu Bytespider keine Dokumentation, deshalb führt das Tool ihn unter anderen Bots.

Was ist eine Logfile Analyse und warum zählt sie für SEO?

Eine Logfile Analyse liest das Access Log Ihres Webservers und zeigt, welcher Bot welche URL wann und mit welchem Ergebnis abgerufen hat. Die Search Console zeigt nur einen Ausschnitt der Crawling Aktivität. Ihr Server Log dagegen hält jede einzelne Anfrage fest, auch jene ohne Spur in den Berichten von Google.

Deshalb ist das Log die ehrlichste Quelle für technisches SEO. Zum Beispiel sehen Sie, ob Googlebot seine Besuche in Produktseiten investiert oder in Filter URLs, Weiterleitungen und Fehler. Außerdem zeigt das Log, welche KI Crawler Ihre Inhalte lesen und ob ein Besucher, der sich Googlebot nennt, wirklich von Google kommt.

Talha Aslan und das Team nutzen Logdateien in jedem technischen Audit unserer SEO Beratung. Dieses Tool bringt den ersten Blick in Ihren Browser. Es lädt die Datei nirgendwohin hoch. Die Analyse läuft auf Ihrem Gerät, also können Sie auch vertrauliche Logs prüfen.

Woher bekommen Sie Ihre Server Logs?

Die meisten Hoster speichern ein Access Log pro Website. Im Shared Hosting mit cPanel öffnen Sie unter Metrics den Bereich Raw Access und laden dort das aktuelle Log oder die .gz Archive herunter. Schalten Sie zuerst die Archivierung ein, denn sonst löscht cPanel alte Daten nach jedem Statistiklauf.

Auf einem eigenen Server schreibt Apache meist nach /var/log/apache2/access.log und Nginx nach /var/log/nginx/access.log. Ältere Tage enden auf .1 oder .gz, und Sie können alle zusammen ablegen. Hinter einem CDN sieht Ihr Server allerdings nur den Verkehr, der durchkommt. Nutzen Sie dann die Logs am Edge: Cloudflare Logpush schreibt JSON Zeilen, und AWS legt Logs von ALB und CloudFront in S3 ab.

Das Tool erkennt combined und common, IIS W3C, ALB, CloudFront, Cloudflare und Caddy selbst. Halten Sie zudem mindestens eine Woche an Daten bereit. Ein einzelner Tag verdeckt Muster wie das wöchentliche Crawling Ihrer Sitemap.

Wie erkennt die Logfile Analyse gefälschte Googlebots?

Jeder kann Googlebot in einen User Agent schreiben. Scraper und Schwachstellenscanner tun genau das, weil viele Websites Google ohne Limit durchlassen. Der User Agent allein beweist also nichts.

Google beschreibt auf seiner Seite zur Verifizierung zwei Wege. Erstens muss ein Reverse DNS Lookup der IP einen Host unter googlebot.com, google.com oder googleusercontent.com liefern. Der Forward Lookup dieses Hosts muss dann dieselbe IP ergeben. Zweitens veröffentlicht Google für große Logs JSON Dateien mit seinen IP Bereichen; Sie gleichen jede Adresse damit ab.

Diese Logfile Analyse nutzt den zweiten Weg. Unser Server lädt täglich die offiziellen Listen von Google, Bing, OpenAI, Anthropic, Perplexity, Apple, DuckDuckGo, Common Crawl und Ahrefs. Ihr Browser gleicht dann jede Botadresse damit ab, für IPv4 und IPv6. Ein Treffer heißt bestätigt. Ein Botname von einer Adresse außerhalb der Listen des Betreibers heißt gefälscht. Nicht prüfbar gilt für Betreiber ohne Liste wie Yandex, Baidu oder Meta; dort hilft Reverse DNS.

Welche KI Crawler tauchen in Ihren Logs auf?

KI Bots fallen in drei Gruppen, und jede Gruppe verlangt eine eigene Entscheidung. Trainingscrawler wie GPTBot, ClaudeBot und CCBot sammeln Seiten für das Modelltraining. Suchcrawler wie OAI-SearchBot, Claude-SearchBot und PerplexityBot bauen den Index hinter KI Antworten auf. Nutzeragenten wie ChatGPT-User, Claude-User und Perplexity-User rufen eine Seite ab, weil eine Person gerade eine Frage stellt.

Die letzte Gruppe verdient besondere Aufmerksamkeit. Ein Abruf durch ChatGPT-User ist kein Crawling, sondern Nachfrage. Daher listet der Reiter KI Crawler die Seiten, die diese Agenten am häufigsten öffnen. OpenAI und Perplexity weisen zudem darauf hin, dass solche Anfragen die robots.txt nicht immer beachten, denn eine Person hat sie ausgelöst.

Zwei Namen tauchen nie im Log auf. Google-Extended und Applebot-Extended sind reine Tokens für die robots.txt; laut Apple crawlt Applebot-Extended nicht. Ihre Regeln schreiben Sie mit unserem robots.txt Generator, und unser Ratgeber zu KI Crawlern, robots.txt und llms.txt erklärt die Hintergründe.

Was zählt als verschwendetes Crawl Budget?

Laut dem Leitfaden von Google zum Crawl Budget bestimmen Crawling Kapazität und Crawling Bedarf, wie viel Google crawlt. Der Leitfaden richtet sich an große Websites; trotzdem profitiert jede Website, wenn Googlebot seine Besuche auf wichtige Seiten lenkt. Ihr Log zeigt, wohin diese Besuche gehen.

Das Tool zählt Weiterleitungen (3xx), Clientfehler (4xx) und Serverfehler (5xx) als Verschwendung und zeigt ihren Anteil an allen Anfragen von Googlebot. Eine 304 Antwort ist die Ausnahme: Sie sagt Google, dass es die Kopie aus dem Cache nutzen kann, und spart so Ressourcen. Serverfehler haben noch eine zweite Wirkung; laut Google bremsen 5xx Antworten und 429 Signale den Googlebot.

In der Praxis schauen Sie in der Tabelle pro URL auf die Spalte Verschwendung. Alte URLs, die Googlebot weiter abruft, stehen meist noch in internen Links oder in der Sitemap; korrigieren Sie zuerst diese Links. Prüfen Sie danach Weiterleitungsketten mit unserem Redirect Checker und schauen Sie auf URLs mit Parametern, weil Filter und Sortierungen dieselbe Seite vervielfachen können.

Wie vergleichen Sie das Log mit Ihrer Sitemap?

Ihre Sitemap nennt die URLs, die in den Index sollen, während das Log die URLs zeigt, die Googlebot tatsächlich abruft. Der Reiter Sitemap stellt beides nebeneinander und liefert zwei Listen.

Die erste Liste enthält URLs aus der Sitemap, die Googlebot im Logzeitraum nie abgerufen hat. Diese Seiten sind vielleicht neu, schwach verlinkt oder aus Sicht von Google wenig wertvoll. Setzen Sie interne Links und prüfen Sie den Status im Tool zur URL Prüfung; unsere Search Console Anleitung erklärt die Schritte.

Die zweite Liste zeigt HTML Seiten mit Status 200, die Googlebot abruft, obwohl die Sitemap sie nicht enthält. Manche gehören in die Sitemap; andere, etwa interne Suchergebnisse, sollten eher aus dem Crawling verschwinden. Ist Ihre Sitemap veraltet, erstellen Sie mit unserem XML Sitemap Generator eine saubere Version. Das Tool liest über unseren Server bis zu 5.000 URLs der Sitemap und vergleicht Pfade, der Hostname spielt also keine Rolle.

Dürfen Sie Logs mit IP Adressen analysieren?

Access Logs enthalten IP Adressen, und nach der DSGVO kann eine IP Adresse als personenbezogenes Datum gelten. Deshalb verarbeitet dieses Tool die Datei nur in Ihrem Browser. Das Log erreicht unseren Server nie; nach außen gehen nur die Abrufe der offiziellen Bot Listen und, wenn Sie es wünschen, Ihrer Sitemap.

Gehen Sie trotzdem sorgsam mit Logdateien um. Geben Sie sie nur an Personen weiter, die sie brauchen. Bewahren Sie sie nicht länger auf, als Ihre Datenschutzerklärung nennt. Kürzen Sie außerdem Besucheradressen vor dem Versand an eine Agentur. Zum Beispiel machen Sie aus 203.0.113.25 die Adresse 203.0.113.0. Bot Adressen aus den offiziellen Listen gehören zu Firmennetzen; für die Prüfung können Sie diese unverändert lassen.

Wenn Sie die Ergebnisse mit Fachleuten lesen möchten, verbindet unser Team die Logdaten mit der Search Console und einem Crawl der Website. Am Ende steht so eine kurze Liste konkreter Korrekturen statt eines weiteren Berichts.

Häufige Fehler bei der Logfile Analyse

  • FehlerNur dem User Agent vertrauenBesser soPrüfen Sie die IP Adresse mit der offiziellen Liste oder per Reverse DNS; gefälschte Googlebots sind häufig.
  • Fehler304 Antworten als Verschwendung zählenBesser soFühren Sie 304 getrennt: Googlebot nutzt so die Kopie aus dem Cache und spart Ressourcen.
  • FehlerChatGPT-User sperren, um ChatGPT zu verlassenBesser soEntscheiden Sie pro Bot: GPTBot steuert das Training, OAI-SearchBot die Suche, und Abrufe im Nutzerauftrag beachten die robots.txt eventuell nicht.
  • FehlerNach einem einzigen Tag urteilenBesser soWerten Sie mindestens 7, besser 30 Tage aus, damit Wochenmuster und Effekte von Releases sichtbar sind.
  • FehlerRohe Logs per E-Mail verschickenBesser soKürzen Sie zuerst die IP Adressen der Besucher und teilen Sie nur den Zeitraum und die Felder, die jemand braucht.

Häufig gestellte Fragen

Zeigen Ihre Logs ein Crawling Problem?

Talha Aslan und das Team prüfen Logs, Search Console Daten und Seitenstruktur gemeinsam und lenken das Crawl Budget auf die wichtigen Seiten.

SEO Service ansehen

Ähnliche Tools

Alle Tools (83)
SEO CheckPrüfen Sie Title, Meta Description, Überschriften, Canonical, Indexierbarkeit und Ladezeit einer URL kostenlos und erhalten Sie einen SEO Score mit konkreten Aufgaben.
KI Sichtbarkeit prüfenBewertet, ob ChatGPT, Perplexity und Google AI Overviews Ihre Seite lesen und zitieren können: KI Crawler in der robots.txt, llms.txt, Schema, Struktur und Inhalt ohne JavaScript.
Robots.txt GeneratorErstellen Sie die richtige robots.txt in Minuten mit fertigen Vorlagen.
Weiterleitungen zuordnenOrdnet alte und defekte URLs nach Pfad und Titel der passenden Seite Ihrer Sitemap zu, mit Übereinstimmungswert, und erstellt 301 Weiterleitungen für .htaccess, nginx oder CSV.
Whois Abfrage & Domain AlterZeigt kostenlos, bei welchem Registrar eine Domain liegt, wann sie registriert wurde, wann sie ausläuft und ob sie noch frei ist.
Ist die Seite down? CheckIst die Seite für alle down oder nur bei Ihnen? Statuscode, Antwortzeit, DNS und SSL in Sekunden prüfen, mit klaren Tipps.