Künstliche Intelligenz

KI Crawler verstehen: GPTBot, ClaudeBot und PerplexityBot mit robots.txt und llms.txt steuern

Talha AslanTalha Aslan 17 Min. Lesezeit 1 Aufrufe

Was ist ein KI Crawler und warum besucht er Ihre Website?

Ein KI Crawler ist ein automatischer Bot, den ein KI Unternehmen zum Lesen von Webseiten schickt; manche sammeln Inhalte für das Modelltraining, manche indexieren Seiten, damit die KI Suche sie als Quelle nennt, und manche öffnen eine Seite genau dann, wenn ein Nutzer eine Frage stellt. Deshalb ist eine einzige Sperrregel für alle ein Fehler.

Wenn ich Serverlogs prüfe, sehe ich hier die deutlichste Veränderung der letzten Jahre: Neben Googlebot und Bingbot tauchen inzwischen regelmäßig Namen wie GPTBot, ClaudeBot und PerplexityBot auf. Außerdem fügen viele Betreiber einen Block in die robots.txt ein, der entweder alle Bots aussperrt oder allen die Tür öffnet, ohne zu wissen, was jeder Bot tut. In diesem Leitfaden fasse ich für jeden KI Crawler zusammen, was die offizielle Dokumentation sagt, und zeige Ihnen danach Schritt für Schritt, wie Sie mit robots.txt und llms.txt eine Richtlinie aufbauen.

Wie unterscheiden sich KI Crawler von klassischen Suchbots?

Ein klassischer Suchbot crawlt Ihre Seite, nimmt sie in den Index auf und zeigt sie als Link in den Ergebnissen. Dafür erhalten Sie Traffic; der Tausch ist also klar. Bei KI Crawlern funktioniert dieser Tausch jedoch auf drei verschiedene Arten, und jede bringt Ihnen etwas anderes.

Ein Trainingsbot liest zum Beispiel Ihre Inhalte, aber weil sie im allgemeinen Wissen eines Modells aufgehen, schickt er Ihnen keinen direkten Link. Ein Suchbot kann Ihre Website dagegen in Produkten wie ChatGPT Search oder Perplexity als Quellenkarte zeigen. Der vom Nutzer ausgelöste Agent öffnet schließlich nur eine Seite, um die aktuelle Frage zu beantworten. Daher greift die Frage "Erlauben wir KI?" zu kurz; die richtige Frage lautet "Welchen Zweck erlauben wir?"

Die allgemeinen Folgen dieser Entwicklung für die Technik habe ich im Beitrag über technisches SEO nach der KI Wende beschrieben. Hier konzentriere ich mich deshalb nur auf die Bots, die robots.txt Regeln und die Datei llms.txt.

Nach welchen drei Aufgaben sollten Sie KI Crawler gruppieren?

Wenn Sie die offiziellen Dokumente nebeneinander legen, sehen Sie, dass die Unternehmen ihre Bots in fast dieselben drei Kategorien teilen. Ich empfehle Ihnen, Ihre Richtlinie ebenfalls darauf aufzubauen, denn jede Kategorie hat ein anderes geschäftliches Ergebnis.

  1. Trainingsbots: Sie sammeln Inhalte, um künftige Modelle zu trainieren. GPTBot und ClaudeBot gehören dazu; Google-Extended und Applebot-Extended steuern dieselbe Entscheidung dagegen als Token und nicht als eigener Bot.
  2. Suchbots: Sie indexieren Seiten, damit die KI Suche sie zitieren kann. OAI-SearchBot, Claude-SearchBot und PerplexityBot gehören dazu.
  3. Nutzeragenten: Sie öffnen eine Seite auf Abruf, wenn ein Nutzer fragt oder einen Link teilt. ChatGPT-User, Claude-User und Perplexity-User gehören dazu.

Kurz gesagt: Wenn Sie einen Trainingsbot sperren, verschwinden Sie nicht automatisch aus der Suche. Sperren Sie jedoch einen Suchbot, sinkt Ihre Chance deutlich, in den Antworten dieses Produkts als Quelle aufzutauchen.

Was machen GPTBot, OAI-SearchBot und ChatGPT-User von OpenAI?

OpenAI beschreibt jeden Bot einzeln in seiner offiziellen Bot Dokumentation. GPTBot sammelt Inhalte für das Training generativer Basismodelle. OAI-SearchBot sorgt dagegen dafür, dass Websites in den Suchergebnissen von ChatGPT erscheinen können. Beide befolgen robots.txt, und zudem gilt: Laut OpenAI kann es nach einer Änderung etwa 24 Stunden dauern, bis die Systeme sie übernehmen.

ChatGPT-User funktioniert anders: Er öffnet Seiten bei Aktionen, die ein Nutzer in ChatGPT oder in eigenen GPTs startet. OpenAI macht dazu zwei wichtige Anmerkungen. Erstens gelten robots.txt Regeln hier möglicherweise nicht, weil der Nutzer die Aktion auslöst. Zweitens nutzt OpenAI ChatGPT-User nicht, um zu entscheiden, ob Inhalte in der Suche erscheinen.

Praktisch ziehe ich daraus diesen Schluss: Wenn Sie in ChatGPT Search als Quelle erscheinen möchten, sollten Sie OAI-SearchBot zulassen. Die Entscheidung über GPTBot treffen Sie hingegen getrennt, je nach Ihrer Haltung zur Nutzung im Training. Die Dokumentation nennt außerdem OAI-AdsBot, der Zielseiten von Anzeigen prüft; schalten Sie dort keine Anzeigen, begegnen Sie ihm kaum.

Einen häufigen Fehler möchte ich ebenfalls erwähnen: Manche Websites schreiben einen Botnamen falsch oder nennen nur einen veralteten Namen. Sie müssen jeden Bot genau so schreiben wie in der Dokumentation, in einer eigenen Zeile mit User-agent; sonst greift die Regel nie.

Warum trennt Anthropic ClaudeBot, Claude-SearchBot und Claude-User?

Anthropic definiert auf seiner Supportseite drei Bots. ClaudeBot sammelt Webinhalte, die zum Training der generativen Modelle beitragen können. Claude-SearchBot durchsucht das Web, um die Qualität der Suchergebnisse und die Relevanz der Antworten von Claude zu verbessern. Claude-User ermöglicht schließlich den Zugriff auf Websites, wenn ein Nutzer eine Frage stellt.

Anthropic schreibt klar, dass alle drei Bots robots.txt befolgen und dass Sie jeden einzeln sperren können. Zudem unterstützt das Unternehmen die nicht standardisierte Erweiterung Crawl-delay; wenn Ihr Server unter Last leidet, können Sie also eine Wartezeit zwischen den Anfragen von ClaudeBot festlegen.

Ein weiteres Detail ist außerdem wichtig: Anthropic erinnert daran, dass Sie die robots.txt für jede Subdomain bearbeiten müssen, die Sie einschränken wollen. So lesen blog.ihreseite.de und www.ihreseite.de verschiedene Dateien. Folglich müssen Sie bei Strukturen mit vielen Subdomains die Richtlinie für jede einzeln schreiben.

Worin unterscheiden sich PerplexityBot und Perplexity-User?

Perplexity beschreibt in seiner Entwicklerdokumentation zwei Agenten. PerplexityBot soll Websites in den Suchergebnissen von Perplexity anzeigen und verlinken, und das Unternehmen betont, dass es diesen Bot nicht zum Sammeln von Inhalten für KI Basismodelle nutzt. Dieser Bot befolgt also robots.txt.

Perplexity-User besucht dagegen eine Seite, wenn ein Nutzer eine Frage stellt, um eine genaue Antwort zu liefern. Laut Perplexity ignoriert dieser Agent robots.txt Regeln in der Regel, weil ein Nutzer den Abruf auslöst. Möchten Sie diesen Zugriff steuern, empfiehlt Perplexity die veröffentlichten IP Listen in Ihrer Firewall.

Wenn Sie in Perplexity als Quelle erscheinen möchten, sollten Sie PerplexityBot also nicht sperren. Die Dokumentation rät Betreibern sogar, diesen Bot zuzulassen und seine IP Bereiche freizugeben. Nutzen Sie eine Firewall oder einen Botschutz im CDN, prüfen Sie deshalb, ob diese Anfragen nicht versehentlich blockiert werden.

Warum sind Google-Extended und Applebot-Extended keine echten Bots?

Diese beiden Namen sorgen vor allem für Missverständnisse. Google schreibt in seiner Crawler Dokumentation, dass Google-Extended keinen eigenen HTTP User Agent hat, dass das Crawling mit den bestehenden Google User Agents läuft und dass der Name in der robots.txt nur als Steuerungstoken dient. Mit diesem Token entscheiden Sie, ob gecrawlte Inhalte für das Training der Gemini Modelle und für fundierte Antworten in Gemini Apps und Vertex AI genutzt werden dürfen.

Auf derselben Seite stellt Google klar, dass Google-Extended die Aufnahme in die Google Suche nicht beeinflusst und kein Rankingsignal ist. Mit anderen Worten: Wenn Sie dieses Token sperren, schadet das Ihren organischen Rankings nicht. Beachten Sie allerdings, dass es Googlebot auch nicht stoppt; Googlebot crawlt und indexiert Ihre Website weiterhin. Wer daher Googlebot sperrt, um aus dem Gemini Training herauszukommen, verliert vor allem organischen Traffic.

Apple geht ähnlich vor. Laut Apples Applebot Seite crawlt Applebot-Extended keine Webseiten; es legt fest, ob Daten, die der normale Applebot gesammelt hat, für das Training der generativen Modelle von Apple verwendet werden dürfen. Zudem berücksichtigt Apple Regeln für Applebot-Extended nicht beim Ranking in der Suche.

KI Crawler im Vergleich: die Tabelle

In der folgenden Tabelle habe ich nur zusammengetragen, was in den offiziellen Dokumenten steht. Gehen Sie sie am besten Zeile für Zeile durch und markieren Sie Ihre eigene Richtlinie.

NameUnternehmenAufgaberobots.txt
GPTBotOpenAIModelltrainingBefolgt
OAI-SearchBotOpenAISuchergebnisse in ChatGPTBefolgt
ChatGPT-UserOpenAINutzeraktionGilt möglicherweise nicht
ClaudeBotAnthropicModelltrainingBefolgt, unterstützt Crawl-delay
Claude-SearchBotAnthropicSuchqualitätBefolgt
Claude-UserAnthropicNutzerfrageBefolgt
PerplexityBotPerplexitySuchergebnisse in PerplexityBefolgt
Perplexity-UserPerplexityNutzerfrageIgnoriert in der Regel
Google-ExtendedGoogleToken für Gemini Training und GroundingNur Token, kein eigener Bot
Applebot-ExtendedAppleToken für das Training der Apple ModelleNur Token, crawlt nicht

Die wichtigste Lehre aus der Tabelle lautet: Nutzeragenten können Sie mit robots.txt nicht vollständig steuern. Für Inhalte, die wirklich privat bleiben müssen, sollten Sie daher eine Anmeldung oder eine serverseitige Zugriffskontrolle nutzen.

Stoppt robots.txt KI Crawler wirklich?

Die robots.txt ist kein Schloss, sondern eine Liste von Einladungen und Absagen. Zwar hat RFC 9309 das Robots Exclusion Protocol schriftlich festgehalten, doch die Einhaltung hängt vom Betreiber des Bots ab. Die genannten Unternehmen erklären offiziell, dass sie robots.txt befolgen; diese Aussage gilt allerdings nur für Bots, die ehrlich unter ihrem echten Namen auftreten.

Deshalb empfehle ich, robots.txt für zwei Zwecke zu nutzen. Erstens, um regelkonformen Unternehmen Ihre Absicht klar mitzuteilen. Zweitens, um Crawl Budget und Serverressourcen zu steuern. Andererseits schützt robots.txt allein keine sensiblen Daten, Kundenportale oder bezahlten Inhalte; weil die Datei öffentlich ist, verraten Sie außerdem die Namen der Ordner, die Sie verstecken wollen.

Zudem spielt das Caching eine Rolle. OpenAI nennt etwa 24 Stunden, bis Änderungen wirken, und andere Bots lesen die Datei ebenfalls in Abständen neu ein. Kurz gesagt: Messen Sie die Wirkung einer neuen Regel am nächsten Tag, nicht in der nächsten Minute.

Können Sie das Training sperren und trotzdem in der KI Suche erscheinen?

Ja, laut offizieller Dokumentation ist diese Trennung möglich, und für viele Marken ist sie die ausgewogenste Option. Sie schreiben Disallow für Trainingsbots und Allow für Suchbots. Dadurch gelangen Ihre Inhalte nicht in künftige Trainingsdaten, aber Sie behalten die Chance, in Antworten von ChatGPT Search, Claude und Perplexity als Quelle zu erscheinen.

Dennoch möchte ich ehrlich sein: Niemand kann genau messen, was der Verzicht auf Trainingsdaten langfristig für die Bekanntheit einer Marke bedeutet. Was ein Modell über Ihre Marke weiß, stammt teilweise aus Trainingsdaten. Für eine neue Marke, die Bekanntheit sucht, kann es also sinnvoll sein, Trainingsbots zuzulassen; für einen Verlag mit eigener Forschung oder bezahlten Inhalten ist die Sperre dagegen besser zu begründen.

Wie KI Antworten Ihre Marke erwähnen, ist eine eigene Aufgabe; darüber schreibe ich im Beitrag Marke in ChatGPT und Gemini sichtbar machen.

Wie schreiben Sie die robots.txt für drei verschiedene Richtlinien?

Die drei folgenden Vorlagen habe ich nach den Szenarien erstellt, die ich mit Kunden am häufigsten bespreche. Statt die Datei von Hand zu schreiben, können Sie im robots.txt Generator die Regeln auswählen und das Ergebnis kopieren.

Szenario 1, komplett offen: Sie schreiben keine eigene Regel für KI Crawler, und Ihre allgemeine Regel mit User-agent: * gilt. Das passt zu neuen Marken, die Bekanntheit aufbauen.

Szenario 2, Training gesperrt, Suche offen: Sie schreiben getrennte Blöcke wie diese.

  • GPTBot sperren: User-agent: GPTBot, danach Disallow: /
  • ClaudeBot sperren: User-agent: ClaudeBot, danach Disallow: /
  • Gemini Training ablehnen: User-agent: Google-Extended, danach Disallow: /
  • Apple Training ablehnen: User-agent: Applebot-Extended, danach Disallow: /
  • Suchbots zulassen: Allow: / für OAI-SearchBot, Claude-SearchBot und PerplexityBot

Szenario 3, selektiv: Sie lassen Blog und Ratgeber offen und sperren Ordner wie Preislisten, Kundenbereiche oder interne Suchergebnisse für alle Bots. So lesen KI Produkte Ihre wertvollsten öffentlichen Inhalte, während schwache oder private Seiten draußen bleiben.

Verwenden Sie in jedem Block den Botnamen exakt in der Schreibweise der Dokumentation. Schreiben Sie etwa "ClaudeSearchBot" statt "Claude-SearchBot", passt die Regel auf keinen einzigen Bot.

Worauf sollten Sie bei Crawl-delay und Subdomains achten?

Crawl-delay gehört nicht zu den Kernregeln von RFC 9309, deshalb liest nicht jeder Bot diese Zeile. Anthropic unterstützt die Erweiterung laut eigener Aussage. Google ignoriert Crawl-delay jedoch. Serverlast lösen Sie also nicht allein mit dieser Zeile; bei Bedarf setzen Sie Ratenlimits im CDN oder auf dem Webserver.

Bei Subdomains sehe ich oft denselben Fehler: Ein Unternehmen sperrt Trainingsbots auf der Hauptseite, aber das Hilfecenter oder der Blog auf einer Subdomain mit denselben Inhalten bleibt offen. Jede Subdomain liest die robots.txt in ihrem eigenen Stammverzeichnis. Listen Sie daher nach dem Schreiben der Richtlinie alle Hostnamen auf und prüfen Sie jede Datei einzeln.

Stellen Sie außerdem sicher, dass Ihre robots.txt den Statuscode 200 liefert. Gibt die Datei einen Serverfehler zurück, kann sich das Verhalten der Bots ändern, und Sie erhalten womöglich ein Ergebnis, das Sie nicht wollten.

Wie erkennen Sie gefälschte Anfragen von KI Crawlern?

Ein User Agent ist allerdings nur ein Etikett, das jeder kopieren kann. Nicht jede Anfrage in Ihren Logs mit "GPTBot" stammt wirklich von OpenAI. Gerade aggressive Scraper imitieren bekannte Botnamen, damit niemand sie sperrt.

Zur Prüfung nutzen Sie die IP Bereiche, die die Unternehmen veröffentlichen. Perplexity teilt zum Beispiel die IP Bereiche von PerplexityBot und Perplexity-User in getrennten JSON Dateien, und OpenAI verlinkt auf seiner Botseite IP Listen für seine Bots. Google empfiehlt wiederum, seine Crawler per Reverse DNS und über die veröffentlichten IP Bereiche zu prüfen.

  • Stimmt der Name des User Agents exakt mit der offiziellen Dokumentation überein?
  • Liegt die IP Adresse der Anfrage im veröffentlichten Bereich des Unternehmens?
  • Passen Anfragerate und Seitenmuster zum erwarteten Verhalten?

Anfragen, die diese Prüfung nicht bestehen, können Sie als Fälschung behandeln und in der Firewall sperren. So bleiben Sie für echte Bots offen und halten ressourcenhungrige Nachahmer fern.

Was ist llms.txt und warum ist sie kein Standard?

llms.txt ist eine vorgeschlagene Datei im Stammverzeichnis einer Website, die großen Sprachmodellen die wichtigsten Seiten in Markdown zusammenfasst. Jeremy Howard hat sie im September 2024 auf llmstxt.org vorgeschlagen, und die Seite selbst bezeichnet den Text ausdrücklich als Vorschlag.

Das betone ich aus gutem Grund: llms.txt ist kein IETF Standard wie robots.txt und auch kein Mechanismus für Berechtigungen. Sie sperrt keinen Bot und erlaubt keinem Bot etwas. Zudem steht in keinem der oben zitierten Botdokumente von OpenAI, Anthropic, Perplexity oder Google, dass sich das Crawling nach llms.txt richtet.

Warum erstelle ich sie trotzdem? Weil sie wenig kostet, nicht schadet und Programmierassistenten, Dokumentationstools oder Agenten, denen ein Nutzer die Datei direkt zeigt, eine saubere Übersicht Ihrer Website bietet. Kurz gesagt: Betrachten Sie llms.txt als ordentliches Vorstellungsdokument, nicht als Rankingfaktor.

Wie strukturieren Sie eine llms.txt Datei?

Der Vorschlag legt zunächst eine einfache Markdown Reihenfolge fest. Sie legen die Datei als /llms.txt in Ihr Stammverzeichnis und folgen diesem Aufbau.

  1. Eine H1 Überschrift mit dem Namen der Website oder des Projekts; das ist der einzige Pflichtteil.
  2. Ein Zitatblock, der in wenigen Sätzen erklärt, was die Website tut.
  3. Optional weitere Absätze mit Details.
  4. Dateilisten unter H2 Überschriften, jede Zeile mit einem Markdown Link und einer optionalen kurzen Notiz.
  5. Nach Konvention ein Abschnitt namens "Optional" für Nebeninformationen.

Der Vorschlag regt außerdem an, informative Seiten als saubere Markdown Version unter derselben Adresse mit angehängtem .md anzubieten. Dieser Teil ist völlig freiwillig, und die meisten Unternehmenswebsites brauchen ihn nicht.

Statt die Datei neu zu schreiben, füllen Sie im llms.txt Generator Titel, Zusammenfassung und Linkgruppen aus und übernehmen das Ergebnis. Prüfen Sie danach vor der Veröffentlichung, ob jeder Link den Status 200 liefert.

Welche Fehler sollten Sie bei der llms.txt vermeiden?

In den llms.txt Dateien, die ich auf Kundenseiten prüfe, sehe ich immer wieder dieselben Fehler. Die meisten entstehen, weil der Zweck der Datei falsch verstanden ist.

  • Berechtigungen eintragen: Eine Zeile mit "Disallow" in der llms.txt sperrt nichts; das Sperren übernimmt die robots.txt.
  • Die ganze Website abladen: Tausend Links aus der Sitemap zu kopieren, verfehlt den Zweck. Der Vorschlag verlangt eine ausgewählte, kommentierte Liste.
  • Werbesprache: Slogans in der Zusammenfassung sagen einem Modell nichts. Schreiben Sie in einfachen Sätzen, was Sie verkaufen, wen Sie bedienen und welche Seite was behandelt.
  • Aktualität vergessen: Bleiben gelöschte Seiten in der Datei, laufen Agenten in 404 Fehler. Prüfen Sie die Datei zusammen mit Ihren Sitemap Updates.
  • Wunder erwarten: Eine llms.txt steigert den Traffic nicht von selbst; sie ersetzt keine inhaltliche Qualität.

Ist Ihre Sitemap bereits sauber, fällt die llms.txt viel leichter. Deshalb empfehle ich, zuerst mit dem XML Sitemap Generator aufzuräumen und danach die wichtigsten Seiten für die llms.txt auszuwählen.

Wie lesen Sie den Traffic von KI Crawlern in Serverlogs?

Bevor Sie eine Richtlinie schreiben, müssen Sie den Ist Zustand sehen. Wenn Sie in den Zugriffslogs Ihres Webservers das Feld User Agent filtern, erkennen Sie, welcher KI Crawler welche Seiten wie oft anfragt. Tools auf JavaScript Basis wie Google Analytics zeigen diese Bots meist nicht, weil die meisten Bots die Skripte der Seite nicht ausführen.

In den Logs sollten Sie auf drei Dinge achten. Zuerst auf Statuscodes: Erhalten Suchbots 403 oder 429, blockiert Ihre Sicherheitsebene sie womöglich unbemerkt. Danach auf die meistgefragten Seiten: Wandern Bots durch Filter und Parameterseiten statt durch wertvolle Inhalte, sollten Sie die Crawlstruktur korrigieren. Schließlich auf das Volumen: Belastet ein Bot den Server, kommen Ratenlimits oder Crawl-delay ins Spiel.

Nach dieser Analyse beruhen Ihre Entscheidungen zur robots.txt auf Daten statt auf Vermutungen. Außerdem können Sie dieselben Daten einige Wochen später erneut ziehen und die Wirkung der Änderung vergleichen.

Wie testen Sie eine Änderung der robots.txt vor dem Livegang?

Eine falsche Zeile in der robots.txt kann Ihre ganze Website für Bots sperren, die Sie eigentlich wollten. Deshalb empfehle ich, jede Änderung zuerst an einer Kopie zu testen. Ein versehentliches Disallow: / im Block User-agent: * gehört zu den teuersten Fehlern, die ich gesehen habe.

Beim Testen prüfen Sie zuerst, welche Gruppe für welchen Bot gilt. Nach RFC 9309 folgt ein Crawler der spezifischsten Gruppe, die zu seinem Namen passt, und ignoriert dann den allgemeinen Sternblock. Haben Sie also einen eigenen Block für GPTBot geschrieben, müssen Sie die Ordnersperren aus dem allgemeinen Block dort wiederholen.

Danach bestätigen Sie mit dem robots.txt Bericht in der Google Search Console, dass Google die Datei liest. Für andere Bots ist der zuverlässigste Test ein Blick in die Serverlogs ein oder zwei Tage nach der Änderung. So wissen Sie, dass die Regel in der Praxis funktioniert und nicht nur in der Theorie.

Was tun Sie, wenn ein neuer KI Crawler angekündigt wird?

Die Liste der Bots bleibt allerdings nicht gleich. Mit neuen Produkten kündigen Unternehmen neue User Agents an, benennen alte um oder ändern ihre Aufgaben. Anthropic und OpenAI haben zum Beispiel Suche und Training im Laufe der Zeit auf getrennte Bots verteilt. Eine robots.txt, die Sie einmal schreiben und dann vergessen, kann daher nach wenigen Monaten lückenhaft sein.

Mein Rat lautet, Ihre schriftliche Richtlinie nach Kategorien zu führen. Erscheint ein neuer Bot, lesen Sie zuerst seine offizielle Dokumentation und ordnen ihn dann als Trainingsbot, Suchbot oder Nutzeragent ein. Anschließend übernehmen Sie die Regel, die Sie für die anderen Bots dieser Kategorie nutzen. Dadurch müssen Sie die Diskussion nicht bei jedem neuen Namen neu beginnen.

Zusätzlich empfehle ich eine Logprüfung pro Quartal. Sehen Sie einen unbekannten User Agent mit hohem Volumen, suchen Sie seinen Namen in der offiziellen Dokumentation des Unternehmens; finden Sie ihn nicht, ist Vorsicht die bessere Wahl.

Welche Richtlinie für KI Crawler passt zu welcher Website?

Es gibt keine einzig richtige Richtlinie; Ihr Geschäftsmodell bestimmt die Entscheidung. In den Beratungsprojekten, die mein Team und ich betreuen, nutzen wir meist diesen Rahmen.

  • Lokale Dienstleister und B2B-Unternehmen: Meist lohnt es sich, für alle Bots offen zu bleiben. Eine Empfehlung in KI Antworten ist mehr wert, als Inhalte aus dem Training herauszuhalten.
  • E-Commerce Shops: Halten Sie Produkt und Kategorieseiten für Suchbots offen und sperren Sie Warenkorb, Konto und Filterkombinationen.
  • Verlage und Anbieter eigener Forschung: Trainingsbots sperren und Suchbots offen lassen ist oft die am besten begründbare Balance.
  • Bezahlte Inhalte und Mitgliederbereiche: Schützen Sie diese mit einer Anmeldung, nicht mit der robots.txt.

Egal in welche Gruppe Sie fallen, halten Sie die Entscheidung schriftlich fest. Wird dann ein neuer Bot angekündigt, ergänzen Sie mit derselben Logik schnell eine Regel.

Macht Crawling Zugang allein Sie in KI Antworten sichtbar?

Nein. Die Tür für KI Crawler zu öffnen, ist nur eine Voraussetzung. Damit ein KI Produkt Sie zitiert, muss Ihr Inhalt die Frage klar beantworten, Vertrauenssignale tragen und technisch lesbar sein. Laden Sie wichtige Texte zum Beispiel nur per JavaScript im Browser, sehen Bots ohne Skriptausführung womöglich eine leere Seite.

Diese inhaltliche Arbeit beschreibe ich unter GEO, Generative Engine Optimization. Wenn Sie wissen möchten, wie sich SEO, GEO und AEO unterscheiden, ist dieser Vergleich ein guter Einstieg. Zur Rolle strukturierter Daten können Sie außerdem den Schema Generator ausprobieren.

Kurz gesagt: robots.txt und llms.txt ordnen die Tür; die Qualität Ihrer Inhalte bestimmt, was Besucher dahinter finden.

Checkliste: KI Crawler Audit in 30 Minuten

Nach diesem Leitfaden können Sie die folgende Liste der Reihe nach abarbeiten. Für die meisten Websites genügt eine halbe Stunde; bei großen Shops oder vielen Subdomains dauert es länger, deshalb können Sie die Arbeit auf mehrere Termine verteilen.

  1. Öffnen Sie die robots.txt jeder Domain und Subdomain und prüfen Sie, ob sie 200 liefert.
  2. Prüfen Sie, ob die Datei eine bewusste Entscheidung für GPTBot, ClaudeBot, Google-Extended und Applebot-Extended enthält.
  3. Stellen Sie sicher, dass OAI-SearchBot, Claude-SearchBot und PerplexityBot nicht versehentlich gesperrt sind.
  4. Prüfen Sie, dass Botregeln im CDN oder in der Firewall diesen Bots kein 403 liefern.
  5. Filtern Sie die Logs der letzten zwei Wochen und gruppieren Sie Anfragen von KI Crawlern nach Seite und Statuscode.
  6. Erstellen Sie Ihre llms.txt oder prüfen Sie die Links in der bestehenden Datei.
  7. Warten Sie nach der Änderung mindestens 24 Stunden und vergleichen Sie die Logs erneut.

Möchten Sie diese Schritte nicht selbst gehen, übernehmen mein Team und ich im Rahmen der SEO Beratung den ganzen Prozess, von der Loganalyse bis zur Richtlinie in der robots.txt. Für einen allgemeinen Blick auf die technischen Grundlagen lesen Sie auch meine Tipps zu technischem SEO.

Häufig gestellte Fragen

Verschwinde ich aus ChatGPT Search, wenn ich GPTBot sperre?
Nein, Sie können weiterhin erscheinen. Laut OpenAI dient GPTBot dem Modelltraining, OAI-SearchBot dagegen den Suchergebnissen in ChatGPT. Sperren Sie GPTBot und lassen OAI-SearchBot offen, bleiben Ihre Inhalte aus dem Training heraus, und Sie behalten trotzdem die Chance, in ChatGPT Search als Quelle genannt zu werden. Die Änderung wirkt nach etwa 24 Stunden.
Schadet eine Sperre von Google-Extended meinem Google Ranking?
Nein, sie schadet nicht. Google erklärt offiziell, dass Google-Extended die Aufnahme in die Google Suche nicht beeinflusst und kein Rankingsignal ist. Das Token steuert nur, ob gecrawlte Inhalte für das Training der Gemini Modelle und für fundierte Antworten in Gemini Apps und Vertex AI genutzt werden dürfen. Googlebot crawlt Ihre Website weiterhin ganz normal.
Verbessert eine llms.txt das SEO Ranking?
Dafür gibt es keinen offiziellen Beleg. llms.txt ist ein Vorschlag, den Jeremy Howard 2024 auf llmstxt.org veröffentlicht hat, und kein Standard. Die Botdokumente der großen KI Unternehmen sagen nicht, dass sich ihr Crawling nach dieser Datei richtet. Weil sie wenig kostet, können Sie sie trotzdem erstellen, um Ihre Website Agenten und Tools sauber vorzustellen.
Kann robots.txt jeden KI Zugriff auf meine Website stoppen?
Nicht vollständig. Offizielle Bots befolgen robots.txt, aber OpenAI schreibt, dass die Regeln für ChatGPT-User möglicherweise nicht gelten, und Perplexity-User ignoriert robots.txt laut Perplexity in der Regel. Zudem gibt es Scraper, die sich an gar keine Regeln halten. Private Inhalte schützen Sie deshalb besser mit einer Anmeldung oder serverseitiger Zugriffskontrolle.
Ich sehe GPTBot in meinen Logs; ist das wirklich OpenAI?
Nicht immer. Einen User Agent kann jeder leicht fälschen. Prüfen Sie deshalb die IP Adresse der Anfrage anhand der IP Listen, die das Unternehmen veröffentlicht. OpenAI und Perplexity verlinken diese Bereiche in ihrer Botdokumentation. Steht die Adresse nicht auf der Liste, behandeln Sie die Anfrage als Fälschung und sperren sie in der Firewall, ohne echte Bots zu treffen.
Kann ich die Crawlrate von ClaudeBot begrenzen?
Ja, das geht. Anthropic unterstützt nach eigener Aussage die nicht standardisierte Erweiterung Crawl-delay. Sie fügen im Block User-agent: ClaudeBot eine Zeile Crawl-delay hinzu und legen so eine Wartezeit zwischen Anfragen fest. Allerdings liest nicht jeder Bot diese Zeile, und Google ignoriert sie. Bei allgemeinen Lastproblemen sind Ratenlimits im CDN oder auf dem Server zuverlässiger.
#KI Crawler#GPTBot#ClaudeBot#PerplexityBot#robots.txt#llms.txt#technisches SEO
Teilen:
Talha Aslan
Talha Aslan

Google Partner und Experte für digitales Marketing. Seit 2012 praktisch in SEO, Google Ads, Webdesign und E-Commerce Projekten; jeder Beitrag hier stammt aus dieser Erfahrung.

Nächstes Projekt

Sprechen wir über Ihr Projekt.

Ihre Anfrage geht direkt an Talha Aslan und Team: Strategie von Talha, Umsetzung durch ein erfahrenes Team. Das Erstgespräch ist kostenlos, wir hören zu und melden uns mit einer klaren Roadmap.

WhatsApp Jetzt anrufen