Was ist robots.txt? Erstellen, Testen und Beispiele

Was ist robots.txt und wofür braucht man sie?
Robots.txt ist eine einfache Textdatei im Stammverzeichnis Ihrer Website, die Crawlern der Suchmaschinen mitteilt, welche URLs sie abrufen dürfen. Sie steuert vor allem den Crawl Verkehr. Also eine Seite vor Google verstecken können Sie damit nicht; dafür brauchen Sie noindex oder einen Passwortschutz.
Also stellen Sie sich die Datei als Türsteher vor. Der Crawler kommt an, liest zuerst diese Datei und geht dann nur durch die erlaubten Bereiche. Die robots.txt ist also ein Schild und kein Schloss. Zudem halten sich seriöse Bots daran, böswillige Bots ignorieren sie dagegen meist.
Die meisten Websites nutzen die Datei aus drei Gründen. Zunächst schonen Sie Ihren Server, weil er weniger sinnlose Anfragen beantwortet. Zudem lenken Sie die Crawl Aktivität auf wichtige Seiten. Schließlich sperren Sie Bereiche, die endlos viele URLs erzeugen, etwa interne Suchergebnisse.
Wie funktioniert die robots.txt genau?
Ein Crawler ruft bei jedem Besuch zuerst ihredomain.de/robots.txt auf. Zunächst liest er, wenn er die Datei findet, die Regeln und wählt die Gruppe, die zu seinem Namen passt. Dann gilt: Liefert der Server einen 404, behandelt der Crawler die ganze Website als offen.
Die Regeln schreiben Sie in Gruppen. Jede Gruppe beginnt mit einer User-agent Zeile und enthält darunter Allow oder Disallow Zeilen. Laut Google Dokumentation befolgt ein Crawler nur die eine, am besten passende Gruppe. Regeln aus Ihrer allgemeinen Gruppe gelten also nicht automatisch in einer speziellen Gruppe.
Auch der Antwortcode des Servers spielt eine Rolle. Zunächst gelten bei einem 200 die Regeln. Dagegen verhalten sich Crawler bei 4xx Fehlern meist, als gäbe es keine Einschränkung. Bei 5xx Fehlern pausiert Google allerdings unter Umständen das Crawling, bis die Datei wieder lesbar ist. Deshalb sollten Sie die Erreichbarkeit der Datei überwachen.
Als Quellen empfehlen wir Googles Einführung in robots.txt sowie den Standard RFC 9309, der das Verhalten von Crawlern festschreibt.
Welche Anweisungen nutzen Sie in der robots.txt?
Die Syntax beruht auf vier Anweisungen. Zudem schreiben Sie jede als Paar aus Feld: Wert in eine eigene Zeile. Dabei ignorieren die Namen der Anweisungen die Groß und Kleinschreibung, die Pfadwerte dagegen nicht.
- User-agent: nennt den Crawler, für den die Regel gilt. Ein Sternchen steht für alle Crawler.
- Disallow: nennt einen Pfad, den der Crawler nicht besuchen soll. Ein leerer Wert sperrt nichts.
- Allow: erlaubt einen bestimmten Pfad innerhalb eines gesperrten Ordners.
- Sitemap: nennt die vollständige URL Ihrer XML Sitemap.
Dazu kommen zwei Platzhalter. Das Sternchen steht für beliebige Zeichen, das Dollarzeichen markiert das Ende einer URL. Zum Beispiel erfasst Disallow: /*.pdf$ jede Adresse, die auf .pdf endet.
Kommentare beginnen mit einer Raute. Nutzen Sie sie für Notizen an Ihr Team, denn nach sechs Monaten weiß niemand mehr, warum eine Regel existiert.
Wie erstellen Sie eine robots.txt Datei?
Öffnen Sie einen einfachen Texteditor, speichern Sie die Datei als robots.txt mit UTF8 Kodierung und laden Sie sie ins Stammverzeichnis Ihrer Website hoch. Laut Google darf eine Website nur eine robots.txt haben, und sie muss direkt unter der Domain liegen.
Dann gehen unsere Teams bei neuen Projekten so vor.
- Listen Sie die Bereiche auf, die nicht gecrawlt werden sollen: Adminbereich, Warenkorb, Filterergebnisse, interne Suche.
- Entscheiden Sie, für welche Crawler jeder Bereich gilt.
- Schreiben Sie die Regeln in User-agent Gruppen.
- Fügen Sie am Ende die Sitemap Zeile ein.
- Laden Sie die Datei hoch und öffnen Sie sie im Browser.
- Prüfen Sie sie mit dem robots.txt Bericht in der Search Console.
Möchten Sie nicht von Hand schreiben, erstellt unser robots.txt Generator einen Entwurf nach Ihren Angaben. Prüfen Sie das Ergebnis trotzdem anhand Ihrer eigenen Seitenstruktur.
Wo laden Sie die robots.txt hoch?
Die Datei muss im Stamm jedes Hosts liegen, inklusive Protokoll und Subdomain. Zum Beispiel steuert https://www.beispiel.de/robots.txt nur genau diesen Ursprung. Denn eine Datei in einem Unterordner ignorieren Crawler.
Außerdem braucht jede Subdomain eine eigene Datei. Für blog.beispiel.de legen Sie also eine andere an als für beispiel.de. Ebenso behandelt Google die Versionen mit http und https getrennt. Deshalb ist eine Weiterleitung auf eine einzige Version hilfreich.
Bei Systemen wie WordPress erzeugt das System manchmal eine virtuelle Datei für Sie. Dann gilt: Sobald Sie eine echte Datei hochladen, antwortet die virtuelle nicht mehr. Öffnen Sie die Adresse im Browser, dann sehen Sie, welche antwortet.
Google verarbeitet etwa die ersten 500 KiB der Datei. Alles darüber ignoriert Google. Daher gilt: Nähert sich Ihre Datei dieser Größe, vereinfachen Sie Ihre Regeln.
Welche Beispiele für robots.txt gibt es?
Zunächst zeigen die folgenden Beispiele typische Szenarien. Passen Sie jedes an Ihre eigenen Pfade an, denn reines Kopieren sperrt oft die falschen Bereiche.
Eine Basisdatei, die alles erlaubt. Für eine kleine Firmenwebsite reicht das oft:
- User-agent: *
- Disallow:
- Sitemap: https://www.beispiel.de/sitemap.xml
Ein Beispiel für E-Commerce. Es sperrt Warenkorb, Kasse und interne Suche:
- User-agent: *
- Disallow: /warenkorb/
- Disallow: /kasse/
- Disallow: /suche/
- Sitemap: https://www.beispiel.de/sitemap.xml
Ein Beispiel für den Adminbereich. Es kommt oft bei WordPress vor. Die Freigabe der Ajax Datei hält manche Themes funktionsfähig:
- User-agent: *
- Disallow: /
wp-admin/ - Allow: /
wp-admin/admin-ajax.php
Ein Detail verdient Aufmerksamkeit: Pfade beginnen mit einem Schrägstrich. Lassen Sie beim Sperren eines Ordners den abschließenden Schrägstrich stehen. Schreiben Sie nämlich /suche ohne ihn, erfassen Sie auch fremde Adressen wie /suchergebnisse. Deshalb missverstehen viele Teams dieses kleine Detail.
Die ganze Website sperren. Nutzen Sie Disallow: / nur auf Testumgebungen. Gelangt die Zeile versehentlich auf die Live Seite, verlieren Sie schnell Traffic.
Was ist der Unterschied zwischen robots.txt und noindex?
Robots.txt steuert das Crawling, noindex steuert die Indexierung. Also greift beides in unterschiedlichen Phasen. Der Bot ruft zunächst die Seite ab und entscheidet danach, ob er sie indexiert. Die robots.txt wirkt auf die erste Phase, noindex auf die zweite.
Hier liegt der entscheidende Punkt. Sperren Sie eine Seite in der robots.txt, ruft Google sie nie ab und sieht deshalb auch ihr noindex nicht. Die Seite kann trotzdem in den Ergebnissen erscheinen, wenn andere Websites auf sie verlinken. Googles Anleitung zum Blockieren der Indexierung erklärt, warum eine noindex Seite crawlbar bleiben muss.
| Merkmal | Robots.txt | Noindex |
|---|---|---|
| Was es steuert | Crawling | Indexierung |
| Wo Sie es setzen | Datei im Stammverzeichnis | Meta Tag der Seite oder HTTP Header |
| Entfernt die Seite aus den Ergebnissen? | Nein | Ja, nach erneutem Crawling |
| Muss der Bot die Seite lesen? | Nein | Ja |
| Sinnvoller Einsatz | Crawl Last senken | Seite aus den Ergebnissen nehmen |
Warum erscheint eine gesperrte Seite trotzdem bei Google?
Google kann eine URL indexieren, ohne ihren Inhalt zu lesen. Denn Links von anderen Websites genügen dafür. In diesem Fall erscheint das Ergebnis oft ohne Beschreibung oder mit dem Hinweis, dass keine Informationen vorliegen.
Das ist das häufigste Missverständnis, das wir in der Praxis sehen. Betreiber sperren einen Ordner und erwarten, dass die Seiten binnen Tagen verschwinden. Allerdings löscht das Sperren nichts aus dem Index; es verhindert nur, dass Google den Inhalt aktualisiert.
Die richtige Reihenfolge sieht so aus. Zunächst lassen Sie die Seiten crawlbar und setzen noindex. Danach bestätigen Sie in der Search Console, dass die Seiten aus dem Index verschwunden sind. Erst dann senken Sie bei Bedarf mit der robots.txt die Crawl Last. Bei sensiblen Daten genügt selbst noindex nicht; nutzen Sie Passwortschutz oder entfernen Sie die Seite ganz.
Welche Seiten sollten Sie mit robots.txt sperren?
Zunächst sperren Sie Bereiche, die in den Suchergebnissen keinen Wert haben und Crawl Aktivität verschwenden. Jede Website ist anders, doch diese Gruppen tauchen immer wieder auf.
- Admin und Login Seiten.
- Warenkorb, Kasse und Kundenkonto.
- Seiten mit internen Suchergebnissen.
- Filter und Sortierparameter, die endlos viele Kombinationen erzeugen.
- URLs mit Sitzungskennungen oder Tracking Parametern.
- Test und Entwicklungsbereiche.
Allerdings birgt jede Einschränkung ein Risiko. Manche Filterseiten bedienen zum Beispiel echte Suchnachfrage und gehören in den Index. Prüfen Sie daher vor jeder Regel die Daten der Search Console und den organischen Traffic je Seite.
Ein Beispiel aus der Praxis: Ein Shop erzeugt für jede Kombination aus Farbe und Größe eine eigene URL. Also ergibt das Tausende ähnliche Seiten, an denen Bots Zeit verlieren. Sie würden diese Parameter gern sperren, doch zuerst messen Sie, welche Filter echte Suchanfragen anziehen.
Dann wertet unser Team auch die Crawling Statistik aus. Wer sieht, welche Ordner Googlebot am häufigsten abruft, erkennt sperrbare Bereiche schneller. Zu Problemen mit der Crawl Häufigkeit lesen Sie unseren Beitrag Googlebot crawlt weniger.
Welche Seiten sollten Sie nicht mit robots.txt sperren?
Sperren Sie niemals Ihre CSS, JavaScript oder Bilddateien. Google stellt Ihre Seite wie ein Browser dar. Kommt es nicht an Stile und Skripte heran, versteht es die Seite unter Umständen falsch. Darunter leiden Mobilfreundlichkeit und Inhaltsbewertung.
Sperren Sie außerdem keine Seite, die ranken soll. Kategorie, Produkt, Blog und Leistungsseiten müssen crawlbar bleiben. Ein zu breiter Pfad in einer Regel kann diese Bereiche unbemerkt mit erfassen.
Auch das Sperren von Seiten mit Canonical Tag macht Ärger. Google muss die Seite lesen, um das Canonical Signal zu sehen. Steuern Sie doppelte Inhalte also über Canonical Tags und nicht über Crawl Sperren.
Schließlich sendet eine gesperrte Adresse, die zugleich in Ihrer Sitemap steht, ein widersprüchliches Signal. Die Search Console warnt Sie dann, und der Indexstatus dieser Seiten schwankt.
Wie arbeiten robots.txt und Sitemap zusammen?
Beide ergänzen sich. Die robots.txt sagt Bots, wohin sie nicht gehen sollen, und die Sitemap liefert eine Liste wichtiger URLs. Steht die Sitemap Zeile am Ende der robots.txt, finden Bots Ihre Karte schon beim ersten Besuch.
Schreiben Sie die Sitemap Adresse als vollständige URL, denn relative Pfade funktionieren nicht. Haben Sie mehrere Karten, gehört jede in eine eigene Zeile. Bei großen Websites reicht eine Zeile zur Sitemap Indexdatei.
Die Karte sollte nur Adressen enthalten, die Sie indexieren möchten, die einen 200 liefern und die kanonische URL nutzen. Nehmen Sie gesperrte, weiterleitende oder noindex Adressen heraus. So geben Sie Google ein einheitliches Signal.
Ist die Karte von Hand mühsam, hilft unser XML Sitemap Generator. Zu den Datumsfeldern liefert unser Beitrag Sitemap lastmod richtig setzen Details. Reichen Sie die Karte schließlich auch in der Search Console ein.
Wie testen Sie eine robots.txt Datei?
Nach der Veröffentlichung führen Sie drei Prüfungen durch. Zunächst öffnen Sie die Adresse im Browser und prüfen den Text. Dann kontrollieren Sie, ob der Server einen 200 liefert. Schließlich schauen Sie in den robots.txt Bericht der Search Console.
Dieser Bericht zeigt, wann Google die Datei zuletzt gelesen hat und welche Zeilen Probleme machten. Googles Anleitung zum Erstellen einer robots.txt verweist zum Testen außerdem auf die quelloffene robots.txt Bibliothek.
Nach einer kritischen Änderung testen Sie wichtige Seiten einzeln mit dem URL Prüftool. Zeigt zum Beispiel eine Kategorieseite die Warnung "durch robots.txt blockiert", ist Ihre Regel zu breit. Sind Sie neu beim Tool, hilft unsere Anleitung zur Google Search Console.
Prüfen Sie außerdem mit dem mobilen und dem Desktop Crawler. Manche Regeln betreffen nur eine Bot Gruppe, und den Unterschied sehen Sie nur in zwei getrennten Tests. Halten Sie die Datei zudem unter Versionskontrolle, damit ein Rückgriff schnell gelingt.
Welche Fehler passieren bei der robots.txt am häufigsten?
Der häufigste Fehler ist, die Regel Disallow: / aus der Testumgebung auf die Live Seite mitzunehmen. Tippfehler in Pfaden, fehlende Schrägstriche und Verwechslungen bei der Schreibweise folgen dicht dahinter. Die Lösungen haben wir in unserem Beitrag robots.txt Fehler beheben beschrieben und wiederholen sie hier nicht.
Trotzdem hilft eine kurze Checkliste:
- Liegt die Datei im Stammverzeichnis und nicht in einem Unterordner?
- Ist die Kodierung UTF8?
- Ist die Sitemap Zeile eine vollständige URL?
- Sind die Ordner für CSS und JS offen?
- Haben Sie Seiten mit noindex für das Crawling offen gelassen?
Ein weiterer häufiger Irrtum: Eine Datei gelte für alle Subdomains. Ein Shop auf einer Subdomain braucht jedoch seine eigene Datei, und Regeln der Hauptdomain erreichen ihn nie.
Außerdem bewirkt ein noindex in der robots.txt nichts. Google unterstützt diese Anweisung nicht. Nutzen Sie stattdessen den Tag der Seite oder den HTTP Header.
Wie steuern Sie KI Bots mit der robots.txt?
Sie steuern KI Bots, indem Sie für jeden User Agent Namen eine eigene Gruppe schreiben. Zum Beispiel legen Sie eine Gruppe für GPTBot und eine für ClaudeBot an und geben jeder eine Allow oder Disallow Regel. Die Betreiber sagen, ihre Bots hielten sich daran, aber die Befolgung bleibt deren freie Entscheidung.
Denken Sie zuerst an Ihr Geschäftsziel. Möchten Sie in KI Antworten zitiert werden, kann eine Sperre diese Chance senken. Haben Urheberrecht und Datenpolitik Vorrang, ist eine Sperre sinnvoll. Das ist also eine strategische und keine technische Entscheidung.
Aktuelle Bot Namen, die Frage, welche Bots trainieren und welche der Suche dienen, sowie unsere empfohlene Einrichtung finden Sie in unserem Leitfaden zu KI Crawlern. Prüfen Sie zudem die offizielle Dokumentation jedes Anbieters, denn Namen ändern sich mit der Zeit.
Wie wirkt sich die robots.txt auf Indexierungsprobleme aus?
Die robots.txt steuert die Indexierung nicht direkt, doch die indirekten Folgen sind groß. Seiten in einem versehentlich gesperrten Ordner lassen sich nicht aktualisieren, und neue Seiten findet Google spät. Deshalb gehört die robots.txt zu den ersten Stellen, die Sie bei Berichten zu nicht indexierten Seiten prüfen.
Zeigt die Search Console "durch robots.txt blockiert", fragen Sie zuerst, ob das Absicht war. Soll die Seite im Index bleiben, verengen Sie die Regel und fordern ein erneutes Crawling an. Den gesamten Ablauf beschreibt unsere Anleitung zu nicht indexierten Seiten.
Bei Onlineshops ist die Lage komplexer. Produktseiten fehlen aus vielen Gründen im Index, und wir haben sie in Produktseiten nicht indexiert gesammelt.
Wie oft sollten Sie Ihre robots.txt prüfen?
Prüfen Sie die Datei nach jeder größeren Änderung der Website und mindestens einmal im Quartal. Fügen Sie einen neuen Bereich hinzu, ziehen Sie um oder wechseln Sie Theme oder Plugin, können alte Regeln ihren Sinn verlieren.
Google legt die Datei meist im Cache ab und aktualisiert sie etwa täglich. Eine Änderung zeigt sich also nicht sofort. Haben Sie einen dringenden Fehler behoben, fordern Sie in der Search Console ein erneutes Crawling an.
Bei Migrationen gehört die Prüfung der robots.txt zu den ersten Punkten Ihrer Startliste. Die weiteren Schritte finden Sie in unserer Checkliste zur SEO Migration.
Machen Sie daraus bei einer Firmenwebsite eine feste Routine. Suchen Sie ein Team, das technische Audits für Sie übernimmt, deckt unsere SEO Beratung diese Prüfungen ab.
Was sind die besten Praktiken für die robots.txt?
Die beste Praxis ist eine kurze, lesbare Datei. Jede Zeile braucht einen Grund. Können Sie eine Regel nicht erklären, ist Löschen oft sicherer.
- Halten Sie schriftlich fest, was Sie sperren wollen, bevor Sie die Datei anfassen.
- Formulieren Sie Regeln so eng wie möglich.
- Erklären Sie jede Gruppe mit einem Kommentar.
- Testen Sie Änderungen zuerst auf einer Testumgebung.
- Prüfen Sie nach der Veröffentlichung den Bericht der Search Console.
- Tragen Sie die Sitemap Adresse in die Datei ein.
Sehen Sie die robots.txt außerdem nicht als komplette SEO Strategie. Titel, Canonical Struktur und Seitenarchitektur sind genauso wichtig. Titel entwerfen Sie mit unserem Meta Tag Generator, und das große Bild zeigt unser Beitrag Was ist technisches SEO.
Was tun, wenn sich die robots.txt ständig ändert?
Ändert sich die Datei ständig, liegt das Problem meist im Prozess und nicht in der Datei. Bearbeiten mehrere Personen sie ohne Protokoll, entstehen unerwartete Sperren.
Bestimmen Sie daher eine verantwortliche Person und notieren Sie jede Änderung kurz. Stellen Sie die Datei unter Versionskontrolle. Richten Sie zudem eine Überwachung für kritische Regeln ein, dann erfahren Sie sofort von unerwarteten Änderungen.
Manche Content Management Systeme und Plugins schreiben die Datei automatisch. Legen Sie dann fest, welches Werkzeug das letzte Wort hat. Sonst löscht ein Plugin Update still die Regeln, die Sie von Hand geschrieben haben.
Wie funktionieren User Agent Gruppen in der robots.txt?
Jede User-agent Zeile eröffnet eine neue Regelgruppe. Schreiben Sie eine eigene Gruppe für Googlebot, verlässt Googlebot die allgemeine Gruppe mit dem Sternchen vollständig und liest nur seine eigene. Sie müssen Ihre allgemeinen Regeln daher auch in die spezielle Gruppe kopieren.
Google betreibt mehrere Crawler. Der Bild Bot, der News Bot und der Werbe Bot haben eigene Namen. Zum Beispiel ignoriert AdsBot die allgemeine Gruppe mit dem Sternchen, und Sie müssen ihn direkt nennen. Schalten Sie Anzeigen, ist dieses Wissen wichtig.
Ein praktischer Fall: Sie haben in der allgemeinen Gruppe den Ordner /suche/ gesperrt. Dann fügen Sie eine Gruppe für Googlebot Image hinzu, die nur einen Bildordner nennt. Der Bild Bot sieht die Regel für /suche/ nun nicht mehr, weil er nur seine eigene Gruppe anwendet.
Halten Sie die Zahl der Gruppen also klein. Fragen Sie sich vor jeder Gruppe für einen Spezialbot, ob Sie wirklich anderes Verhalten wollen. Zusätzliche Gruppen erschweren die Pflege und laden Fehler ein.
Wie funktionieren Platzhalter und Vorrangregeln in der robots.txt?
Passen mehrere Regeln auf dieselbe Adresse, wählt Google die spezifischste, also die mit dem längsten Pfad. Sind Allow und Disallow gleich lang, gewinnt das weniger restriktive Allow. Wer diese Logik kennt, liest auch komplexe Dateien leichter.
Nehmen wir an, Sie haben Disallow: /produkte/ und Allow: /produkte/beliebt/ geschrieben. Der Ordner für beliebte Produkte bleibt offen, weil der Allow Pfad länger und genauer ist. Die übrigen Produktordner bleiben gesperrt.
Auch das Sternchen kann überraschen. Die Zeile Disallow: /*? sperrt jede Adresse mit einem Fragezeichen. Das hilft bei Filterparametern. Allerdings trifft es womöglich auch echte Seiten, die über Seitenzahlen oder Kampagnenparameter laufen.
Testen Sie deshalb jede Regel mit Platzhaltern zusammen mit Beispieladressen, die sie betrifft. Veröffentlichen Sie keine Regel, bevor Sie genau sehen, welche URLs sie erfasst.
Wie beeinflusst die robots.txt das Crawl Budget?
Die robots.txt verbessert das Crawl Budget indirekt, indem sie die Anfragen von Googlebot auf wertvolle Seiten lenkt. Bei den meisten kleinen Websites spüren Sie diesen Effekt jedoch kaum. Google erklärt, das Crawl Budget betreffe vor allem sehr große Websites, die sich oft ändern.
Schätzen Sie daher die Größe Ihrer eigenen Website ein. Bei einer Firmenwebsite mit wenigen hundert Seiten ändert Feintuning an der robots.txt die Rankings nicht. Bei einem Shop mit Hunderttausenden Filterkombinationen macht diese Kontrolle dagegen einen klaren Unterschied.
Beobachten Sie Ihre Crawl Daten. Der Bericht zu den Crawling Statistiken in der Search Console zeigt, wie viele Anfragen Google täglich stellt und wie schnell Ihr Server antwortet. Erhält ein Ordner einen unverhältnismäßigen Anteil, erwägen Sie eine Sperre.
Bedenken Sie zuletzt, dass eine Sperre das Budget nicht automatisch auf andere Seiten verlagert. Sind Ihr Server langsam oder Ihre Architektur schwach, beheben Sie zuerst das.
Wie bearbeiten Sie die robots.txt bei WordPress?
Findet WordPress keine echte Datei, liefert es eine eigene virtuelle robots.txt aus. Diese Antwort bearbeiten Sie über Ihr Theme oder ein SEO Plugin. Viele SEO Plugins bieten im Dashboard einen Dateieditor, in dem Sie Regeln direkt schreiben.
Sie können auch eine echte Datei auf den Server laden. Existiert eine echte Datei, liefert WordPress die virtuelle nicht aus. Gibt es sowohl ein Plugin als auch eine Datei, sehen Sie im Browser, welche gewinnt.
Achten Sie auf die Einstellung, die Suchmaschinen vom Indexieren Ihrer Website abhält. Diese Option fügt eine Regel hinzu, die die ganze Website sperrt. Bleibt sie auf einer Live Seite aktiviert, ist das ein häufiger Unfall.
Prüfen Sie die Datei schließlich nach jedem Plugin Update. Plugins schreiben manchmal Standardregeln neu und löschen Ihre eigenen Zeilen.




