Eine einzige Zeile kann einen ganzen Bereich deiner Website für Suchmaschinen sperren. Wenn du deine Robots.txt prüfen möchtest, solltest du deshalb nicht nur nach Tippfehlern suchen. Entscheidend ist, welche Regeln für welchen Crawler gelten, welche Pfade sie betreffen und ob das Ergebnis zu deiner Absicht passt.
Die Datei ist kein geheimnisvoller SEO Hebel. Sie ist eine öffentlich abrufbare Textdatei im Stammverzeichnis deiner Domain. Dort gibt sie Crawlern Anweisungen, welche Bereiche sie abrufen dürfen. Eine saubere Prüfung verbindet deshalb drei Fragen: Ist die Datei erreichbar, sind die Regeln syntaktisch sinnvoll und treffen sie tatsächlich die richtigen URLs?
Was die robots.txt leistet und was nicht
Die robots.txt steuert in erster Linie das Crawling. Crawling bedeutet, dass ein Suchmaschinenprogramm eine URL abruft und ihren Inhalt verarbeitet. Laut der Dokumentation von Google Search Central ist die Datei nicht dafür gedacht, Webseiten zuverlässig aus dem Suchindex zu entfernen. Eine gesperrte URL kann unter Umständen trotzdem als Adresse in Suchergebnissen erscheinen, wenn andere Seiten auf sie verweisen.
Wenn eine Seite nicht in Suchergebnissen erscheinen soll, brauchst du eine andere Maßnahme. Je nach Fall kommen ein Meta Robots Wert mit noindex, eine Zugriffsbeschränkung oder das Entfernen der Seite infrage. Dabei gibt es einen wichtigen Zusammenhang: Blockierst du den Abruf der Seite in der robots.txt, kann ein Crawler ein noindex Signal auf dieser Seite nicht lesen.
Die Datei eignet sich dagegen gut, um unnötige Abrufe von technischen Bereichen zu begrenzen. Dazu können interne Suchergebnisse, bestimmte Parameterpfade oder Verwaltungsbereiche gehören. Ob eine Sperre sinnvoll ist, hängt von deiner Website ab. Eine Regel aus einer fremden Vorlage solltest du nie ungeprüft übernehmen.
Robots.txt prüfen: Beginne mit der öffentlich sichtbaren Datei
Rufe zuerst deine-domain.de/robots.txt im Browser auf. Ersetze die Beispieldomain durch deine eigene Adresse. Erscheint eine Textdatei, notierst du ihren Inhalt. Erhältst du einen Fehler, prüfst du die Weiterleitung, den Serverstatus und die WordPress Einstellungen. Die Datei muss unter dem Stamm der jeweiligen Domain erreichbar sein.
Achte auch auf die verwendete Variante der Website. Eine Datei unter einer Subdomain gilt nicht automatisch für eine andere Subdomain. Ebenso solltest du nach einem Domainwechsel kontrollieren, ob Weiterleitungen oder alte Regeln erhalten geblieben sind. Für eine belastbare Prüfung arbeitest du immer mit der endgültigen, öffentlich aufrufbaren Adresse.
Suche anschließend nach den Gruppen, die mit User-agent beginnen. Dieser Eintrag legt fest, für welchen Crawler die nachfolgenden Regeln bestimmt sind. Ein Stern steht für alle Crawler, die diese Konvention beachten. Spezifische Gruppen können davon abweichende Regeln enthalten. Lies daher nicht nur die erste Gruppe, sondern die gesamte Datei.
Regeln Zeile für Zeile lesen
Die häufigsten Anweisungen heißen Disallow und Allow. Disallow kennzeichnet einen Pfad, der nicht abgerufen werden soll. Allow kann innerhalb eines gesperrten Bereichs einen engeren Pfad wieder freigeben. Entscheidend ist nicht, wie eine Zeile auf den ersten Blick klingt, sondern auf welche URL Pfade sie angewendet wird.
Die Regel Disallow: / sperrt den Abruf der gesamten Website für die zugehörige Crawlergruppe. Auf einer Testumgebung kann das beabsichtigt sein. Auf einer veröffentlichten Website ist es meist ein schwerer Fehler. Prüfe nach einem Relaunch deshalb ausdrücklich, ob eine solche Sperre versehentlich mitkopiert wurde.
Kontrolliere danach jeden gesperrten Pfad anhand konkreter Beispieladressen. Aus einer abstrakten Regel wie /intern/ werden mindestens zwei Testfälle: eine URL, die gesperrt sein soll, und eine ähnliche URL, die erreichbar bleiben soll. Diese Gegenprobe deckt zu breit formulierte Regeln schneller auf als bloßes Lesen.
Wildcards und Dateiendungen vorsichtig einsetzen
Ein Stern kann für eine beliebige Zeichenfolge stehen. Das Dollarzeichen wird häufig verwendet, um das Ende einer URL zu markieren. Solche Muster sind nützlich, aber fehleranfällig. Ein zu allgemeines Muster kann mehr Varianten erfassen als beabsichtigt. Dokumentiere daher für jede komplexe Regel mindestens eine passende und eine nicht passende Beispiel URL.
Blockiere außerdem nicht pauschal CSS oder JavaScript Dateien, die für die Darstellung wichtiger Seiten gebraucht werden. Suchmaschinen versuchen Seiten so zu verstehen, wie Nutzer sie sehen. Werden zentrale Ressourcen gesperrt, kann das die Verarbeitung der Seite erschweren. Prüfe technische Verzeichnisse daher nach ihrem tatsächlichen Inhalt statt allein nach ihrem Namen.
Sitemap Hinweis und Indexierung getrennt bewerten
Eine robots.txt kann die Adresse einer XML Sitemap nennen. Das ist eine hilfreiche Angabe, ersetzt aber keine funktionierende Sitemap. Öffne die angegebene Adresse und kontrolliere, ob sie erreichbar ist und nur gewünschte kanonische URLs enthält. Eine ausführliche Vorgehensweise findest du im Beitrag zum Prüfen einer XML Sitemap.
Die Sitemap Zeile darf auch auf einer anderen zulässigen Adresse liegen, sollte aber vollständig angegeben sein. Mehrere Sitemap Dateien können separat aufgeführt werden. Wenn du einen Sitemap Index nutzt, genügt in der Regel dessen Adresse. Wichtig ist, dass die Angabe nicht auf eine alte Domain oder eine nicht mehr vorhandene Datei zeigt.
Verwechsle die Sitemap nicht mit einer Freigabeliste. Eine URL wird nicht automatisch abrufbar, nur weil sie in der Sitemap steht. Eine Disallow Regel kann den Abruf trotzdem verhindern. Umgekehrt garantiert eine erlaubte URL weder Indexierung noch Rankings. Technische Freigabe, Indexierbarkeit und inhaltliche Qualität sind getrennte Ebenen.
Verdächtige URLs mit einem Testplan untersuchen
Erstelle eine kleine Auswahl typischer URLs aus verschiedenen Bereichen: Startseite, Beitrag, Kategorie, Bild, Skript, interne Suche und Verwaltungsseite. Ergänze Seiten, die nach einem Relaunch neu entstanden sind. Für jede Adresse notierst du, ob sie gecrawlt werden soll und welche Regel dieses Ergebnis verursacht.
Prüfe anschließend die tatsächliche URL statt nur den sichtbaren Linktext. Weiterleitungen, Parameter und abweichende Schreibweisen können eine andere Regel treffen. Bei WordPress sind besonders automatisch erzeugte Archive, Suchpfade und Medienadressen relevant. Pauschale Empfehlungen greifen hier zu kurz, weil Themes und Erweiterungen unterschiedliche Strukturen erzeugen.
Wenn eine wichtige Seite nicht wie erwartet in der Suche erscheint, untersuche nicht nur die robots.txt. Prüfe den HTTP Status, Weiterleitungen, kanonische Angaben und Meta Robots Signale. Der Beitrag zum Prüfen von Canonical Tags zeigt, wie du das bevorzugte URL Signal kontrollierst. Erst die Kombination dieser Hinweise erklärt, warum eine Suchmaschine eine Adresse anders behandelt als erwartet.
Typische Fehler lassen sich systematisch eingrenzen
Ein häufiger Fehler entsteht beim Umzug von einer Testumgebung auf die öffentliche Domain. Die Testseite war vollständig gesperrt, und dieselbe Datei landet auf dem Livesystem. Ein zweiter Klassiker ist eine alte Pfadregel, die nach einer Änderung der Seitenstruktur plötzlich wichtige Inhalte erfasst.
Auch widersprüchliche Erwartungen führen zu Problemen. Wer einen Bereich per robots.txt sperrt und gleichzeitig erwartet, dass ein noindex auf den betroffenen Seiten verarbeitet wird, kombiniert zwei Signale, die sich praktisch behindern. Entscheide zuerst, ob ein Crawler die Seite lesen darf. Danach legst du fest, ob sie indexiert werden soll.
Leere oder ungewöhnlich umfangreiche Dateien sind nicht automatisch falsch. Eine kleine Website kann ohne besondere Sperren auskommen. Eine große Plattform kann viele technische Pfade besitzen. Bewerte deshalb jede Zeile nach einem nachvollziehbaren Zweck. Regeln, deren Ziel niemand mehr erklären kann, gehören auf eine Prüfliste und nicht blind in die nächste Version.
Änderungen kontrolliert veröffentlichen
Erstelle vor jeder Änderung eine Kopie der bisherigen Datei. Formuliere dann nur die Regel um, die du verstanden und getestet hast. Google beschreibt in der offiziellen Anleitung zum Erstellen und Aktualisieren einer robots.txt, wo die Datei liegen muss und wie Regeln aufgebaut werden. Nutze diese Syntax als Referenz, nicht zufällige Beispiele aus Foren.
Nach dem Hochladen rufst du die Datei erneut öffentlich auf. Prüfe, ob Caches oder Weiterleitungen noch eine ältere Version ausliefern. Teste danach dieselben Beispiel URLs wie zuvor. Wenn du den erwarteten Effekt nur aus der Regel ableitest, aber die ausgelieferte Datei nicht kontrollierst, bleibt eine unnötige Fehlerquelle offen.
Beobachte anschließend, ob wichtige Bereiche weiterhin erreichbar sind. Änderungen am Crawling wirken nicht wie ein Schalter für Rankings. Suchmaschinen müssen die Datei erneut abrufen und URLs erneut verarbeiten. Beurteile daher zuerst technische Signale und vermeide vorschnelle Schlussfolgerungen aus einzelnen Schwankungen.
Wie KI bei der Prüfung helfen kann
Eine KI kann Regeln in verständliche Sprache übersetzen, Beispiel URLs erzeugen und mögliche Überschneidungen markieren. Ein brauchbarer Prompt lautet etwa: Erkläre jede Gruppe dieser robots.txt. Nenne pro Regel zwei passende und zwei nicht passende Beispielpfade. Triff keine Annahmen über nicht genannte Verzeichnisse.
Die Ausgabe bleibt eine Arbeitshilfe. Ein Sprachmodell kennt weder deine komplette Seitenstruktur noch die Absicht hinter jedem Verzeichnis. Es kann Syntax plausibel erklären und trotzdem einen betrieblichen Sonderfall übersehen. Vergleiche seine Aussagen deshalb mit der offiziellen Dokumentation und teste reale URLs.
Entferne interne Servernamen, geheime Pfade, Zugangsdaten und andere vertrauliche Angaben, bevor du Inhalte in ein externes KI System kopierst. Die öffentlich erreichbare robots.txt ist zwar ohnehin sichtbar, ergänzende technische Notizen können jedoch sensible Informationen enthalten. Datenminimierung ist hier die einfache und vernünftige Regel.
Eine kurze Routine für spätere Kontrollen
Prüfe die Datei nach Domainwechseln, Relaunches, Änderungen an der URL Struktur und größeren Anpassungen durch SEO oder Sicherheits Erweiterungen. Zusätzlich lohnt sich eine Kontrolle, wenn wichtige Seiten unerwartet nicht gecrawlt werden oder neue technische Bereiche entstehen.
- Datei unter der endgültigen Domain öffnen
- Alle Crawlergruppen vollständig lesen
- Disallow und Allow mit echten Beispiel URLs testen
- Vollsperre und alte Testregeln ausschließen
- Sitemap Adresse auf Erreichbarkeit kontrollieren
- Indexierungssignale getrennt untersuchen
- Änderung dokumentieren und erneut öffentlich abrufen
Eine gute Prüfung endet nicht bei der Frage, ob die Datei vorhanden ist. Du musst erklären können, welche URL von welcher Regel betroffen ist und warum dieses Ergebnis gewollt ist. Wenn das für jede wichtige Regel gelingt, wird aus einer unscheinbaren Textdatei ein kontrollierbarer Teil deiner technischen SEO.


