Die robots.txt ist eine Textdatei im Hauptverzeichnis einer Website, die Suchmaschinen-Crawlern mitteilt, welche Bereiche der Website sie abrufen dürfen und welche nicht. Sie ist die erste Datei, die seriöse Crawler wie der Googlebot beim Besuch einer Domain prüfen. Die robots.txt steuert das Crawling, verhindert aber nicht zuverlässig die Indexierung einzelner Seiten.

Was ist die robots.txt?
Die robots.txt ist eine Textdatei im Hauptverzeichnis einer Website, die Suchmaschinen-Crawlern mitteilt, welche Bereiche sie abrufen dürfen und welche nicht. Sie ist die erste Datei, die seriöse Crawler wie der Googlebot beim Besuch einer Domain prüfen. Die robots.txt steuert das Crawling, verhindert aber nicht zuverlässig die Indexierung einzelner Seiten — ein Unterschied, der in der Praxis oft verwechselt wird und zu teuren Fehlern führt.
Der zugrunde liegende Standard heißt Robots Exclusion Protocol und ist unter robotstxt.org sowie in der Wikipedia zum Robots Exclusion Standard dokumentiert. Er existiert seit den 1990er-Jahren und wurde 2022 als offizieller Internetstandard (RFC 9309) formalisiert. Die für Google maßgeblichen Regeln beschreibt die Google-Dokumentation zur robots.txt.
Die Datei ist bewusst simpel gehalten: reiner Text, wenige Direktiven, keine Programmlogik. Gerade diese Einfachheit macht sie robust, aber auch fehleranfällig — schon ein falsch gesetzter Schrägstrich kann weitreichende Folgen für die Sichtbarkeit einer Website haben.
Wie funktioniert die robots.txt?
Die Datei liegt immer unter derselben Adresse: domain.de/robots.txt. Sie enthält Regeln aus zwei Grundbausteinen: User-agent benennt den Crawler, für den die Regel gilt (etwa Googlebot oder * für alle); Disallow und Allow definieren, welche Pfade gesperrt oder freigegeben sind. Zusätzlich wird dort häufig die XML-Sitemap verlinkt, damit Suchmaschinen die wichtigsten URLs schneller finden.
Ein einfaches Beispiel sperrt für alle Crawler einen Admin-Pfad und gibt den Rest frei. Reihenfolge und Spezifität der Regeln entscheiden, welche Direktive greift; unterschiedliche Crawler können unterschiedliche Regelblöcke erhalten. Wichtig ist, dass die robots.txt nur das Abrufen (Crawling) steuert, nicht die inhaltliche Bewertung oder Aufnahme in den Index.
Seriöse Suchmaschinen halten sich an diese Regeln, verpflichtend ist das jedoch nicht. Bösartige Bots ignorieren die robots.txt schlicht. Sie ist deshalb ein Steuerungsinstrument für das Crawling, kein Sicherheitsmechanismus: Vertrauliche Inhalte gehören hinter einen Login, nicht in eine Disallow-Regel — die den Pfad im Gegenteil sogar öffentlich sichtbar macht. Details zur Funktionsweise des Crawlers erläutert die Google-Dokumentation zum Googlebot.
Warum ist die robots.txt wichtig?
Mit der robots.txt lässt sich das Crawl-Budget lenken: Suchmaschinen sollen ihre Zeit auf wichtige Inhalte verwenden statt auf interne Suchergebnisseiten, endlose Filter-URLs oder Admin-Bereiche. Gerade bei großen Websites mit vielen automatisch erzeugten URL-Varianten verhindert das, dass unwichtige Seiten Ressourcen binden und das Crawling wichtiger Inhalte verzögern.
Die robots.txt ist damit ein Grundbaustein des technischen SEO. Sie ergänzt andere Steuerungsinstrumente wie den Canonical-Tag oder die Sitemap, ersetzt sie aber nicht — jedes Werkzeug hat seine eigene Aufgabe. Für kleine Websites mit wenigen hundert Seiten ist die Crawl-Budget-Steuerung meist weniger kritisch, für große Shops oder Portale dagegen entscheidend.
Fehler in dieser kleinen Datei haben große Wirkung: Ein versehentliches Disallow: / sperrt die komplette Website für Suchmaschinen und beeinträchtigt die Indexierbarkeit massiv. Das passiert in der Praxis erstaunlich oft, etwa wenn die Sperrregel einer Staging-Umgebung beim Livegang mit übernommen wird. Ein Ranking-Einbruch ist dann die Folge, oft erst Tage später bemerkt.
Typische Fehler bei der robots.txt
Der häufigste Irrtum: Eine per robots.txt gesperrte Seite verschwindet aus dem Google-Index. Das stimmt nicht. Google kann die URL weiterhin listen, wenn andere Seiten auf sie verlinken, dann allerdings ohne Beschreibung, weil der Inhalt nicht gecrawlt werden durfte. Wer eine Seite zuverlässig aus dem Index halten will, nutzt stattdessen ein Noindex-Signal über den Robots-Meta-Tag — und darf die Seite gerade nicht per robots.txt sperren, da der Crawler das Noindex-Tag sonst nie zu sehen bekommt.
Weitere klassische Fehler: gesperrte CSS- und JavaScript-Dateien, die Google am korrekten Rendern der Seite hindern und so das JavaScript-SEO untergraben, sowie Tippfehler in Pfadangaben, die entweder zu viel oder zu wenig sperren. Auch das Vertrauen auf die robots.txt als Zugriffsschutz ist ein Fehler — sie ist rein hinweisend.
Die Google Search Console bietet Werkzeuge, um die Wirkung der robots.txt auf einzelne URLs zu prüfen und Crawling-Probleme zu erkennen. Vor jeder Änderung an der Datei lohnt ein Test in einer sicheren Umgebung, bevor sie produktiv gesetzt wird.
robots.txt richtig einsetzen
Eine gute robots.txt ist bewusst schlank: Sie sperrt nur, was wirklich nicht gecrawlt werden soll, und lässt die eigentlichen Inhalte samt Ressourcen frei zugänglich. Vor jedem Livegang lohnt ein Blick, ob keine Staging-Sperre übernommen wurde — ein Standard-Kontrollpunkt bei jedem Relaunch. Änderungen sollten anschließend in der Search Console getestet werden, bevor sie produktiv gehen.
Für die Steuerung der Indexierung ist die Kombination entscheidend: Crawling regelt die robots.txt, die Indexierung regeln Noindex und Canonical. Wer beide Ebenen sauber trennt, vermeidet die häufigsten Widersprüche — etwa eine per robots.txt gesperrte Seite, die trotzdem im Index landen soll. Ein praxisnaher Einstieg findet sich im Ryte-Wiki zur robots.txt, das Aufbau, Direktiven und häufige Fehler kompakt erklärt.
Sinnvoll ist außerdem, die robots.txt regelmäßig zu überprüfen, besonders nach Umzügen, CMS-Wechseln oder größeren Umbauten. Da die Datei zentral über die gesamte Sichtbarkeit einer Domain entscheidet, gehört sie in jedes technische SEO-Monitoring.