+49 631 20691820

robots.txt

Kurz erklärt

Die robots.txt ist eine Textdatei im Hauptverzeichnis einer Website, die Suchmaschinen-Crawlern mitteilt, welche Bereiche der Website sie abrufen dürfen und welche nicht. Sie ist die erste Datei, die seriöse Crawler wie der Googlebot beim Besuch einer Domain prüfen. Die robots.txt steuert das Crawling, verhindert aber nicht zuverlässig die Indexierung einzelner Seiten.

robots.txt

Was ist die robots.txt?

Die robots.txt ist eine Textdatei im Hauptverzeichnis einer Website, die Suchmaschinen-Crawlern mitteilt, welche Bereiche sie abrufen dürfen und welche nicht. Sie ist die erste Datei, die seriöse Crawler wie der Googlebot beim Besuch einer Domain prüfen. Die robots.txt steuert das Crawling, verhindert aber nicht zuverlässig die Indexierung einzelner Seiten — ein Unterschied, der in der Praxis oft verwechselt wird und zu teuren Fehlern führt.

Der zugrunde liegende Standard heißt Robots Exclusion Protocol und ist unter robotstxt.org sowie in der Wikipedia zum Robots Exclusion Standard dokumentiert. Er existiert seit den 1990er-Jahren und wurde 2022 als offizieller Internetstandard (RFC 9309) formalisiert. Die für Google maßgeblichen Regeln beschreibt die Google-Dokumentation zur robots.txt.

Die Datei ist bewusst simpel gehalten: reiner Text, wenige Direktiven, keine Programmlogik. Gerade diese Einfachheit macht sie robust, aber auch fehleranfällig — schon ein falsch gesetzter Schrägstrich kann weitreichende Folgen für die Sichtbarkeit einer Website haben.

Wie funktioniert die robots.txt?

Die Datei liegt immer unter derselben Adresse: domain.de/robots.txt. Sie enthält Regeln aus zwei Grundbausteinen: User-agent benennt den Crawler, für den die Regel gilt (etwa Googlebot oder * für alle); Disallow und Allow definieren, welche Pfade gesperrt oder freigegeben sind. Zusätzlich wird dort häufig die XML-Sitemap verlinkt, damit Suchmaschinen die wichtigsten URLs schneller finden.

Ein einfaches Beispiel sperrt für alle Crawler einen Admin-Pfad und gibt den Rest frei. Reihenfolge und Spezifität der Regeln entscheiden, welche Direktive greift; unterschiedliche Crawler können unterschiedliche Regelblöcke erhalten. Wichtig ist, dass die robots.txt nur das Abrufen (Crawling) steuert, nicht die inhaltliche Bewertung oder Aufnahme in den Index.

Seriöse Suchmaschinen halten sich an diese Regeln, verpflichtend ist das jedoch nicht. Bösartige Bots ignorieren die robots.txt schlicht. Sie ist deshalb ein Steuerungsinstrument für das Crawling, kein Sicherheitsmechanismus: Vertrauliche Inhalte gehören hinter einen Login, nicht in eine Disallow-Regel — die den Pfad im Gegenteil sogar öffentlich sichtbar macht. Details zur Funktionsweise des Crawlers erläutert die Google-Dokumentation zum Googlebot.

Warum ist die robots.txt wichtig?

Mit der robots.txt lässt sich das Crawl-Budget lenken: Suchmaschinen sollen ihre Zeit auf wichtige Inhalte verwenden statt auf interne Suchergebnisseiten, endlose Filter-URLs oder Admin-Bereiche. Gerade bei großen Websites mit vielen automatisch erzeugten URL-Varianten verhindert das, dass unwichtige Seiten Ressourcen binden und das Crawling wichtiger Inhalte verzögern.

Die robots.txt ist damit ein Grundbaustein des technischen SEO. Sie ergänzt andere Steuerungsinstrumente wie den Canonical-Tag oder die Sitemap, ersetzt sie aber nicht — jedes Werkzeug hat seine eigene Aufgabe. Für kleine Websites mit wenigen hundert Seiten ist die Crawl-Budget-Steuerung meist weniger kritisch, für große Shops oder Portale dagegen entscheidend.

Fehler in dieser kleinen Datei haben große Wirkung: Ein versehentliches Disallow: / sperrt die komplette Website für Suchmaschinen und beeinträchtigt die Indexierbarkeit massiv. Das passiert in der Praxis erstaunlich oft, etwa wenn die Sperrregel einer Staging-Umgebung beim Livegang mit übernommen wird. Ein Ranking-Einbruch ist dann die Folge, oft erst Tage später bemerkt.

Typische Fehler bei der robots.txt

Der häufigste Irrtum: Eine per robots.txt gesperrte Seite verschwindet aus dem Google-Index. Das stimmt nicht. Google kann die URL weiterhin listen, wenn andere Seiten auf sie verlinken, dann allerdings ohne Beschreibung, weil der Inhalt nicht gecrawlt werden durfte. Wer eine Seite zuverlässig aus dem Index halten will, nutzt stattdessen ein Noindex-Signal über den Robots-Meta-Tag — und darf die Seite gerade nicht per robots.txt sperren, da der Crawler das Noindex-Tag sonst nie zu sehen bekommt.

Weitere klassische Fehler: gesperrte CSS- und JavaScript-Dateien, die Google am korrekten Rendern der Seite hindern und so das JavaScript-SEO untergraben, sowie Tippfehler in Pfadangaben, die entweder zu viel oder zu wenig sperren. Auch das Vertrauen auf die robots.txt als Zugriffsschutz ist ein Fehler — sie ist rein hinweisend.

Die Google Search Console bietet Werkzeuge, um die Wirkung der robots.txt auf einzelne URLs zu prüfen und Crawling-Probleme zu erkennen. Vor jeder Änderung an der Datei lohnt ein Test in einer sicheren Umgebung, bevor sie produktiv gesetzt wird.

robots.txt richtig einsetzen

Eine gute robots.txt ist bewusst schlank: Sie sperrt nur, was wirklich nicht gecrawlt werden soll, und lässt die eigentlichen Inhalte samt Ressourcen frei zugänglich. Vor jedem Livegang lohnt ein Blick, ob keine Staging-Sperre übernommen wurde — ein Standard-Kontrollpunkt bei jedem Relaunch. Änderungen sollten anschließend in der Search Console getestet werden, bevor sie produktiv gehen.

Für die Steuerung der Indexierung ist die Kombination entscheidend: Crawling regelt die robots.txt, die Indexierung regeln Noindex und Canonical. Wer beide Ebenen sauber trennt, vermeidet die häufigsten Widersprüche — etwa eine per robots.txt gesperrte Seite, die trotzdem im Index landen soll. Ein praxisnaher Einstieg findet sich im Ryte-Wiki zur robots.txt, das Aufbau, Direktiven und häufige Fehler kompakt erklärt.

Sinnvoll ist außerdem, die robots.txt regelmäßig zu überprüfen, besonders nach Umzügen, CMS-Wechseln oder größeren Umbauten. Da die Datei zentral über die gesamte Sichtbarkeit einer Domain entscheidet, gehört sie in jedes technische SEO-Monitoring.

Häufige Fragen zu robots.txt

Nein. Sie steuert nur das Crawling. Eine gesperrte URL kann trotzdem im Index erscheinen, wenn andere Seiten auf sie verlinken. Für zuverlässiges Ausschließen aus dem Index ist ein Noindex-Meta-Tag nötig, wobei die Seite dann nicht per robots.txt gesperrt sein darf.

Immer im Hauptverzeichnis der Domain, also unter domain.de/robots.txt. Nur dort suchen Crawler die Datei. In Unterverzeichnissen abgelegte Dateien werden ignoriert.

Nein. Seriöse Crawler halten sich an die Regeln, bösartige Bots ignorieren sie. Vertrauliche Inhalte gehören hinter einen Login oder eine Zugriffssperre, nicht in eine Disallow-Regel, die den Pfad sogar öffentlich sichtbar macht.

Ja. Ein versehentliches Disallow: / sperrt die gesamte Website für Suchmaschinen und kann zu drastischen Ranking-Einbrüchen führen. Häufige Ursache ist die versehentlich übernommene Sperrregel einer Staging-Umgebung beim Livegang.

Nein. Werden diese Ressourcen gesperrt, kann Google die Seite nicht korrekt rendern und bewertet sie möglicherweise falsch. Solche Dateien sollten für den Googlebot zugänglich bleiben.

Theorie verstanden — Zeit für Umsetzung?

Wir übernehmen Google Ads, SEO und Webdesign für Kanzleien und Unternehmen — rechtssicher und messbar.

Kontakt aufnehmen

Bereit für mehr
Mandanten?

In einem unverbindlichen Erstgespräch analysieren wir Ihre aktuelle Situation und zeigen Ihnen konkret, wie wir Ihre Kanzlei digital nach vorne bringen – ohne leere Versprechen, nur mit messbaren Ergebnissen.

+49 631 206918 20
hallo@ommatic.de
Mo – Fr, 09:00 – 18:00 Uhr
Kostenlos & unverbindlich.
Unser Erstgespräch ist für Sie ohne Kosten und ohne Verpflichtung.

Erstberatung anfragen

Füllen Sie das Formular aus – wir melden uns innerhalb von 24 Stunden.

Keine Weitergabe an Dritte. Antwort innerhalb von 24 Stunden.

TerminKontaktAnrufenWhatsApp