+49 631 20691820

robots.txt

Kurz erklärt

Die robots.txt ist eine Textdatei im Hauptverzeichnis einer Website, die Suchmaschinen-Crawlern mitteilt, welche Bereiche der Website sie abrufen dürfen und welche nicht. Sie ist die erste Datei, die seriöse Crawler wie der Googlebot beim Besuch einer Domain prüfen. Die robots.txt steuert das Crawling, verhindert aber nicht zuverlässig die Indexierung einzelner Seiten.

Wie funktioniert die robots.txt?

Die Datei liegt immer unter derselben Adresse: domain.de/robots.txt. Sie enthält Regeln aus zwei Grundbausteinen: User-agent benennt den Crawler, für den die Regel gilt (etwa Googlebot oder * für alle), Disallow und Allow definieren, welche Pfade gesperrt oder freigegeben sind. Zusätzlich wird dort häufig die XML-Sitemap verlinkt.

Seriöse Suchmaschinen halten sich an diese Regeln, verpflichtend ist das jedoch nicht. Bösartige Bots ignorieren die robots.txt schlicht. Sie ist deshalb ein Steuerungsinstrument für das Crawling, kein Sicherheitsmechanismus: Vertrauliche Inhalte gehören hinter einen Login, nicht in eine Disallow-Regel.

Warum ist die robots.txt wichtig?

Mit der robots.txt lässt sich das Crawl-Budget lenken: Suchmaschinen sollen ihre Zeit auf wichtige Inhalte verwenden statt auf interne Suchergebnisseiten, Filter-URLs oder Admin-Bereiche. Gerade bei großen Websites verhindert das, dass unwichtige URL-Varianten Ressourcen binden.

Fehler in dieser kleinen Datei haben große Wirkung: Ein versehentliches Disallow: / sperrt die komplette Website für Suchmaschinen. Das passiert in der Praxis erstaunlich oft, etwa wenn die Sperrregel einer Staging-Umgebung beim Livegang mit übernommen wird. Ein Ranking-Einbruch ist dann die Folge.

Typische Fehler bei der robots.txt

Der häufigste Irrtum: Eine per robots.txt gesperrte Seite verschwindet aus dem Google-Index. Das stimmt nicht. Google kann die URL weiterhin listen, wenn andere Seiten auf sie verlinken, dann allerdings ohne Beschreibung. Wer eine Seite zuverlässig aus dem Index halten will, nutzt stattdessen ein Noindex-Meta-Tag und darf die Seite gerade nicht per robots.txt sperren, da der Crawler das Tag sonst nie zu sehen bekommt.

Weitere klassische Fehler: gesperrte CSS- und JavaScript-Dateien, die Google am korrekten Rendern der Seite hindern, sowie Tippfehler in Pfadangaben. Die Google Search Console bietet Werkzeuge, um die Wirkung der robots.txt auf einzelne URLs zu prüfen.

Häufige Fragen zu robots.txt

Zwingend nötig ist sie nicht: Ohne robots.txt dürfen Crawler alles abrufen, was meist unproblematisch ist. Empfehlenswert ist trotzdem eine einfache Datei mit Verweis auf die XML-Sitemap. Wichtig ist vor allem, dass keine fehlerhafte Datei existiert, die versehentlich Inhalte sperrt.

Nein, nicht zuverlässig. Sie verhindert nur das Crawlen, also das Abrufen der Inhalte. Google kann eine gesperrte URL trotzdem in den Index aufnehmen, wenn Links auf sie zeigen. Zum sicheren Ausschluss aus dem Index dient das Noindex-Meta-Tag auf einer crawlbaren Seite.

Rufen Sie einfach Ihre Domain mit dem Zusatz /robots.txt im Browser auf, zum Beispiel www.ihre-domain.de/robots.txt. Erscheint eine Textdatei mit Regeln, ist sie vorhanden. Bei WordPress erzeugen viele SEO-Plugins die Datei automatisch und erlauben die Bearbeitung im Backend.

Theorie verstanden — Zeit für Umsetzung?

Wir übernehmen Google Ads, SEO und Webdesign für Kanzleien und Unternehmen — rechtssicher und messbar.

Kontakt aufnehmen

Bereit für mehr
Mandanten?

In einem unverbindlichen Erstgespräch analysieren wir Ihre aktuelle Situation und zeigen Ihnen konkret, wie wir Ihre Kanzlei digital nach vorne bringen – ohne leere Versprechen, nur mit messbaren Ergebnissen.

+49 631 206918 20
hallo@ommatic.de
Mo – Fr, 09:00 – 18:00 Uhr
Kostenlos & unverbindlich.
Unser Erstgespräch ist für Sie ohne Kosten und ohne Verpflichtung.

Erstberatung anfragen

Füllen Sie das Formular aus – wir melden uns innerhalb von 24 Stunden.

Keine Weitergabe an Dritte. Antwort innerhalb von 24 Stunden.

TerminKontaktAnrufenWhatsApp