robots.txt und XML-Sitemap sind zwei der grundlegendsten technischen SEO-Dateien – und gleichzeitig zwei der am häufigsten falsch konfigurierten. Für Kanzleien können Fehler in diesen Dateien erhebliche Konsequenzen haben: Wichtige Servicepages werden nicht indexiert, Administrationsseiten erscheinen in den Suchergebnissen, oder Google crawlt die Website ineffizient.
Die gute Nachricht: Beide Dateien sind keine Raketentechnik. Wer versteht, was robots.txt macht und was nicht, und wer weiß, welche Seiten in die Sitemap gehören – und welche nicht – hat die Grundlage für eine saubere Crawling-Basis. Dieser Leitfaden erklärt beide Dateien konkret für den Kanzleibetrieb. Den technischen Gesamtrahmen bietet der OMmatic-Leitfaden zur Suchmaschinenoptimierung für Rechtsanwälte.
robots.txt: Was die Datei macht – und was nicht
Die robots.txt ist eine einfache Textdatei, die im Wurzelverzeichnis einer Website gespeichert ist (erreichbar unter domain.de/robots.txt). Sie enthält Anweisungen für Suchmaschinen-Crawler, welche Bereiche der Website gecrawlt werden dürfen und welche nicht.
Was robots.txt kann
robots.txt kann Google-Crawler davon abhalten, bestimmte Verzeichnisse oder URLs zu crawlen. Das ist sinnvoll für: administrative Bereiche wie /wp-admin/, Staging-Umgebungen, interne Suchergebnisseiten, Checkout- und Warenkorbseiten (falls vorhanden), und duplizierten Content durch Parameter-URLs.
Was robots.txt nicht kann
robots.txt verhindert das Crawlen – aber nicht das Indexieren. Das ist ein häufiges Missverständnis: Wenn eine Seite durch robots.txt blockiert ist, kann Google sie trotzdem in den Index aufnehmen, wenn andere Websites auf sie verlinken. Google sieht die Seite dann – liest aber den Inhalt nicht, weil sie beim Crawlen blockiert wurde. Das Ergebnis: Eine Seite erscheint in den Suchergebnissen, aber ohne Titel und Beschreibung, weil der Inhalt nie gelesen wurde. Um eine Seite aus dem Index zu entfernen, ist der noindex-Tag die richtige Lösung – nicht robots.txt.
Kritischer Fehler: Eine häufige Fehlkonfiguration in WordPress ist die Option 'Suchmaschinen davon abhalten, diese Website zu indexieren' unter Einstellungen - Lesen. Diese Option fügt eine Disallow-Regel für alle Seiten in die robots.txt ein. Wird diese Option nach einem Launch vergessen, ist die gesamte Website für Google geblockt. Das passiert überraschend häufig – besonders nach Relaunches, bei denen die Website zunächst im Staging-Modus betrieben wurde.
robots.txt für Kanzlei-Websites: Korrekte Konfiguration
Eine typische, korrekte robots.txt für eine WordPress-Kanzlei-Website sieht so aus:
User-agent: * – Disallow: /wp-admin/ – Disallow: /wp-includes/ – Disallow: /wp-login.php – Disallow: /xmlrpc.php – Disallow: /?s= – Disallow: /search/ – Allow: /wp-admin/admin-ajax.php – Sitemap: https://www.kanzlei-beispiel.de/sitemap.xml
Erklärung der einzelnen Regeln
User-agent: * bedeutet: Diese Regeln gelten für alle Crawler (Google, Bing, und andere). Disallow: /wp-admin/ blockiert das Crawlen des WordPress-Administrationsbereichs – dieser hat für Suchmaschinen keinen Wert. Allow: /wp-admin/admin-ajax.php ist eine Ausnahme: Diese Datei wird von WordPress für dynamische Funktionen benötigt und sollte erreichbar bleiben. Disallow: /?s= blockiert interne Suchergebnisseiten, die Duplicate Content erzeugen können. Sitemap: gibt Google direkt den Pfad zur Sitemap an – das beschleunigt die Entdeckung neuer Inhalte.
Was Kanzleien nicht blockieren sollten
Häufiger Fehler: Zu viele Seiten werden geblockt. Servicepages, Blogposts, Anwaltsprofile, Kontaktseiten – all das muss für Google erreichbar sein. Wenn die robots.txt keine Disallow-Regel für einen Bereich enthält, ist dieser standardmäßig erlaubt. Eine robots.txt, die nur die oben genannten Bereiche blockiert, ist für die meisten Kanzlei-Websites vollständig ausreichend.
Spezifische Konfigurationen
Für Kanzleien mit Mehrsprachigkeit (WPML): Sprachversionen dürfen nicht geblockt werden. Jede Sprachversion (z.B. /en/, /tr/) muss crawlbar sein. Für Kanzleien mit Stadtseiten: Stadtseiten gehören nicht in die robots.txt-Blockierung, auch wenn sie temporär dünnen Inhalt haben – dafür ist noindex die richtige Lösung. Für Kanzleien mit Kalender- oder Buchungstools: Prüfen, ob die generierten URLs Duplicate Content erzeugen, und ggf. entsprechende Parameter-Regeln hinzufügen.
XML-Sitemap: Was hineingehört – und was nicht
Die XML-Sitemap ist eine strukturierte Liste aller Seiten einer Website, die Google indexieren soll. Sie hilft Google, neue oder aktualisierte Inhalte schneller zu finden – besonders bei größeren Websites mit vielen Seiten oder bei neuen Seiten, die noch keine internen Links haben.
Was in die Sitemap gehört
In die Sitemap gehören alle Seiten, die indexiert werden sollen und für Nutzer relevant sind: Startseite, alle Servicepages (Rechtsgebiete, Fachanwalt-Seiten), alle Blogposts, Anwaltsprofile und Teamseiten, Stadtseiten (sofern sie indexiert werden sollen), und Über-uns-Seite sowie Kontaktseite.
Was nicht in die Sitemap gehört
Ebenso wichtig wie der Inhalt der Sitemap ist, was nicht hineingehört: Seiten mit noindex-Tag (inkonsistent: eine Seite kann nicht gleichzeitig noindex haben und in der Sitemap stehen), Datenschutzerklärung und Impressum (rechtlich notwendig, aber kein SEO-Ziel), Dankesseiten nach Formular-Versand, administrative Seiten, und Seiten mit dünnem oder temporär unvollständigem Inhalt, die noch nicht indexierungsreif sind.
Faustregel: In die Sitemap gehört nur, was Google indexieren soll. Eine aufgeräumte Sitemap, die nur hochwertige Seiten enthält, signalisiert Google Qualität – eine Sitemap, die Tausende von dünnen oder irrelevanten Seiten enthält, schwächt das Signal.
Sitemap-Format und Aufbau
Eine XML-Sitemap hat eine standardisierte Struktur. Eine einzelne URL wird beschrieben durch die Felder: loc (die vollständige URL, z.B. https://www.kanzlei-beispiel.de/arbeitsrecht/), lastmod (Datum der letzten Änderung, z.B. 2026-05-15), changefreq (z.B. monthly) und priority (z.B. 0.8).
Wichtig: Das changefreq- und priority-Feld wird von Google weitgehend ignoriert – Google bewertet selbst, wie oft eine Seite gecrawlt werden sollte. Entscheidend ist das loc-Feld (korrekte URL) und das lastmod-Feld (Datum der letzten Änderung, das Google beim Crawling priorisiert).
Sitemap in WordPress: Automatisch oder manuell?
Für WordPress-Kanzlei-Websites gibt es zwei Ansätze.
SEO-Plugin: Empfohlen für die meisten Kanzleien
AIOSEO, Rank Math und Yoast SEO generieren automatisch eine XML-Sitemap aus allen veröffentlichten Seiten und Beiträgen. Sie ermöglichen die Konfiguration, welche Seitentypen in die Sitemap aufgenommen werden (z.B. Custom Post Types wie 'rechtsanwalt' oder 'mitarbeiter') und welche ausgeschlossen werden sollen. Für die meisten Kanzlei-Websites ist ein SEO-Plugin die einfachste und zuverlässigste Lösung.
Sitemap-Index für größere Websites
Websites mit mehr als einigen Hundert Seiten können eine Sitemap-Index-Datei nutzen: Eine Haupt-Sitemap, die auf mehrere Unter-Sitemaps zeigt (z.B. eine für Seiten, eine für Beiträge, eine für Custom Post Types). Das verbessert die Verwaltbarkeit und erlaubt Google, spezifische Bereiche gezielt zu crawlen.
Für mehrsprachige Kanzlei-Websites (WPML): WPML generiert in der Regel eigene Sitemap-Einträge für jede Sprachversion. Prüfen Sie in der GSC, ob alle Sprachversionen korrekt in der Sitemap erfasst sind.
Sitemap in der Google Search Console einreichen
Die Sitemap muss Google explizit bekannt gemacht werden. Das geschieht auf zwei Wegen: erstens durch einen Sitemap-Verweis in der robots.txt, und zweitens durch die direkte Einreichung in der Google Search Console unter Sitemaps.
Schritt für Schritt
In der Google Search Console zur Property der Kanzlei-Website navigieren. Im linken Menü 'Sitemaps' auswählen. Sitemap-URL eingeben (häufig /sitemap.xml oder /sitemap_index.xml) und 'Senden' klicken. Google bestätigt die Einreichung und zeigt an, wie viele Seiten entdeckt und indexiert wurden.
Der Unterschied zwischen 'entdeckt' und 'indexiert' ist wichtig: Nicht jede Seite, die Google in der Sitemap findet, wird auch indexiert. Google entscheidet selbst, welche Seiten würdig sind. Eine hohe Entdeckungs-zu-Indexierungs-Quote ist ein Qualitätssignal.
Häufige Fehler und ihre Behebung
Fehler 1: robots.txt blockt die gesamte Website
Ursache: In WordPress wurde die Option 'Suchmaschinen davon abhalten, diese Website zu indexieren' aktiviert, häufig im Staging-Betrieb und dann vergessen. Erkennung: robots.txt aufrufen – erscheint dort 'Disallow: /', ist die gesamte Website geblockt. Behebung: Einstellung in WordPress unter Einstellungen - Lesen deaktivieren.
Fehler 2: Wichtige Seiten fehlen in der Sitemap
Ursache: Custom Post Types (z.B. 'rechtsanwalt' für Anwaltsprofile) wurden im SEO-Plugin nicht für die Sitemap aktiviert. Erkennung: Google Search Console - Sitemaps - Anzahl entdeckter URLs mit tatsächlicher Seitenanzahl vergleichen. Behebung: Im SEO-Plugin Custom Post Types für die Sitemap aktivieren.
Fehler 3: Sitemap enthält noindex-Seiten
Eine Seite hat gleichzeitig einen noindex-Tag und steht in der Sitemap. Das ist ein Widerspruchssignal: Google wird in der Sitemap aufgefordert, die Seite zu crawlen, und beim Crawlen angewiesen, sie nicht zu indexieren. Erkennung: Tools wie Screaming Frog identifizieren URLs, die in der Sitemap stehen aber noindex haben. Behebung: Entweder noindex entfernen oder aus der Sitemap ausschließen.
Fehler 4: Sitemap-URL falsch in GSC eingetragen
Die Sitemap-URL wurde ohne Protokoll oder mit www eingereicht, obwohl die Property ohne www verifiziert ist. Google akzeptiert die Sitemap, kann aber die URLs nicht korrekt zuordnen. Erkennung: GSC - Sitemaps - Status prüfen. Behebung: Sitemap-URL genau so einreichen, wie die URLs in der Sitemap formatiert sind.
robots.txt und Sitemap gemeinsam: Das Zusammenspiel
robots.txt und Sitemap ergänzen sich, arbeiten aber unabhängig. robots.txt sagt Google, was nicht gecrawlt werden soll. Sitemap sagt Google, was gecrawlt werden soll. Diese beiden Listen sollten sich nicht überschneiden: Was in robots.txt geblockt ist, sollte nicht in der Sitemap stehen. Was in der Sitemap steht, sollte nicht durch robots.txt blockiert sein.
Ein einfacher Konsistenz-Check: Alle URLs in der Sitemap gegen die robots.txt-Regeln prüfen – keine geblockte URL sollte in der Sitemap erscheinen. Das Google URL-Prüfungstool in der GSC zeigt für jede URL, ob sie durch robots.txt blockiert ist und ob sie indexiert werden kann.
Praxishinweis: Nach jedem Website-Relaunch, nach jeder Änderung der robots.txt und nach der Installation eines neuen SEO-Plugins sollte das Zusammenspiel von robots.txt und Sitemap überprüft werden. Fehler in diesen Grundlagen können alle anderen SEO-Maßnahmen wirkungslos machen.
robots.txt für verschiedene Crawler konfigurieren
Die robots.txt unterstützt neben dem allgemeinen User-agent: * auch spezifische Regeln für einzelne Crawler. Das ist in bestimmten Situationen nützlich.
Googlebot vs. andere Crawler
Wenn Sie bestimmte Bereiche nur für Google sperren, aber anderen Crawlern erlauben möchten (oder umgekehrt), können Sie spezifische User-agent-Regeln setzen. Für Kanzleien relevant: Manche KI-Trainings-Crawler (z.B. GPTBot von OpenAI, CCBot von Common Crawl) können blockiert werden, wenn die Kanzlei nicht möchte, dass ihre Inhalte für KI-Training genutzt werden. Diese Entscheidung hat keine direkten Auswirkungen auf Google-Rankings, aber ist eine Grundsatzentscheidung zum Schutz eigener Inhalte.
Beispiel: KI-Crawler blockieren
Um KI-Trainingscrawler zu blockieren während Google-Crawler weiterhin Zugriff haben:
User-agent: GPTBot – Disallow: / – User-agent: CCBot – Disallow: / – User-agent: * – Disallow: /wp-admin/ – Disallow: /wp-includes/ – Allow: /wp-admin/admin-ajax.php – Sitemap: https://www.kanzlei-beispiel.de/sitemap.xml
Diese Konfiguration blockiert GPTBot und CCBot vollständig, während Googlebot und alle anderen Crawler die normalen Regeln erhalten. Für Kanzleien, die ihr geistiges Eigentum schützen möchten, ist das eine einfach umsetzbare Maßnahme.
Sitemap-Qualität messen: Google Search Console als Kontrollinstrument
Die Google Search Console bietet im Sitemap-Bericht wichtige Kennzahlen: Wie viele URLs wurden in der Sitemap gefunden? Wie viele davon hat Google tatsächlich indexiert? Die Differenz zwischen diesen beiden Zahlen gibt Aufschluss über die Qualität der Website-Inhalte.
Hohe Entdeckungs-zu-Indexierungs-Quote
Wenn von 100 in der Sitemap enthaltenen Seiten 95 indexiert werden, ist das ein gutes Signal: Die meisten Seiten sind nach Googles Einschätzung indexierungswürdig. Für Kanzleien mit sorgfältig erstellten Inhalten und sauberer Seitenstruktur ist eine hohe Quote das Ziel.
Niedrige Indexierungs-Quote: Was sie bedeutet
Wenn von 150 Sitemap-Seiten nur 60 indexiert werden, hat Google viele Seiten als nicht indexierungswürdig eingestuft. Häufige Gründe: Seiten mit zu wenig Inhalt, Seiten mit inhaltlicher Redundanz, oder Seiten, die technisch einwandfrei, aber inhaltlich nicht wertvoll genug sind. Die Lösung liegt nicht darin, mehr Seiten in die Sitemap aufzunehmen, sondern darin, schwächere Seiten zu stärken oder aus der Sitemap zu entfernen.
Praxishinweis: Eine Sitemap mit 50 hochwertigen Seiten und einer Indexierungsquote von 95 Prozent ist wertvoller als eine Sitemap mit 500 Seiten und einer Quote von 30 Prozent. Weniger, aber besser.
robots.txt und Sitemap nach einem WordPress-Update prüfen
WordPress-Updates, Theme-Updates und Plugin-Updates können unerwartet robots.txt-Regeln oder Sitemap-Konfigurationen ändern. Das passiert, weil manche Plugins eigene robots.txt-Regeln hinzufügen, weil SEO-Plugins nach einem Major-Update ihre Sitemap-Einstellungen zurücksetzen können, oder weil ein Theme-Update neue Seitentypen einführt, die nicht automatisch in die Sitemap aufgenommen werden.
Die Empfehlung: Nach jedem WordPress-Major-Update und nach der Installation neuer Plugins mit SEO-Relevanz sollte die robots.txt auf Veränderungen geprüft werden und die Sitemap in der GSC auf Vollständigkeit und Fehlerfreiheit geprüft werden. Dieser Check dauert fünf Minuten und verhindert, dass Updates wochenlang unbemerkt die Crawling-Basis beschädigen.
Versionskontrolle für die robots.txt
Für Kanzleien mit häufigerem Bedarf: Die robots.txt kann im Website-Repository oder in einem einfachen Dokument versioniert gehalten werden. Damit ist bei Problemen immer eine bekannte, funktionierende Version verfügbar, auf die zurückgegriffen werden kann.
Zusammenfassend: robots.txt und XML-Sitemap sind keine Dateien, die man einmal einrichtet und dann vergisst. Sie sind lebendige Konfigurationsdateien, die mit der Website wachsen und sich verändern. Wer sie regelmäßig pflegt und nach Änderungen überprüft, sichert die technische Crawling-Basis – und damit die Grundlage für alle anderen SEO-Maßnahmen.
Fazit
robots.txt und XML-Sitemap sind zwei der grundlegendsten technischen SEO-Dateien – und die Konsequenzen von Fehlern in diesen Dateien sind größer als bei den meisten anderen SEO-Maßnahmen. Eine falsch konfigurierte robots.txt kann die gesamte Kanzlei-Website für Google unsichtbar machen. Eine unvollständige Sitemap verzögert die Indexierung neuer Seiten. Eine Sitemap mit noindex-Seiten sendet widersprüchliche Signale.
Die gute Nachricht: Diese Fehler sind leicht vermeidbar, wenn die Grundkonfiguration einmal korrekt eingerichtet ist. Ein jährlicher Check von robots.txt und Sitemap – besonders nach Relaunches, Plugin-Updates und strukturellen Änderungen – sichert die Crawling-Basis dauerhaft. Den vollständigen technischen Rahmen für Kanzlei-Websites beschreibt der OMmatic-Leitfaden zu Kanzleimarketing.




