Eine Anweisung ist noch keine Zugangssperre
Stell dir ein Bürogebäude vor, in dem Schilder den Lieferdienst zum richtigen Eingang führen. Diese Schilder helfen bei der Orientierung, verschließen aber keine Tür. Ähnlich funktioniert Robots.txt: Du veröffentlichst Regeln, an denen sich kooperierende Programme orientieren. Die Datei liegt üblicherweise direkt im Hauptverzeichnis des betreffenden Hosts und kann vor dem Abruf weiterer Inhalte gelesen werden. Für dich als Unternehmer ist vor allem die Unterscheidung zwischen einer Bitte an automatische Besucher und einer technisch durchgesetzten Zugriffsbeschränkung wichtig. Wer diese beiden Dinge verwechselt, erwartet von einer kleinen Textdatei eine Schutzwirkung, die sie nicht leisten kann.
Abrufen und im Suchindex stehen sind verschieden
Beim Crawling ruft eine Suchmaschine Inhalte ab. Bei der Indexierung nimmt sie Informationen in ihren Suchbestand auf. Ein gesperrter Abruf bedeutet nicht automatisch, dass die Adresse unbekannt bleibt. Andere Seiten können auf sie verweisen. Deshalb kann eine Adresse unter Umständen weiterhin in Suchergebnissen auftauchen, obwohl ihr Inhalt nicht abgerufen werden darf. Möchtest du eine öffentliche Seite aus den Ergebnissen ausschließen, braucht es eine dafür geeignete Anweisung. Soll dagegen niemand Unberechtigtes den Inhalt lesen, brauchst du echte Zugangskontrollen. Diese Ziele sollten bereits im Auftrag an deinen technischen Dienstleister klar getrennt sein.
Ein beispielhafter Fall aus einem Onlineshop
Ein fiktiver Laden für Bastelmaterial verkauft Produkte, die nach Farbe, Material und Lieferbarkeit gefiltert werden können. Durch unterschiedliche Kombinationen entstehen sehr viele Adressen, obwohl sich die gezeigten Inhalte nur wenig unterscheiden. Die Inhaberin möchte ihre Produktseiten gut auffindbar halten, aber unnötige automatische Abrufe begrenzen. Zuerst prüft ihre Betreuung, welche Filterseiten tatsächlich einen eigenen Nutzen haben und ob überhaupt ein relevantes Problem besteht. Erst danach kommen gezielte Einschränkungen infrage. Würde man einfach das gesamte Shopverzeichnis sperren, wären gerade die wichtigen Verkaufsseiten betroffen. Die technische Regel muss also aus dem Zweck der jeweiligen Seitengruppe folgen.
Welche Informationen in der Datei stehen
Die Regeln können bestimmte Crawler oder Gruppen ansprechen und Pfade vom Abruf ausschließen. Je nach unterstützter Syntax lassen sich auch Ausnahmen erlauben. Außerdem kann ein Verweis auf eine Sitemap enthalten sein. Diese Liste hilft beim Entdecken wichtiger Adressen, während eine Sperrregel den Abruf begrenzt. Beides erfüllt unterschiedliche Aufgaben und garantiert weder eine Aufnahme in Suchergebnisse noch eine bestimmte Position. Du musst die Schreibweise nicht auswendig lernen. Lass dir stattdessen in verständlichen Worten erklären, welche Seitengruppe jede Regel betrifft, welches Problem sie lösen soll und anhand welcher Beispiele ihre Wirkung überprüft wurde.
Kleine Änderungen können große Folgen haben
Eine einzelne Regel kann sehr viele Seiten betreffen. Besonders heikel sind pauschale Sperren, die aus einer Entwicklungsumgebung übernommen wurden oder ähnlich benannte Bereiche miterfassen. Auch notwendige Dateien für die Darstellung einer Seite sollten nicht unüberlegt blockiert werden. Sichere vor einer Änderung die bisherige Fassung und lege wichtige Prüfseiten fest. Dazu gehören neben der Startseite eine zentrale Leistung, ein typisches Produkt und vorhandene Sprachversionen. Prüfe außerdem tiefere Unterseiten. Eine funktionierende Startseite sagt wenig darüber aus, ob ein ganzer Angebotsbereich versehentlich abgeschnitten wurde. Diese Vorbereitung macht eine spätere Fehlersuche deutlich konkreter und überschaubarer.
Vertrauliche Unterlagen anders schützen
Ein Kundenangebot, eine interne Personalliste oder ein vertrauliches Projektpapier gehört hinter eine wirksame Zugangsbeschränkung. Eine Anweisung an Crawler reicht dafür nicht. Weil Robots.txt öffentlich erreichbar ist, kann ein dort genannter Pfad sogar verraten, dass ein bestimmter Bereich existiert. Besprich deshalb Anmeldung, Berechtigungen und die tatsächliche Auslieferung solcher Dateien mit der verantwortlichen Person. Auch eine schwer zu erratende Adresse ist kein verlässlicher Ersatz. Der entscheidende Test lautet: Kann jemand ohne die erforderliche Berechtigung den Inhalt direkt aufrufen? Diese Frage musst du unabhängig davon beantworten, ob die Seite in einer Suchmaschine erscheint oder von ihr besucht wird.
Ein überschaubarer Check vor dem Start
Lass dir die Adresse der tatsächlich veröffentlichten Robots.txt zeigen und jede Sperre kurz begründen. Vergleiche die Einstellungen mit dem geplanten Zustand nach dem Start. Gerade nach einem Relaunch kann eine alte Einstellung für Testseiten versehentlich bestehen bleiben. Bitte um einen Nachweis, dass repräsentative wichtige Seiten abrufbar sind. Halte außerdem fest, wer Änderungen vornimmt und wie sich die vorige Fassung wiederherstellen lässt. Manche Systeme erzeugen die Datei automatisch aus ihren Einstellungen. Eine lokal bearbeitete Kopie hilft dann nicht weiter. Der Check muss deshalb den echten Veröffentlichungsweg abdecken, einschließlich der zuständigen Person und der richtigen Umgebung.
Regeln brauchen einen nachvollziehbaren Zweck
Wenn du Produktgruppen, Sprachen oder Buchungsfunktionen umbaust, prüfe auch die bisherigen Crawlerregeln. Eine früher sinnvolle Sperre kann später wichtige Inhalte betreffen. Ergänze Regeln nicht allein deshalb, weil ein Werkzeug viele ähnliche Adressen meldet. Vielleicht passen eine bessere Navigation, klarere kanonische Adressen oder eine andere Filterlogik besser zum Problem. Technisches SEO betrachtet diese Zusammenhänge gemeinsam. Hilfreich ist eine kurze Dokumentation mit Zweck, betroffenen Bereichen und Prüfdatum. So kann auch eine neue Betreuung verstehen, weshalb die Regel existiert. Ohne diese Erklärung sammeln sich leicht Ausnahmen an, die niemand mehr verantworten oder zuverlässig beurteilen kann.
Häufige Fragen
Muss sich jeder Bot an Robots.txt halten?
Nein. Die Datei richtet sich an kooperierende Programme. Andere können die Hinweise ignorieren, und einzelne Anweisungen werden nicht überall gleich unterstützt. Für vertrauliche Inhalte oder unerwünschte Zugriffe brauchst du daher geeignete technische Kontrollen außerhalb dieser Datei.
Kann ich damit eine Seite sofort aus Google entfernen?
Darauf solltest du dich nicht verlassen. Zuerst ist zu klären, ob der Inhalt öffentlich bleiben, nur nicht in Suchergebnissen erscheinen oder vollständig verschwinden soll. Danach lässt sich die passende Maßnahme wählen und ihre tatsächliche Wirkung überprüfen.
Braucht eine kleine Website viele eigene Regeln?
Meist ist eine umfangreiche Sonderkonfiguration nicht automatisch sinnvoll. Prüfe die bestehenden Einstellungen und ein konkretes Problem, bevor du neue Einschränkungen einführst. Wenige nachvollziehbare Regeln lassen sich im Alltag leichter betreuen als eine Sammlung fremder Vorlagen ohne erkennbaren Zweck.