Zutritt, Indexierung und Referenzierung getrennt steuern
Crawler-Zutritt, Aufnahme in einen Suchindex, bevorzugte URL und Nutzung in Such- oder KI-Produkten sind verschiedene Ebenen. Ordne robots.txt, noindex, Canonical, Redirects und Plattformregeln korrekt zu.
Die kurze Antwort
Formuliere zuerst, ob eine Inhaltsgruppe öffentlich zugänglich, crawlbar, indexierbar und für eine bestimmte Such-, Grounding- oder Trainingsnutzung verfügbar sein soll. Wähle dann das passende Mittel: Zugriffsschutz, robots.txt, noindex, Canonical, Redirect oder plattformspezifischen Bot-Token. Kein einzelner Schalter deckt alle Ebenen ab.
Die Frage «Soll ein Bot diese Seite verwenden?» ist zu ungenau. Sie vermischt, ob ein Client die URL abrufen darf, ob ein Suchsystem sie indexieren darf und ob ein Anbieter sie für eine bestimmte Such-, Grounding- oder Trainingsfunktion verwendet.
Eine Crawling-Sperre ist keine Geheimhaltung. Eine Canonical-Angabe ist kein Löschbefehl. Eine Trainingsregel entscheidet nicht automatisch über die klassische Suche.
Zutritt und Indexierung unterscheiden
Die öffentliche Datei robots.txt verwendet das Robots Exclusion Protocol. Regeln für benannte User-Agents fordern kooperative Crawler auf, bestimmte Pfade nicht abzurufen. Sie sind keine Zugriffskontrolle. Vertrauliche Inhalte benötigen Authentifizierung und serverseitige Autorisierung.
noindex ist dagegen eine Indexierungsregel. Für HTML steht sie im Robots-Meta-Tag, für andere Ressourcen kann sie über X-Robots-Tag übertragen werden. Damit ein Crawler die Regel erkennt, muss er die URL abrufen dürfen. Eine gleichzeitige Sperre in robots.txt kann das verhindern.
Bevorzugte Fassung, Verschiebung und Entfernung
rel="canonical" benennt eine bevorzugte Fassung aus mehreren gleichen oder sehr ähnlichen Ressourcen. Die Angabe ist weder Weiterleitung noch sichere Entfernung. Suchsysteme können anders entscheiden.
| Situation | Technische Antwort |
|---|---|
| Inhalt dauerhaft unter neuer URL | 301 oder 308 zu einem passenden Ziel |
| Ziel nur vorübergehend | 302, 303 oder 307 |
| Dauerhaft entfernt, kein Ersatz | 404 oder 410 |
| Inhalt bleibt eigenständig | keine Weiterleitung |
Leite entfernte URLs nicht pauschal auf die Startseite.
Produktspezifische Nutzung zuordnen
| Steuerung | Dokumentierter Zweck |
|---|---|
Googlebot |
Google Search und zugehörige Suchfunktionen |
noindex |
Ausschluss aus unterstützten Suchindizes |
nosnippet |
Vorschauen und bestimmte direkte Nutzung in Google Search begrenzen |
Google-Extended |
Bestimmte Gemini-Trainings- und Grounding-Zwecke, nicht Search |
OAI-SearchBot |
Automatisches Crawling für ChatGPT Search |
GPTBot |
Crawling für mögliches Training von OpenAI-Grundmodellen |
ChatGPT-User |
Nutzerinitiierter Abruf |
Grounding bezeichnet die Verwendung externer Informationen zur sachlichen Abstützung einer Modellantwort. Das ist nicht dasselbe wie Training.
Plattformregeln mit Datum führen
Stand vom 17. August 2026: Google-Extended ist ein Produkttoken in robots.txt, aber kein separater HTTP-User-Agent. Er beeinflusst laut Google weder Aufnahme noch Ranking in Search. nosnippet verhindert die direkte Verwendung des Seiteninhalts in AI Overviews und AI Mode, begrenzt aber zugleich Suchvorschauen.
OpenAI dokumentiert OAI-SearchBot und GPTBot als unabhängige Steuerungen. ChatGPT-User dient bestimmten nutzerinitiierten Abrufen; robots.txt kann dafür nicht gleich anwendbar sein.
Vor der Konfiguration entscheiden
Halte je Inhaltsgruppe fest, ob der Inhalt öffentlich oder zugangsgeschützt ist, welche Crawler ihn abrufen sollen, ob er in Suchergebnissen erscheinen soll, ob gleichwertige oder ersetzte URLs existieren und welche Such-, Grounding- oder Trainingsnutzung erlaubt ist. Benenne ausserdem die Person, die Regeln bei Anbieteränderungen prüft. Mehr Regeln sind nicht automatisch besser.
Quellen und Vertiefung
- Robots Exclusion Protocol, IETFStandard für robots.txt.
- Einführung in robots.txt, Google Search CentralCrawler-Steuerung und Grenzen.
- Indexierung mit noindex blockieren, Google Search CentralVoraussetzungen und Wirkung.
- Robots-Meta-Tag und X-Robots-Tag, Google Search CentralIndexierungs- und Snippet-Regeln.
- Google-Crawler und Google-Extended, GoogleZwecke der User-Agents und Produkttoken.
- Overview of OpenAI Crawlers, OpenAIOAI-SearchBot, GPTBot und ChatGPT-User.