Zutritt, Indexierung und Referenzierung getrennt steuern

Crawler-Zutritt, Aufnahme in einen Suchindex, bevorzugte URL und Nutzung in Such- oder KI-Produkten sind verschiedene Ebenen. Ordne robots.txt, noindex, Canonical, Redirects und Plattformregeln korrekt zu.

Die kurze Antwort

Formuliere zuerst, ob eine Inhaltsgruppe öffentlich zugänglich, crawlbar, indexierbar und für eine bestimmte Such-, Grounding- oder Trainingsnutzung verfügbar sein soll. Wähle dann das passende Mittel: Zugriffsschutz, robots.txt, noindex, Canonical, Redirect oder plattformspezifischen Bot-Token. Kein einzelner Schalter deckt alle Ebenen ab.

Die Frage «Soll ein Bot diese Seite verwenden?» ist zu ungenau. Sie vermischt, ob ein Client die URL abrufen darf, ob ein Suchsystem sie indexieren darf und ob ein Anbieter sie für eine bestimmte Such-, Grounding- oder Trainingsfunktion verwendet.

Eine Crawling-Sperre ist keine Geheimhaltung. Eine Canonical-Angabe ist kein Löschbefehl. Eine Trainingsregel entscheidet nicht automatisch über die klassische Suche.

Zutritt und Indexierung unterscheiden

Die öffentliche Datei robots.txt verwendet das Robots Exclusion Protocol. Regeln für benannte User-Agents fordern kooperative Crawler auf, bestimmte Pfade nicht abzurufen. Sie sind keine Zugriffskontrolle. Vertrauliche Inhalte benötigen Authentifizierung und serverseitige Autorisierung.

noindex ist dagegen eine Indexierungsregel. Für HTML steht sie im Robots-Meta-Tag, für andere Ressourcen kann sie über X-Robots-Tag übertragen werden. Damit ein Crawler die Regel erkennt, muss er die URL abrufen dürfen. Eine gleichzeitige Sperre in robots.txt kann das verhindern.

Bevorzugte Fassung, Verschiebung und Entfernung

rel="canonical" benennt eine bevorzugte Fassung aus mehreren gleichen oder sehr ähnlichen Ressourcen. Die Angabe ist weder Weiterleitung noch sichere Entfernung. Suchsysteme können anders entscheiden.

Situation Technische Antwort
Inhalt dauerhaft unter neuer URL 301 oder 308 zu einem passenden Ziel
Ziel nur vorübergehend 302, 303 oder 307
Dauerhaft entfernt, kein Ersatz 404 oder 410
Inhalt bleibt eigenständig keine Weiterleitung

Leite entfernte URLs nicht pauschal auf die Startseite.

Produktspezifische Nutzung zuordnen

Steuerung Dokumentierter Zweck
Googlebot Google Search und zugehörige Suchfunktionen
noindex Ausschluss aus unterstützten Suchindizes
nosnippet Vorschauen und bestimmte direkte Nutzung in Google Search begrenzen
Google-Extended Bestimmte Gemini-Trainings- und Grounding-Zwecke, nicht Search
OAI-SearchBot Automatisches Crawling für ChatGPT Search
GPTBot Crawling für mögliches Training von OpenAI-Grundmodellen
ChatGPT-User Nutzerinitiierter Abruf

Grounding bezeichnet die Verwendung externer Informationen zur sachlichen Abstützung einer Modellantwort. Das ist nicht dasselbe wie Training.

Plattformregeln mit Datum führen

Stand vom 17. August 2026: Google-Extended ist ein Produkttoken in robots.txt, aber kein separater HTTP-User-Agent. Er beeinflusst laut Google weder Aufnahme noch Ranking in Search. nosnippet verhindert die direkte Verwendung des Seiteninhalts in AI Overviews und AI Mode, begrenzt aber zugleich Suchvorschauen.

OpenAI dokumentiert OAI-SearchBot und GPTBot als unabhängige Steuerungen. ChatGPT-User dient bestimmten nutzerinitiierten Abrufen; robots.txt kann dafür nicht gleich anwendbar sein.

Vor der Konfiguration entscheiden

Halte je Inhaltsgruppe fest, ob der Inhalt öffentlich oder zugangsgeschützt ist, welche Crawler ihn abrufen sollen, ob er in Suchergebnissen erscheinen soll, ob gleichwertige oder ersetzte URLs existieren und welche Such-, Grounding- oder Trainingsnutzung erlaubt ist. Benenne ausserdem die Person, die Regeln bei Anbieteränderungen prüft. Mehr Regeln sind nicht automatisch besser.

In die Praxis

Dein nächster Arbeitsschritt

Erstelle je Inhaltsgruppe eine Steuerungsmatrix mit öffentlichem Zugriff, echter Zugriffskontrolle, Googlebot, Indexierungsabsicht, Snippet-Regel, Canonical, Redirect, Google-Extended, OAI-SearchBot, GPTBot, nutzerinitiierten Abrufen, Sitemap, internen Links, Begründung, technischer Umsetzung, Prüfnachweis und nächstem Überprüfungsauslöser.

Quellen und Vertiefung
  1. Robots Exclusion Protocol, IETFStandard für robots.txt.
  2. Einführung in robots.txt, Google Search CentralCrawler-Steuerung und Grenzen.
  3. Indexierung mit noindex blockieren, Google Search CentralVoraussetzungen und Wirkung.
  4. Robots-Meta-Tag und X-Robots-Tag, Google Search CentralIndexierungs- und Snippet-Regeln.
  5. Google-Crawler und Google-Extended, GoogleZwecke der User-Agents und Produkttoken.
  6. Overview of OpenAI Crawlers, OpenAIOAI-SearchBot, GPTBot und ChatGPT-User.