# Zutritt, Indexierung und Referenzierung getrennt steuern

Crawler-Zutritt, Aufnahme in einen Suchindex, bevorzugte URL und Nutzung in Such- oder KI-Produkten sind verschiedene Ebenen. Ordne robots.txt, noindex, Canonical, Redirects und Plattformregeln korrekt zu.

## Die kurze Antwort

Formuliere zuerst, ob eine Inhaltsgruppe öffentlich zugänglich, crawlbar, indexierbar und für eine bestimmte Such-, Grounding- oder Trainingsnutzung verfügbar sein soll. Wähle dann das passende Mittel: Zugriffsschutz, robots.txt, noindex, Canonical, Redirect oder plattformspezifischen Bot-Token. Kein einzelner Schalter deckt alle Ebenen ab.

Die Frage «Soll ein Bot diese Seite verwenden?» ist zu ungenau. Sie vermischt, ob ein Client die URL abrufen darf, ob ein Suchsystem sie indexieren darf und ob ein Anbieter sie für eine bestimmte Such-, Grounding- oder Trainingsfunktion verwendet.

Eine Crawling-Sperre ist keine Geheimhaltung. Eine Canonical-Angabe ist kein Löschbefehl. Eine Trainingsregel entscheidet nicht automatisch über die klassische Suche.

## Zutritt und Indexierung unterscheiden

Die öffentliche Datei `robots.txt` verwendet das **Robots Exclusion Protocol**. Regeln für benannte User-Agents fordern kooperative Crawler auf, bestimmte Pfade nicht abzurufen. Sie sind keine Zugriffskontrolle. Vertrauliche Inhalte benötigen Authentifizierung und serverseitige Autorisierung.

`noindex` ist dagegen eine Indexierungsregel. Für HTML steht sie im Robots-Meta-Tag, für andere Ressourcen kann sie über `X-Robots-Tag` übertragen werden. Damit ein Crawler die Regel erkennt, muss er die URL abrufen dürfen. Eine gleichzeitige Sperre in `robots.txt` kann das verhindern.

## Bevorzugte Fassung, Verschiebung und Entfernung

`rel="canonical"` benennt eine bevorzugte Fassung aus mehreren gleichen oder sehr ähnlichen Ressourcen. Die Angabe ist weder Weiterleitung noch sichere Entfernung. Suchsysteme können anders entscheiden.

| Situation | Technische Antwort |
|---|---|
| Inhalt dauerhaft unter neuer URL | `301` oder `308` zu einem passenden Ziel |
| Ziel nur vorübergehend | `302`, `303` oder `307` |
| Dauerhaft entfernt, kein Ersatz | `404` oder `410` |
| Inhalt bleibt eigenständig | keine Weiterleitung |

Leite entfernte URLs nicht pauschal auf die Startseite.

## Produktspezifische Nutzung zuordnen

| Steuerung | Dokumentierter Zweck |
|---|---|
| `Googlebot` | Google Search und zugehörige Suchfunktionen |
| `noindex` | Ausschluss aus unterstützten Suchindizes |
| `nosnippet` | Vorschauen und bestimmte direkte Nutzung in Google Search begrenzen |
| `Google-Extended` | Bestimmte Gemini-Trainings- und Grounding-Zwecke, nicht Search |
| `OAI-SearchBot` | Automatisches Crawling für ChatGPT Search |
| `GPTBot` | Crawling für mögliches Training von OpenAI-Grundmodellen |
| `ChatGPT-User` | Nutzerinitiierter Abruf |

**Grounding** bezeichnet die Verwendung externer Informationen zur sachlichen Abstützung einer Modellantwort. Das ist nicht dasselbe wie Training.

## Plattformregeln mit Datum führen

**Stand vom 17. August 2026:** `Google-Extended` ist ein Produkttoken in `robots.txt`, aber kein separater HTTP-User-Agent. Er beeinflusst laut Google weder Aufnahme noch Ranking in Search. `nosnippet` verhindert die direkte Verwendung des Seiteninhalts in AI Overviews und AI Mode, begrenzt aber zugleich Suchvorschauen.

OpenAI dokumentiert `OAI-SearchBot` und `GPTBot` als unabhängige Steuerungen. `ChatGPT-User` dient bestimmten nutzerinitiierten Abrufen; `robots.txt` kann dafür nicht gleich anwendbar sein.

## Vor der Konfiguration entscheiden

Halte je Inhaltsgruppe fest, ob der Inhalt öffentlich oder zugangsgeschützt ist, welche Crawler ihn abrufen sollen, ob er in Suchergebnissen erscheinen soll, ob gleichwertige oder ersetzte URLs existieren und welche Such-, Grounding- oder Trainingsnutzung erlaubt ist. Benenne ausserdem die Person, die Regeln bei Anbieteränderungen prüft. Mehr Regeln sind nicht automatisch besser.

## Dein nächster Arbeitsschritt

Erstelle je Inhaltsgruppe eine Steuerungsmatrix mit öffentlichem Zugriff, echter Zugriffskontrolle, Googlebot, Indexierungsabsicht, Snippet-Regel, Canonical, Redirect, Google-Extended, OAI-SearchBot, GPTBot, nutzerinitiierten Abrufen, Sitemap, internen Links, Begründung, technischer Umsetzung, Prüfnachweis und nächstem Überprüfungsauslöser.

## Quellen und Vertiefung

- [RFC 9309](https://www.rfc-editor.org/rfc/rfc9309) — IETF: Standard für robots.txt.
- [Quelle bei Google](https://developers.google.com/search/docs/crawling-indexing/robots/intro) — Google Search Central: Crawler-Steuerung und Grenzen.
- [Quelle bei Google](https://developers.google.com/search/docs/crawling-indexing/block-indexing) — Google Search Central: Voraussetzungen und Wirkung.
- [Quelle bei Google](https://developers.google.com/search/docs/crawling-indexing/robots-meta-tag) — Google Search Central: Indexierungs- und Snippet-Regeln.
- [Quelle bei Google](https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers) — Google: Zwecke der User-Agents und Produkttoken.
- [Quelle bei OpenAI](https://developers.openai.com/api/docs/bots) — OpenAI: OAI-SearchBot, GPTBot und ChatGPT-User.

## Hinweis

Die Plattformangaben geben den dokumentierten Stand vom 17. August 2026 wieder. Sie können sich ändern; Indexierung, Ranking oder Nennung werden nicht garantiert.