Die robots.txt ist die erste Datei, die ein Crawler beim Besuch Ihrer Website liest. In Zeiten von ChatGPT, Perplexity und Gemini entscheidet sie nicht mehr nur über Ihr Google-Ranking, sondern auch darüber, ob Ihre Inhalte in KI-Antworten auftauchen. Viele Websites sperren dabei versehentlich genau die Bots, die für ihre KI-Sichtbarkeit zuständig sind. Dieser Leitfaden zeigt, welche KI-Crawler es gibt und wie Sie sie gezielt steuern.
Warum ist die robots.txt für KI-Suche entscheidend?
KI-Antwortmaschinen greifen auf zwei Arten auf Ihre Inhalte zu: über Trainings-Crawler, die Daten für künftige Modelle sammeln, und über Such- und Antwort-Crawler, die in Echtzeit Quellen für eine konkrete Nutzerfrage abrufen. Für Ihre Sichtbarkeit in KI-Antworten ist vor allem die zweite Gruppe wichtig: Wird sie blockiert, kann Ihre Seite nicht als Quelle zitiert werden.
"Wer alle KI-Bots pauschal aussperrt, schützt vielleicht seine Trainingsdaten – verschwindet damit aber gleichzeitig aus allen KI-Suchergebnissen."
Welche KI-Crawler gibt es?
Die folgende Übersicht listet die wichtigsten KI-Crawler, ihren Betreiber und ihren Zweck. Die Spalte „Für KI-Sichtbarkeit" zeigt, welche Bots Sie erlauben sollten, wenn Sie in KI-Antworten erscheinen möchten.
| User-Agent | Betreiber | Zweck | Für KI-Sichtbarkeit |
|---|---|---|---|
GPTBot | OpenAI | Modell-Training | Optional |
OAI-SearchBot | OpenAI | ChatGPT Search Index | Empfohlen |
ChatGPT-User | OpenAI | Live-Abruf bei Nutzeranfrage | Empfohlen |
ClaudeBot | Anthropic | Modell-Training | Optional |
Claude-SearchBot | Anthropic | Suche & Zitate in Claude | Empfohlen |
PerplexityBot | Perplexity | Suchindex | Empfohlen |
Perplexity-User | Perplexity | Live-Abruf bei Nutzeranfrage | Empfohlen |
Google-Extended | Gemini & KI-Funktionen | Empfohlen | |
Applebot-Extended | Apple | Apple Intelligence | Empfohlen |
Amazonbot | Amazon | Alexa & KI-Dienste | Optional |
CCBot | Common Crawl | Offener Trainings-Datensatz | Optional |
Bytespider | ByteDance | Modell-Training | Optional |
Wie gebe ich KI-Crawler in der robots.txt frei?
Um maximale KI-Sichtbarkeit zu erreichen, erlauben Sie die Such- und Antwort-Crawler explizit. Eine empfohlene Konfiguration sieht so aus:
User-agent: *
Allow: /
# KI-Antwort-Crawler ausdrücklich erlaubt
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: Applebot-Extended
Allow: /
Sitemap: https://ihre-domain.de/sitemap.xml
Wie blockiere ich KI-Crawler gezielt?
Möchten Sie verhindern, dass Ihre Inhalte zum Training verwendet werden, aber weiterhin in KI-Suchergebnissen erscheinen? Dann blockieren Sie nur die Trainings-Crawler und erlauben die Such-Crawler:
# Training verbieten ...
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
# ... Suche & Zitate aber erlauben
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
Wichtig: Die meisten KI-Crawler werten jeden User-Agent-Block einzeln aus und ignorieren die Wildcard User-agent: * für KI-Zwecke. Sie müssen jeden Bot daher namentlich aufführen.
Blockiert Ihre robots.txt versehentlich KI-Crawler?
Unser kostenloses Website-Audit ruft Ihre robots.txt live ab und prüft, ob zentrale KI-Antwort-Crawler wie OAI-SearchBot, PerplexityBot oder ClaudeBot gesperrt sind. Ergebnis in Sekunden.
Häufig gestellte Fragen zu KI-Crawlern
Welche KI-Crawler sollte ich erlauben, um in ChatGPT und Perplexity zu erscheinen?
Um in KI-Antworten zitiert zu werden, sollten Sie vor allem die Such- und Antwort-Crawler erlauben: OAI-SearchBot und ChatGPT-User (OpenAI), PerplexityBot und Perplexity-User (Perplexity), ClaudeBot und Claude-SearchBot (Anthropic), Google-Extended (Gemini) sowie Applebot-Extended (Apple Intelligence).
Was ist der Unterschied zwischen GPTBot und OAI-SearchBot?
GPTBot sammelt Inhalte primär für das Training zukünftiger OpenAI-Modelle. OAI-SearchBot indexiert Inhalte für die Live-Suche in ChatGPT Search. Wer in KI-Suchergebnissen erscheinen will, sollte mindestens OAI-SearchBot und ChatGPT-User erlauben, auch wenn GPTBot blockiert bleibt.
Schadet es meinem Google-Ranking, wenn ich Google-Extended blockiere?
Nein. Google-Extended steuert ausschließlich die Nutzung Ihrer Inhalte für Gemini und KI-Funktionen. Die normale Google-Suche und Ihr klassisches Ranking werden über den Googlebot gesteuert und bleiben unberührt.
Wie blockiere ich alle KI-Crawler in der robots.txt?
Sie legen pro Crawler einen Block an, zum Beispiel User-agent: GPTBot gefolgt von Disallow: /. Das müssen Sie für jeden KI-Bot einzeln wiederholen, da die meisten KI-Crawler die Wildcard User-agent: * für KI-Zwecke ignorieren.
Fazit
Die robots.txt ist Ihr wichtigster Hebel, um die KI-Sichtbarkeit Ihrer Website bewusst zu steuern. Trennen Sie zwischen Trainings- und Such-Crawlern: Wer in ChatGPT, Perplexity und Gemini zitiert werden möchte, sollte die Antwort-Crawler ausdrücklich erlauben. Prüfen Sie Ihre Konfiguration regelmäßig – eine einzige falsche Disallow-Zeile kann Sie aus der gesamten KI-Suche entfernen.