Zurück zur Übersicht
KI & Technik

robots.txt für KI-Crawler: GPTBot, ClaudeBot & Co. richtig steuern

Die robots.txt ist die erste Datei, die ein Crawler beim Besuch Ihrer Website liest. In Zeiten von ChatGPT, Perplexity und Gemini entscheidet sie nicht mehr nur über Ihr Google-Ranking, sondern auch darüber, ob Ihre Inhalte in KI-Antworten auftauchen. Viele Websites sperren dabei versehentlich genau die Bots, die für ihre KI-Sichtbarkeit zuständig sind. Dieser Leitfaden zeigt, welche KI-Crawler es gibt und wie Sie sie gezielt steuern.

Warum ist die robots.txt für KI-Suche entscheidend?

KI-Antwortmaschinen greifen auf zwei Arten auf Ihre Inhalte zu: über Trainings-Crawler, die Daten für künftige Modelle sammeln, und über Such- und Antwort-Crawler, die in Echtzeit Quellen für eine konkrete Nutzerfrage abrufen. Für Ihre Sichtbarkeit in KI-Antworten ist vor allem die zweite Gruppe wichtig: Wird sie blockiert, kann Ihre Seite nicht als Quelle zitiert werden.

"Wer alle KI-Bots pauschal aussperrt, schützt vielleicht seine Trainingsdaten – verschwindet damit aber gleichzeitig aus allen KI-Suchergebnissen."

Welche KI-Crawler gibt es?

Die folgende Übersicht listet die wichtigsten KI-Crawler, ihren Betreiber und ihren Zweck. Die Spalte „Für KI-Sichtbarkeit" zeigt, welche Bots Sie erlauben sollten, wenn Sie in KI-Antworten erscheinen möchten.

User-Agent Betreiber Zweck Für KI-Sichtbarkeit
GPTBotOpenAIModell-TrainingOptional
OAI-SearchBotOpenAIChatGPT Search IndexEmpfohlen
ChatGPT-UserOpenAILive-Abruf bei NutzeranfrageEmpfohlen
ClaudeBotAnthropicModell-TrainingOptional
Claude-SearchBotAnthropicSuche & Zitate in ClaudeEmpfohlen
PerplexityBotPerplexitySuchindexEmpfohlen
Perplexity-UserPerplexityLive-Abruf bei NutzeranfrageEmpfohlen
Google-ExtendedGoogleGemini & KI-FunktionenEmpfohlen
Applebot-ExtendedAppleApple IntelligenceEmpfohlen
AmazonbotAmazonAlexa & KI-DiensteOptional
CCBotCommon CrawlOffener Trainings-DatensatzOptional
BytespiderByteDanceModell-TrainingOptional

Wie gebe ich KI-Crawler in der robots.txt frei?

Um maximale KI-Sichtbarkeit zu erreichen, erlauben Sie die Such- und Antwort-Crawler explizit. Eine empfohlene Konfiguration sieht so aus:

User-agent: *
Allow: /

# KI-Antwort-Crawler ausdrücklich erlaubt
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

Sitemap: https://ihre-domain.de/sitemap.xml

Wie blockiere ich KI-Crawler gezielt?

Möchten Sie verhindern, dass Ihre Inhalte zum Training verwendet werden, aber weiterhin in KI-Suchergebnissen erscheinen? Dann blockieren Sie nur die Trainings-Crawler und erlauben die Such-Crawler:

# Training verbieten ...
User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

# ... Suche & Zitate aber erlauben
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

Wichtig: Die meisten KI-Crawler werten jeden User-Agent-Block einzeln aus und ignorieren die Wildcard User-agent: * für KI-Zwecke. Sie müssen jeden Bot daher namentlich aufführen.

Blockiert Ihre robots.txt versehentlich KI-Crawler?

Unser kostenloses Website-Audit ruft Ihre robots.txt live ab und prüft, ob zentrale KI-Antwort-Crawler wie OAI-SearchBot, PerplexityBot oder ClaudeBot gesperrt sind. Ergebnis in Sekunden.

Häufig gestellte Fragen zu KI-Crawlern

Welche KI-Crawler sollte ich erlauben, um in ChatGPT und Perplexity zu erscheinen?

Um in KI-Antworten zitiert zu werden, sollten Sie vor allem die Such- und Antwort-Crawler erlauben: OAI-SearchBot und ChatGPT-User (OpenAI), PerplexityBot und Perplexity-User (Perplexity), ClaudeBot und Claude-SearchBot (Anthropic), Google-Extended (Gemini) sowie Applebot-Extended (Apple Intelligence).

Was ist der Unterschied zwischen GPTBot und OAI-SearchBot?

GPTBot sammelt Inhalte primär für das Training zukünftiger OpenAI-Modelle. OAI-SearchBot indexiert Inhalte für die Live-Suche in ChatGPT Search. Wer in KI-Suchergebnissen erscheinen will, sollte mindestens OAI-SearchBot und ChatGPT-User erlauben, auch wenn GPTBot blockiert bleibt.

Schadet es meinem Google-Ranking, wenn ich Google-Extended blockiere?

Nein. Google-Extended steuert ausschließlich die Nutzung Ihrer Inhalte für Gemini und KI-Funktionen. Die normale Google-Suche und Ihr klassisches Ranking werden über den Googlebot gesteuert und bleiben unberührt.

Wie blockiere ich alle KI-Crawler in der robots.txt?

Sie legen pro Crawler einen Block an, zum Beispiel User-agent: GPTBot gefolgt von Disallow: /. Das müssen Sie für jeden KI-Bot einzeln wiederholen, da die meisten KI-Crawler die Wildcard User-agent: * für KI-Zwecke ignorieren.

Fazit

Die robots.txt ist Ihr wichtigster Hebel, um die KI-Sichtbarkeit Ihrer Website bewusst zu steuern. Trennen Sie zwischen Trainings- und Such-Crawlern: Wer in ChatGPT, Perplexity und Gemini zitiert werden möchte, sollte die Antwort-Crawler ausdrücklich erlauben. Prüfen Sie Ihre Konfiguration regelmäßig – eine einzige falsche Disallow-Zeile kann Sie aus der gesamten KI-Suche entfernen.