Wissen

KI-Crawler in der robots.txt wen Sie erlauben sollten und wen nicht

Ob ein KI-System Ihre Website überhaupt abrufen darf, steht in einer unscheinbaren Textdatei: der robots.txt. Dabei lohnt es sich, zwei Sorten von KI-Bots auseinanderzuhalten. Antwort-Bots holen Ihre Seite, wenn jemand gerade eine Frage stellt. Trainings-Bots sammeln Material für das nächste Modell. Die einen sollten Sie hereinlassen, bei den anderen haben Sie die Wahl.

Welche KI-Bots gibt es?

Jeder große Anbieter schickt gleich mehrere Crawler los, jeden mit eigenem Namen. In der robots.txt taucht dieser Name als User-agent auf, und was dort steht, gilt für genau diesen Bot. Die wichtigsten, Stand September 2026:

  • OAI-SearchBot von OpenAI holt Seiten für die Suche in ChatGPT. Wer ihn aussperrt, taucht in ChatGPT-Antworten mit Quellenangabe nicht auf.
  • ChatGPT-User ruft eine Seite ab, wenn jemand in ChatGPT danach fragt oder einen Link einfügt.
  • PerplexityBot und Perplexity-User machen dasselbe für Perplexity.
  • Claude-SearchBot und Claude-User für Claude von Anthropic.
  • GPTBot, ClaudeBot, Google-Extended und CCBot sind Trainings-Crawler. Sie sammeln Inhalte, aus denen Modelle lernen. Mit der Frage, ob Ihre Seite in einer Antwort zitiert wird, haben sie nichts zu tun.

Bei Google ist es einfacher: Die KI-Antworten laufen über den ganz normalen Googlebot. Wer den hereinlässt, ist dabei. Google-Extended regelt nur, ob Gemini mit Ihren Inhalten trainiert wird.

Was sollte in der robots.txt stehen?

Wer in KI-Antworten vorkommen möchte, muss die Antwort-Bots nicht einmal ausdrücklich einladen. Es reicht, sie nicht zu sperren. Eine robots.txt mit nichts als User-agent: * und Allow: / lässt alle herein. Soll das Training draußen bleiben und die Antworten trotzdem funktionieren, sieht das so aus:

robots.txt
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

User-agent: *
Allow: /

Sitemap: https://www.beispiel.de/sitemap.xml

Auf die Reihenfolge kommt es dabei nicht an, sondern auf die Gruppen. Jeder Bot sucht sich die Gruppe, in der sein Name steht. Nur wenn er keine findet, gilt für ihn der Stern. Ein Allow: / unter dem Stern genügt also für die Antwort-Bots, solange keine eigene Gruppe sie aussperrt.

Wo liegt der häufigste Fehler?

In einer Sperre, die niemand wollte. Viele Plugins und Firewall-Regeln blocken pauschal alles, was „Bot“ im Namen trägt, und erwischen die Antwort-Bots gleich mit. Der Check kommt dem auf die Spur, indem er die Startseite einmal mit der Kennung eines KI-Bots abruft. Bekommt der Bot eine andere Antwort als ein Browser, sitzt die Sperre außerhalb der robots.txt, meist im CDN oder in einem Sicherheits-Plugin.

Ebenfalls häufig: Die robots.txt fehlt ganz, oder der Server antwortet an ihrer Stelle mit einem Fehler. Bots gehen damit unterschiedlich um, manche lesen dann gar nichts. Selbst eine leere Datei ist besser als gar keine, solange sie erreichbar ist.

Ist es legitim, das Training zu untersagen?

Ja, und es kostet Sie keine Sichtbarkeit. Wer die eigenen Texte nicht in einem Modell wiederfinden möchte, sperrt die Trainings-Crawler und bleibt in den Antworten trotzdem vertreten. Der Check zeigt diese Entscheidung an, bewertet sie aber nicht. Bewertet wird allein, ob die Antwort-Bots hereinkommen. Ohne sie gibt es keine Nennung.

Wie prüfe ich das selbst?

  1. Rufen Sie ihre-domain.de/robots.txt im Browser auf. Dort muss die Datei erscheinen und keine Fehlerseite.
  2. Suchen Sie nach den Namen der Antwort-Bots. Steht einer davon in einer Gruppe mit Disallow: /, ist er gesperrt.
  3. Schauen Sie, ob unter dem Stern etwas gesperrt ist, das zum Inhalt gehört, etwa Disallow: /wp-content/ mit den Bildern darin oder ein ganzer Bereich.
  4. Lassen Sie den GEO-Check laufen. Er sucht zusätzlich nach Sperren außerhalb der Datei, und die sieht man in der robots.txt nun mal nicht.