Wissen
Ob ein KI-System Ihre Website überhaupt abrufen darf, steht in einer unscheinbaren Textdatei: der robots.txt. Dabei lohnt es sich, zwei Sorten von KI-Bots auseinanderzuhalten. Antwort-Bots holen Ihre Seite, wenn jemand gerade eine Frage stellt. Trainings-Bots sammeln Material für das nächste Modell. Die einen sollten Sie hereinlassen, bei den anderen haben Sie die Wahl.
Jeder große Anbieter schickt gleich mehrere Crawler los, jeden mit eigenem Namen. In der robots.txt taucht dieser Name als User-agent auf, und was dort steht, gilt für genau diesen Bot. Die wichtigsten, Stand September 2026:
Bei Google ist es einfacher: Die KI-Antworten laufen über den ganz normalen Googlebot. Wer den hereinlässt, ist dabei. Google-Extended regelt nur, ob Gemini mit Ihren Inhalten trainiert wird.
Wer in KI-Antworten vorkommen möchte, muss die Antwort-Bots nicht einmal ausdrücklich
einladen. Es reicht, sie nicht zu sperren. Eine robots.txt mit nichts als
User-agent: * und Allow: / lässt alle herein. Soll das
Training draußen bleiben und die Antworten trotzdem funktionieren, sieht das so
aus:
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
User-agent: *
Allow: /
Sitemap: https://www.beispiel.de/sitemap.xml
Auf die Reihenfolge kommt es dabei nicht an, sondern auf die Gruppen. Jeder Bot sucht
sich die Gruppe, in der sein Name steht. Nur wenn er keine findet, gilt für ihn der
Stern. Ein Allow: / unter dem Stern genügt also für die Antwort-Bots,
solange keine eigene Gruppe sie aussperrt.
In einer Sperre, die niemand wollte. Viele Plugins und Firewall-Regeln blocken pauschal alles, was „Bot“ im Namen trägt, und erwischen die Antwort-Bots gleich mit. Der Check kommt dem auf die Spur, indem er die Startseite einmal mit der Kennung eines KI-Bots abruft. Bekommt der Bot eine andere Antwort als ein Browser, sitzt die Sperre außerhalb der robots.txt, meist im CDN oder in einem Sicherheits-Plugin.
Ebenfalls häufig: Die robots.txt fehlt ganz, oder der Server antwortet an ihrer Stelle mit einem Fehler. Bots gehen damit unterschiedlich um, manche lesen dann gar nichts. Selbst eine leere Datei ist besser als gar keine, solange sie erreichbar ist.
Ja, und es kostet Sie keine Sichtbarkeit. Wer die eigenen Texte nicht in einem Modell wiederfinden möchte, sperrt die Trainings-Crawler und bleibt in den Antworten trotzdem vertreten. Der Check zeigt diese Entscheidung an, bewertet sie aber nicht. Bewertet wird allein, ob die Antwort-Bots hereinkommen. Ohne sie gibt es keine Nennung.
ihre-domain.de/robots.txt im Browser auf. Dort muss die
Datei erscheinen und keine Fehlerseite.Disallow: /, ist er gesperrt.Disallow: /wp-content/ mit den Bildern darin oder ein ganzer
Bereich.