KI-Crawler sind Programme von OpenAI, Anthropic, Perplexity und anderen, die Websites für ihre Assistenten lesen. Wer sie in der robots.txt sperrt, kommt in ChatGPT oder Perplexity kaum mit eigenen Inhalten vor, eine llms.txt ergänzt das als Übersicht für Maschinen.
Was KI-Crawler sind
Ein Crawler ruft Websites ab und liest sie, bekannt ist vor allem der Googlebot. KI-Anbieter betreiben Trainings-Crawler, die Texte für Sprachmodelle sammeln, sowie Such-Crawler, die Seiten für Antworten lesen. Dazu kommen Abrufe, die ein Nutzer im Chat auslöst.
Die wichtigsten KI-Crawler
| Name | Anbieter | Zweck |
|---|---|---|
| GPTBot | OpenAI | Training der Modelle |
| OAI-SearchBot | OpenAI | Suche in ChatGPT |
| ChatGPT-User | OpenAI | Abruf, wenn ein Nutzer im Chat eine Seite anfragt |
| ClaudeBot | Anthropic | Training der Modelle |
| Claude-SearchBot | Anthropic | Suche in Claude |
| PerplexityBot | Perplexity | Index für die Antworten von Perplexity |
| Google-Extended | Kein Crawler, sondern Steuerzeichen in der robots.txt für Training und Grounding von Gemini, nicht für AI Overviews |
Warum Sie KI-Crawler nicht sperren sollten
Sperren Sie die Such-Crawler, kann ein Assistent Ihre Seite nicht lesen und verlässt sich auf fremde Quellen oder nennt Sie gar nicht.
Bei Trainings-Crawlern ist die Abwägung offener: Wer das Training ablehnt, sperrt nur GPTBot und ClaudeBot. Wir lassen auch das Training zu, damit die Modelle uns kennen. Dass das wirkt, ist plausibel, aber nicht belegt.
Oft kommt eine Sperre ungewollt per Schalter vom Hosting- oder Schutzdienst oder aus einer Vorlage. Ein Blick auf ihre-domain.de/robots.txt zeigt, ob dort ein „Disallow“ für einen der Namen aus der Tabelle steht.
Was eine llms.txt ist
Die llms.txt ist ein Vorschlag aus dem Jahr 2024: eine Markdown-Datei unter ihre-domain.de/llms.txt, die das Unternehmen kurz beschreibt und die wichtigsten Seiten mit je einem Satz auflistet.
Ob KI-Anbieter sie auswerten, ist nicht bestätigt. Sie ersetzt weder gute Inhalte noch eine offene robots.txt, macht aber wenig Aufwand.
Wie H&K Automation das umsetzt
- Die robots.txt von hks-automation.de lässt alle Crawler zu, auch GPTBot, ClaudeBot, PerplexityBot und Google-Extended.
- Die llms.txt entsteht aus derselben Seitenliste wie die Sitemap und nennt Leistungen, Standort, Gründer, häufige Fragen und Negativfakten, etwa dass H&K Automation keine Steuerberatung leistet.
- Alle Seiten kommen als fertiges HTML, weil viele KI-Crawler kein JavaScript ausführen.
- Dasselbe bauen wir für Kunden, etwa auf rollladen-ludwigsburg.de.
So prüfen Sie Ihre eigene Seite
Diese Punkte und viele weitere prüft der Sichtbarkeitscheck automatisch.
- ihre-domain.de/robots.txt aufrufen und nach den Namen aus der Tabelle suchen.
- Beim Hosting- oder Schutzdienst nachsehen, ob dort eine Sperre für KI-Crawler eingeschaltet ist.
- ihre-domain.de/llms.txt aufrufen. Eine Fehlerseite heißt: Es gibt noch keine.
- Den Quelltext einer Unterseite ansehen. Steht der Text dort nicht, lädt ihn erst JavaScript nach.
So geht es weiter
- Wir prüfen, wie Google und KI-Assistenten Ihre Website heute lesen.
- Im Gespräch über 30 Minuten gehen wir den Befund Punkt für Punkt durch.
- Sie entscheiden, ob Sie selbst umsetzen oder wir das übernehmen.
- Nach der Umsetzung messen wir mit demselben Check nach.
Wer dahintersteckt
H&K Automation sitzt in Leonberg bei Stuttgart. Wir bauen jede Lösung selbst und betreuen sie danach weiter. Unsere eigene Website und die Seiten unserer Kunden bauen und optimieren wir selbst.
Häufige Fragen
Schadet es meiner Google-Platzierung, wenn ich Google-Extended sperre?
Nach der Dokumentation von Google nein. Google-Extended steuert nur Training und Grounding von Gemini, nicht die normale Suche und nicht die AI Overviews.
Brauche ich eine llms.txt?
Pflicht ist sie nicht und ihre Wirkung ist nicht belegt. Sie macht wenig Aufwand, darum legen wir sie bei unseren Websites an.
Belasten KI-Crawler meinen Server?
Bei kleinen Websites meist kaum spürbar. Wer Probleme hat, sollte die Abrufrate begrenzen, statt die Crawler ganz auszusperren.
Woran erkenne ich, ob KI-Crawler meine Seite besuchen?
In den Zugriffsprotokollen Ihres Servers stehen die Namen der Crawler im Feld User-Agent. Ihr Hoster kann Ihnen diese Protokolle meist bereitstellen.



