SEO & KI-Suche

KI-Crawler steuern: robots.txt statt llms.txt

IT-Fachkraft prüft mit einem Tablet einen Serverschrank – Sinnbild für die Steuerung von KI-Crawlern über die robots.txt

Bilder: mit KI erstellt

Kurzantwort: KI-Crawler steuern Sie 2026 über die robots.txt, nicht über die Datei llms.txt. Nur robots.txt wird von OpenAI, Google und Anthropic nachweislich beachtet. Entscheidend ist die Unterscheidung zwischen Trainings-Bots und Such-Bots: Wer beide pauschal sperrt, verschwindet aus den Quellenangaben der KI-Antworten.

Seit KI-Assistenten Antworten mit Quellen ausliefern, tauchen in jedem Server-Protokoll Namen auf, die vor drei Jahren niemand kannte: GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot. Die Reaktion vieler Betriebe ist reflexhaft – entweder alles sperren, weil „die trainieren mit unseren Inhalten“, oder gar nichts tun, weil es zu kompliziert wirkt. Beides ist teuer. Dieser Beitrag zeigt, welche Bots es gibt, was Sie tatsächlich steuern können und warum die viel diskutierte Datei llms.txt Ihr Problem nicht löst.

Trainieren, suchen, abrufen: drei völlig verschiedene Dinge

Der wichtigste Unterschied wird in fast jeder Diskussion übersehen. KI-Anbieter setzen mehrere Bots ein, die unterschiedliche Aufgaben haben:

  • Trainings-Crawler sammeln Inhalte, aus denen später Modelle lernen. Sperren Sie diese, hat das keinen Einfluss darauf, ob Sie in Antworten auftauchen.
  • Such-Crawler bauen den Index, aus dem der Assistent seine Antworten belegt. Sperren Sie diese, verschwinden Sie aus den Quellenangaben – das ist der schmerzhafte Fall.
  • Nutzerinitiierte Abrufe passieren, wenn jemand im Chat einen Link einfügt oder der Assistent im Auftrag des Nutzers eine Seite öffnet. Diese Abrufe verhalten sich anders als klassisches Crawling.

Wer pauschal alles blockt, entscheidet damit unbeabsichtigt gegen die eigene Sichtbarkeit. Wie diese Sichtbarkeit entsteht, beschreiben wir ausführlich in GEO und AEO: Wie Sie von KI-Antworten zitiert werden.

Die Bots, die 2026 zählen

Bot Betreiber Aufgabe Über robots.txt steuerbar Wirkung einer Sperre
GPTBot OpenAI Training künftiger Modelle ja keine Auswirkung auf Sichtbarkeit in ChatGPT-Antworten
OAI-SearchBot OpenAI Suchindex für ChatGPT ja Sie erscheinen nicht mehr als Quelle
ChatGPT-User OpenAI Abruf im Auftrag eines Nutzers eingeschränkt – laut Doku greifen robots.txt-Regeln hier möglicherweise nicht schwer kalkulierbar
OAI-AdsBot OpenAI Werbebezogene Abrufe ja betrifft nur Werbekontexte
ClaudeBot Anthropic Training ja keine Auswirkung auf Sichtbarkeit
Claude-SearchBot Anthropic Suchindex ja Sie erscheinen nicht mehr als Quelle
Claude-User Anthropic Abruf im Auftrag eines Nutzers ja Nutzer können Ihre Seite nicht mehr einbinden
Google-Extended Google Training und Fundierung von Gemini ja (reines robots.txt-Token, kein eigener Browser-Kennung) kein Einfluss auf die Google-Suche
Stand: August 2026. Quellen: OpenAI-Dokumentation zu Bots, Anthropic-Hilfeartikel, Google-Dokumentation zu Crawlern.

Zwei Details lohnen die Aufmerksamkeit. Erstens: Google schreibt in der eigenen Dokumentation ausdrücklich, dass Google-Extended keinen Einfluss darauf hat, ob eine Website in die Google-Suche aufgenommen wird, und auch nicht als Ranking-Signal dient. Sie können Gemini-Training also sperren, ohne Ihre klassische Sichtbarkeit zu gefährden. Zweitens: Änderungen an der robots.txt wirken nicht sofort – OpenAI nennt in der eigenen Dokumentation etwa 24 Stunden Vorlauf.

Was llms.txt ist – und was sie nicht kann

Die Datei llms.txt geht auf einen Vorschlag von Jeremy Howard aus dem September 2024 zurück und liegt seit dem 10. August 2026 in Version 2 vor. Die Idee: eine Markdown-Datei, die einem Sprachmodell in kompakter Form sagt, welche Inhalte eine Website hat und wo die maschinenlesbaren Fassungen liegen. Version 2 erlaubt zusätzlich, die Datei an beliebigen Pfaden abzulegen und Markdown-Varianten einzelner Seiten zu verlinken.

Das klingt sinnvoll – und ist trotzdem kein Ersatz für robots.txt, aus einem simplen Grund: llmstxt.org selbst bezeichnet das Format ausdrücklich als Vorschlag, nicht als Standard. Kein großer Anbieter hat sich verpflichtet, die Datei zu lesen. Google ist sogar ausdrücklich dagegen: In der offiziellen Anleitung zur Optimierung für KI-Funktionen schreibt Google, dass keine zusätzlichen maschinenlesbaren KI-Dateien nötig sind und die Google-Suche sie ignoriert. John Mueller wurde 2026 mit der Einschätzung zitiert, das Thema sei bis auf Weiteres rein spekulativ.

Unsere Empfehlung ist deshalb unspektakulär: Eine llms.txt schadet nicht und kostet zwanzig Minuten. Wer sie anlegen will, soll das tun. Nur sollte niemand erwarten, dass sie Sichtbarkeit erzeugt. Die Arbeit, die tatsächlich wirkt, steckt in sauberen Inhalten, klarer Struktur und einer robots.txt, die die richtigen Bots durchlässt.

Eine robots.txt, die 2026 Sinn ergibt

Für die meisten mittelständischen Websites ist diese Haltung die richtige: Such-Bots erlauben, Trainings-Bots je nach Geschäftsmodell entscheiden.

Erlauben Sie Trainings-Crawler, wenn Sie Reichweite über Inhalte aufbauen und Ihre Texte ohnehin öffentlich sind. Sperren Sie sie, wenn Ihre Inhalte selbst das Produkt sind – bei Fachdatenbanken, kostenpflichtigen Ratgebern, umfangreichen Werkverzeichnissen. Und sperren Sie in jedem Fall die Bereiche, die nie in einem Index landen sollten: Kundenportale, Suchergebnisseiten, Warenkorb, Druckansichten.

Drei Regeln aus der Praxis:

  • Nie mit einem globalen Disallow beginnen. Eine Zeile User-agent: * mit Disallow: / im Kopf der Datei macht alles Folgende wirkungslos und kostet Sie im Zweifel die gesamte Sichtbarkeit.
  • Bot-Namen exakt schreiben. Die Kennungen sind fest vergeben. GPT-Bot oder Claude-Bot mit Bindestrich an der falschen Stelle sind wirkungslos.
  • IP-Sperren sind kein Ersatz. Anthropic weist in der eigenen Hilfe ausdrücklich darauf hin, dass das Blockieren von IP-Bereichen kein taugliches Mittel ist, weil sich die Adressen ändern.

Wenn Sie unsicher sind, was Ihre Datei derzeit erlaubt: Rufen Sie sie unter Ihrer Domain mit dem Zusatz /robots.txt auf und lesen Sie sie Zeile für Zeile. Diese fünf Minuten sind gut investiert.

Rechenbeispiel: Was ein falsches Disallow kostet

Ein Handwerksbetrieb erhält monatlich 40 Anfragen über die Website. Die eigene Auswertung ordnet 6 davon Verweisen aus KI-Antworten zu, also 15 Prozent. Der durchschnittliche Auftragswert liegt bei 2.800 Euro, die Abschlussquote bei 20 Prozent.

  • Aus diesem Kanal entstehen 6 × 0,2 = 1,2 Aufträge im Monat, also rund 3.360 Euro Auftragsvolumen.
  • Auf zwölf Monate hochgerechnet sind das 40.320 Euro, die ein pauschales Disallow für alle KI-Bots kostet.

Dem gegenüber steht die Serverlast, die häufig als Argument für die Sperre dient. Rechnen wir sie ehrlich durch: 600 URLs, fünf KI-Crawler, zwei Abrufe je URL und Monat ergeben 6.000 Abrufe. Bei durchschnittlich 1,4 Megabyte je Seite sind das rund 8,4 Gigabyte im Monat – auf handelsüblichem Hosting keine messbare Größe.

Die Rechnung kippt nur in einem Fall: wenn ein einzelner Bot fehlerhaft arbeitet und dieselben URLs hundertfach am Tag abruft. Dafür gibt es das gezielte Mittel – eine Crawl-Verzögerung für genau diesen Bot statt einer Generalsperre. Anthropic unterstützt diese nicht standardisierte Angabe laut eigener Dokumentation ausdrücklich.

Wie Sie messen, wie viele Besucher tatsächlich aus KI-Antworten kommen, erklären wir im Beitrag Als KMU in Google und KI-Suche gefunden werden.

Bleiben Sie in KI-Antworten sichtbar
Wir werten Ihre Server-Protokolle auf KI-Bots aus, prüfen Ihre robots.txt und richten sie so ein, dass Trainings-Zugriffe gesteuert werden und Ihre Sichtbarkeit erhalten bleibt.

SEO und KI-Suche ansehen Kurz sprechen

Was Sie mit robots.txt nicht erreichen

Drei ehrliche Einschränkungen, die in Anbieter-Dokumentationen zwischen den Zeilen stehen:

Sie verhindern keine Inhaltsübernahme durch Dritte. Die robots.txt ist eine Bitte, kein Zaun. Sie wird von den großen Anbietern respektiert, von unbekannten Diensten aber nicht zwangsläufig. Wer Inhalte technisch schützen will, braucht eine Zugangsbeschränkung.

Sie bekommen Inhalte nicht aus bereits trainierten Modellen heraus. Eine heute gesetzte Sperre wirkt in die Zukunft. Was in einem Modell steckt, das vor zwei Jahren trainiert wurde, bleibt dort.

Sie steuern nutzerinitiierte Abrufe nur bedingt. Wenn jemand Ihre URL in einen Chat kopiert, ruft der Assistent die Seite im Auftrag dieser Person ab. OpenAI weist in der eigenen Dokumentation darauf hin, dass robots.txt-Regeln in diesem Fall möglicherweise nicht greifen – ein rechtlich und technisch noch nicht abschließend geklärter Bereich.

Ein Vorgehen in vier Schritten

  1. Bestand aufnehmen. Serverprotokolle der letzten 30 Tage nach den Bot-Kennungen durchsuchen. Sie sehen dann, welche Bots Sie überhaupt betreffen – oft sind es nur drei oder vier.
  2. Entscheidung treffen. Trainings-Bots erlauben oder sperren? Diese Entscheidung fällt die Geschäftsführung, nicht die IT, denn es ist eine Frage des Geschäftsmodells.
  3. robots.txt schreiben. Such-Bots durchlassen, sensible Verzeichnisse sperren, Bot-Namen exakt setzen, Datei anschließend im Browser prüfen.
  4. Nach vier Wochen kontrollieren. Wieder in die Protokolle sehen: Halten sich die Bots daran? Und in der Search Console prüfen, ob die klassische Sichtbarkeit unverändert ist.

Für Websites, die wir betreuen, ist dieser Durchgang Teil des laufenden Betriebs – siehe Managed Service. Wer die Sichtbarkeit in KI-Antworten gezielt aufbauen will, findet den passenden Rahmen unter SEO und KI-Suche.

Häufige Fragen

Soll ich GPTBot sperren?

Nur, wenn Ihre Inhalte selbst das Produkt sind. GPTBot sammelt Material für künftiges Training und hat nach Angaben von OpenAI nichts damit zu tun, ob Ihre Website in Antworten als Quelle erscheint. Dafür ist OAI-SearchBot zuständig – und den sollten Sie in aller Regel durchlassen.

Brauche ich eine llms.txt?

Notwendig ist sie nicht. Google schreibt in der eigenen Dokumentation, dass zusätzliche KI-Dateien nicht erforderlich sind und die Suche sie ignoriert. Wenn Sie eine anlegen wollen, halten Sie sie aktuell – eine veraltete Inhaltsübersicht ist schlechter als gar keine.

Kostet das Sperren von Google-Extended Rankings?

Nein. Google stellt in der Crawler-Dokumentation ausdrücklich klar, dass Google-Extended weder die Aufnahme in die Google-Suche beeinflusst noch als Ranking-Signal verwendet wird.

Wie erkenne ich, ob ein Bot echt ist?

Über die veröffentlichten IP-Bereiche der Anbieter. OpenAI stellt für jeden Bot eine eigene Adressliste bereit. Prüfen Sie im Zweifel die anfragende Adresse gegen diese Liste – gefälschte Kennungen sind verbreitet.

Wie lange dauert es, bis eine Änderung wirkt?

OpenAI nennt in der eigenen Dokumentation rund 24 Stunden nach einer Änderung der robots.txt. Rechnen Sie bei anderen Anbietern mit ähnlichen Zeiträumen und planen Sie Änderungen nicht auf den letzten Drücker.

Nächster Schritt

Wenn Sie wissen wollen, welche KI-Bots Ihre Seite besuchen und ob Ihre aktuelle robots.txt Sie unbeabsichtigt unsichtbar macht, sehen wir uns das gemeinsam an. Starten Sie mit dem KI-Check oder schreiben Sie uns über das Kontaktformular.

Teilen
Newsletter

Einmal im Monat ein Ablauf aus der Praxis

Wir schreiben nur, wenn wir etwas Handfestes haben: einen Ablauf, den wir selbst gebaut haben, was er gekostet hat, was er einspart — und woran es gehakt hat. Kommt in einem Monat nichts Brauchbares zusammen, bekommen Sie in dem Monat auch keine E-Mail. Abmelden können Sie sich in jeder E-Mail mit einem Klick.

  • Ca. 1× im Monat
  • Abmelden mit einem Klick
  • Keine Weitergabe an Dritte

Zurück zum Anfang

Loslegen

Bereit, KI wirklich arbeiten zu lassen?

Erzählen Sie uns in wenigen Minuten von Ihrem Vorhaben — Sie erhalten eine ehrliche Ersteinschätzung, ganz ohne Verkaufsdruck.

  • Kostenlos & unverbindlich
  • Antwort meist in 1 Werktag
  • DSGVO-konform