Website-Check: Befunde erklärt

KI: Bot-Zugang, Marke und llms.txt

Die Kategorie KI beantwortet zwei Fragen: Dürfen ChatGPT, Claude und Perplexity deine Seiten überhaupt abrufen, und erkennen sie, wer dahintersteht? Zu jedem Befund aus dem Website-Check steht hier, was er bedeutet, warum er zählt und wie du ihn abstellst.

Hasan Kalkan Informatiker, SEO seit 2012 17 Min. Lesezeit

Kurz gesagt

  • 01Der Check liest deine robots.txt und prüft, welche KI-Kennungen lesen dürfen — Suche und Training lassen sich getrennt steuern.
  • 02Läuft die Seite über Cloudflare, entscheidet auch das Dashboard mit: „Block“ beim Training sperrt seit dem 15. September auch Googlebot aus.
  • 03Was ein System nicht lesen darf, kann es nicht als Quelle nennen. Das ist die Tür, alles andere kommt danach.
  • 04Eine llms.txt ist kein Google-Hebel, sondern die kürzeste Selbstbeschreibung deiner Website für andere Agenten und Werkzeuge.

Welche davon betreffen deine Website?

Der Website-Check prüft genau diese Befunde an deiner Domain, meist in unter 40 Sekunden, ohne Anmeldung, und verlinkt jeden Treffer hierher.

Die KI-Befunde stammen aus zwei Werkzeugen des Website-Checks: aus der KI-Sichtbarkeit (sie prüft eine Seite gründlich) und aus dem Quick-Crawl (er prüft die Startseite plus neun weitere Seiten). Deshalb kann derselbe Punkt zweimal auftauchen, einmal aus jedem Werkzeug. Inhaltlich ist es dieselbe Frage.

Bevor du über Formulierungen, Markup oder Struktur nachdenkst: Prüf die Tür. Ein System, das deine Seiten nicht abrufen darf, kann sie auch nicht empfehlen — und merkt nicht einmal, dass es etwas verpasst.

KI-Crawler ausgesperrt: ChatGPT, Claude und Perplexity dürfen nicht lesen

Was das heißt

Der Check ruft deine robots.txt ab und prüft neun Kennungen: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot, Google-Extended und Bingbot. Im Ergebnis steht dann grün „KI-Crawler dürfen lesen“, gelb „X von 9 KI-Crawlern ausgesperrt“ mit Namen — oder gelb „Alle KI-Crawler ausgesperrt“. Sperrt die Datei nur das Training, also GPTBot oder ClaudeBot, und bleiben die Kennungen für Suche und Abruf offen, steht dort grün „KI-Crawler für Suche und Abruf dürfen lesen“, ohne Punktabzug. Der Quick-Crawl meldet dasselbe für die sieben Kennungen von ChatGPT, Claude und Perplexity.

Warum es zählt

Die Hersteller sagen es selbst. OpenAI zu OAI-SearchBot: „Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers.“ Anthropic zu Claude-SearchBot: Wer ihn sperrt, wird nicht für die Suche erfasst, „which may reduce your site’s visibility“. Perplexity empfiehlt, PerplexityBot zu erlauben, damit die Seite in den Ergebnissen erscheint. Google braucht keine Extra-Freigabe — dafür muss die Seite normal crawlbar und indexierbar sein. Google-Extended ist der Sonderfall in der Liste: Es steuert Training und Grounding der Gemini-Apps, und Google hält ausdrücklich fest, dass es die Google-Suche nicht betrifft — wer es sperrt, verliert also nichts in den KI-Übersichten. Ausführlich je System: ChatGPT-SEO — vier OpenAI-Bots, einer entscheidet, Perplexity-SEO — zwei Bots, zwei Regeln und Google KI-Übersichten und KI-Modus.

So behebst du es

Öffne deine-domain.de/robots.txt und suche die Zeilen mit diesen Namen; entferne die Disallow-Regeln für die Systeme, die lesen dürfen sollen. Shopify: robots.txt.liquid im Theme. Shopware 6: Datei im öffentlichen Verzeichnis. WordPress: Editor in Yoast oder Rank Math, sonst eine echte Datei im Hauptverzeichnis. JTL: erst das Shop-Hauptverzeichnis, dann den Template-Ordner. Danach den Bot-Schutz prüfen: Cloudflare oder eine WAF können KI-Crawler blockieren, obwohl die robots.txt sie erlaubt, mehr dazu unter Cloudflare vor deiner Seite. Bei OpenAI zieht die Suche laut Doku nach rund 24 Stunden nach.

Quelle

OpenAI, Overview of OpenAI Crawlers (abgerufen 23.09.2026) · Anthropic, Does Anthropic crawl data from the web, and how can site owners block the crawler? (abgerufen 23.09.2026) · Perplexity, Perplexity Crawlers (abgerufen 23.09.2026) · Google, AI Optimization Guide (abgerufen 23.09.2026) · zu Google-Extended: Google, Latest documentation updates — „we specified that Google-Extended doesn’t affect Google Search“ (abgerufen 23.09.2026). Dass Bot-Schutz und Firewall häufiger blockieren als die robots.txt: Erfahrungswert aus unseren Audits.

Nur einzelne KI-Crawler gesperrt: ein System liest, das andere nicht

Was das heißt

Hier ist die Tür halb offen. Der Quick-Crawl meldet „X KI-Crawler ausgesperrt“ und nennt die betroffenen Kennungen mit Klarnamen, zum Beispiel „OAI-SearchBot — ChatGPT-Suche“. Typisch ist eine Mischung aus gesperrten und erlaubten Bots — und dass niemand im Unternehmen diese Entscheidung bewusst getroffen hat.

Warum es zählt

Die Regeln gelten je Kennung, nicht pauschal. OpenAI schreibt: „Each setting is independent of the others – for example, a webmaster can allow OAI-SearchBot in order to appear in search results while disallowing GPTBot to indicate that crawled content should not be used for training OpenAI’s generative AI foundation models.“ Du kannst Suche und Training also bewusst trennen — oder versehentlich das Falsche sperren. Der unangenehme Fall ist: Such-Crawler gesperrt, Training erlaubt. Dann liest ein System deine Inhalte für seine Modelle, nennt dich aber nicht als Quelle.

So behebst du es

Geh die Liste im Ergebnis Zeile für Zeile durch. Wer in KI-Antworten vorkommen will, lässt mindestens die Such-Kennungen zu: OAI-SearchBot, Claude-SearchBot, PerplexityBot. Beim Training — GPTBot und ClaudeBot, im Check als Training gekennzeichnet — entscheidest du; eine reine Trainings-Sperre kostet im Check keine Punkte, solange die Such- und Abruf-Kennungen offen sind. Google-Extended steuert laut Google neben dem Training auch das Grounding in den Gemini-Apps, seine Sperre kostet deshalb Punkte wie die einer Such-Kennung. Wichtig ist nur, dass es eine Entscheidung ist. Prüf danach, woher die Regel kam: nach meiner Erfahrung steckt fast immer eine Vorlage dahinter, in WordPress ein Plugin, in Shopify das Theme, bei Managed Hosting der Anbieter. Sonst steht die Sperre beim nächsten Update wieder drin. Welche Kennung was bewirkt, samt Generator für die robots.txt-Regeln: Perplexity-SEO.

Quelle

OpenAI, Overview of OpenAI Crawlers (abgerufen 23.09.2026) · Anthropic, Does Anthropic crawl data from the web? (abgerufen 23.09.2026) · Google, Google’s common crawlers — Google-Extended steuert das Training und „grounding […] in Gemini Apps“ (abgerufen 29.09.2026). Dass solche Einzelsperren meist aus Vorlagen stammen: Erfahrungswert aus unseren Audits.

Cloudflare vor deiner Seite: Sperren, die in keiner Datei stehen

Was das heißt

Der Check liest die Antwort-Kopfzeilen deiner Seite. Steht dort Server: cloudflare oder eine cf-ray-Kennung, läuft die Seite über Cloudflare, und im Ergebnis steht gelb „Cloudflare entscheidet mit, welche Crawler durchkommen“. Das ist ein Prüfhinweis, kein Fehler: Ob Cloudflare Crawler abweist, sieht man von außen nicht. Deshalb zählt der Befund nicht in den Score. Nachstellen lässt es sich auch nicht, denn Cloudflare unterscheidet geprüfte Bots von Abrufen, die sich nur so nennen. Ein Test, der sich als GPTBot ausgibt, bewiese also nichts. Wir geben uns deshalb grundsätzlich nicht als fremder Crawler aus.

Warum es zählt

Seit dem 15. September 2026 hat Cloudflare drei getrennte Einstellungen für KI-Verkehr: Search, Training und Agent. Beim Training entscheidet ein Wort über deine Google-Sichtbarkeit. Cloudflare schreibt: „Block and Block on pages with ads now apply to mixed-use crawlers, including Applebot, Bingbot, and Googlebot, so either setting impacts search as well as training.“ Wer beim Training „Block“ wählt, sperrt also auch Googlebot aus, die Suche eingeschlossen. Die Alternative heißt „Disallow AI Training“: Dann dürfen Googlebot, Applebot und Bingbot für die Suche weiter lesen, und nur die übrigen Trainings-Crawler werden gesperrt, etwa die von OpenAI, Anthropic, Meta und Amazon.

Dazu kommen die Voreinstellungen. Wer seit dem 15. September eine neue Domain anmeldet, bekommt eine Voreinstellung angeboten, abhängig davon, ob die Seite mit Werbung Geld verdient. Mit Werbung: Suche erlaubt, Training untersagt, KI-Agenten auf Seiten mit Werbung gesperrt. Ohne Werbung ist alles erlaubt. Agenten sind laut Cloudflare Abrufe, die in Echtzeit im Auftrag eines Menschen laufen, also auch die Abrufe aus einem Chat heraus. Bestehende Domains hat Cloudflare so umgestellt, dass die Wirkung gleich bleibt. Wer beim Training bisher „Block“ hatte, steht jetzt auf „Disallow AI Training“.

So behebst du es

Öffne im Cloudflare-Dashboard deiner Domain Security → Settings und dort die Einstellungen für KI-Bots. Für die meisten Unternehmensseiten passt: Search erlauben. Training nach eigener Entscheidung, aber mit „Disallow AI Training“ statt „Block“, wenn du in Google, Bing und bei Apple gefunden werden willst. Agent erlauben, wenn ChatGPT oder Perplexity deine Seiten abrufen dürfen sollen, sobald jemand im Chat danach fragt. Prüf danach eigene Firewall-Regeln (WAF): Cloudflare hält fest, dass eine eigene Regel Crawler auch dann sperrt, wenn die KI-Einstellung sie erlaubt. Zum Schluss die Gegenprobe in der Google Search Console unter Einstellungen → Crawling-Statistik: Ruft Googlebot normal ab, oder häufen sich Fehlerantworten?

Quelle

Cloudflare, Have it both ways: stay discoverable in search while disallowing AI training (15.09.2026, abgerufen 25.09.2026) — Block und Disallow AI Training, Voreinstellungen für neue Domains, Umstellung bestehender Domains · Cloudflare, Cloudflare Helps End the Search-or-AI-Training Tradeoff (15.09.2026, abgerufen 25.09.2026) · Cloudflare Docs, Block AI Bots — Einteilung in Search, Agent und Training (abgerufen 25.09.2026).

Ein Teil deiner robots.txt kommt von Cloudflare

Was das heißt

Cloudflare kann einen eigenen Block an den Anfang deiner robots.txt schreiben. Früher hieß die Funktion „Managed robots.txt“, erkennbar an der Zeile # BEGIN Cloudflare Managed content. Seit dem 15. September 2026 wird sie durch „Bot Preference Sync“ ersetzt, erkennbar an der Zeile # BEGIN Cloudflare Bot Preference Sync. Der Check erkennt beide Markierungen und nennt die Bots, die dieser Block mit Disallow: / sperrt. Gelb ist der Befund dann, wenn der Block Bots sperrt.

Warum es zählt

Der Block kommt aus deinen Cloudflare-Einstellungen, nicht aus deiner Datei. Cloudflare setzt ihn vor deinen eigenen Inhalt, deine Regeln bleiben erhalten. Bei neuen Kunden ist die Synchronisierung laut Cloudflare von Anfang an eingeschaltet. Wer die Datei auf dem Server bearbeitet, ändert am Cloudflare-Teil also nichts. Die Zeilen darin können gewollt sein: Google-Extended gesperrt heißt zum Beispiel „kein Training und kein Grounding für die Gemini-Apps“ und berührt die Google-Suche nicht. Steht dort dagegen ein Bot, den du für deine Sichtbarkeit brauchst, gehört das geklärt.

So behebst du es

Ist die Sperre gewollt, musst du nichts tun. Ist sie es nicht, ändere sie in Cloudflare unter Security → Settings und nicht in der Datei, denn dort entsteht der Block. Willst du deine robots.txt komplett selbst schreiben, schalte die Synchronisierung in Cloudflare ab. Danach den Check noch einmal laufen lassen: Der Cloudflare-Block muss verschwunden oder angepasst sein.

Quelle

Cloudflare, Say it once: introducing Bot Preference Sync (21.08.2026, mit Nachtrag vom 15.09.2026; abgerufen 25.09.2026) — Markierung, Voranstellen vor den eigenen Inhalt, Standard für neue Kunden · Cloudflare Docs, robots.txt setting — Aufbau der früheren Managed robots.txt (Stand 03.08.2026, abgerufen 25.09.2026) · Cloudflare, Have it both ways — Ablösung der Managed robots.txt durch Bot Preference Sync (15.09.2026) · zu Google-Extended: Google, Latest documentation updates (abgerufen 23.09.2026).

Content-Signal in der robots.txt: was search, ai-input und ai-train bedeuten

Was das heißt

Manche robots.txt enthält eine Zeile wie Content-signal: search=yes, ai-train=no. Sie sagt nach der Content Signals Policy, wofür Inhalte verwendet werden dürfen. Die Policy kennt drei Zwecke. search steht für Suchindex und Suchergebnisse mit Links und kurzen Auszügen, ausdrücklich ohne KI-Zusammenfassungen. ai-input steht für die Nutzung als Quelle, wenn eine KI eine Antwort erzeugt, etwa beim Abruf während einer Anfrage. ai-train steht für Training und Feinabstimmung von KI-Modellen. Der Check übersetzt die Zeile und zeigt sie grün an, denn es gibt nichts zu reparieren.

Warum es zählt

Das Signal ist eine Erklärung, keine Sperre. Die Policy formuliert jedes „no“ als ausdrücklichen Rechtevorbehalt nach Artikel 4 der EU-Richtlinie 2019/790, also als Vorbehalt gegen Text- und Data-Mining. Ob ein Anbieter das Signal auswertet, entscheidet er selbst. Fehlt ein Zweck in der Zeile, erlaubst du ihn damit nicht und verbietest ihn auch nicht. So steht es in der Policy.

So behebst du es

Nichts zu beheben, nur zu entscheiden: Passt die Zeile zu dem, was du willst? Wer in KI-Antworten als Quelle vorkommen will, sollte ai-input nicht auf „no“ setzen. Stammt die Zeile aus dem Cloudflare-Block, änderst du sie in Cloudflare, sonst in deiner eigenen robots.txt.

Quelle

Wortlaut der Content Signals Policy, wiedergegeben in Cloudflare Docs, robots.txt setting: „search: building a search index and providing search results … Search does not include providing AI-generated search summaries“, Rechtevorbehalt „under Article 4 of the European Union Directive 2019/790“, fehlendes Signal „neither grants nor restricts permission“ (Stand 03.08.2026, abgerufen 25.09.2026).

Google kennt deine Marke noch nicht als Entität: ein Name ohne Wissen dahinter

Was das heißt

Der Check nimmt den Markennamen — aus deinem Organisations-Markup, sonst aus Titel und Domain — und fragt damit Googles Knowledge-Graph-Suche ab. Gibt es einen Eintrag, steht im Ergebnis „Google kennt ‘deine Marke’ als Entität“ samt Typ und Kurzbeschreibung; sonst der gelbe Befund „noch nicht als Entität“. Das ist kein Fehler in deiner Website: Für die meisten kleinen und mittleren Unternehmen ist der leere Eintrag der Normalzustand.

Warum es zählt

Ein Name ohne Eintrag ist für eine Maschine eine Zeichenkette. Ein Name mit Eintrag ist ein Unternehmen mit Art, Ort und Angebot. Aus unseren Audits: Marken, deren Identität überall gleich hinterlegt ist, werden in KI-Antworten eher als eigenständiger Anbieter genannt und seltener mit ähnlich klingenden Namen verwechselt. Eine Google-Zusage dafür gibt es nicht, und ich tue auch nicht so. Deshalb ist dieser Befund gelb und nicht rot. Warum Entitäten in der KI-Suche an die Stelle von Keywords treten: GEO vs. SEO.

So behebst du es

Fang beim maschinenlesbaren Absender an: Google empfiehlt Organisations-Daten auf der Startseite, mit Name, Website-Adresse, Logo und sameAs-Verweisen auf weitere Profile — die Felder und der passende Untertyp stehen unter Kein Organisations-Markup. Danach die Fleißarbeit: identische Angaben in Branchenverzeichnissen, im Unternehmensprofil bei Google und in Social-Profilen, bei belegbaren Fakten ein Wikidata-Eintrag. Umsetzung: WordPress über Yoast oder Rank Math, Shopify über einen JSON-LD-Block im Theme, Shopware und JTL über das Template. Rechne in Monaten.

Quelle

Für das Markup: Google, Organization (Organisation) structured data — Organisations-Daten gehören auf die Startseite (abgerufen 23.09.2026). Die Wirkung eines Knowledge-Graph-Eintrags auf KI-Antworten ist ein Erfahrungswert aus unseren Audits, keine Google-Aussage.

Entitäten im Seitentext: Google liest aus deinem Text etwas anderes heraus als dein Angebot

Was das heißt

Der Check schickt Titel, Beschreibung, Hauptüberschrift und einen Textauszug deiner Seite, zusammen höchstens 1.000 Zeichen, an Googles Natural Language API, Version 1. Deren Entitätsanalyse sucht die Dinge, über die ein Text spricht: Organisationen, Personen, Orte, Produkte. Zu jeder Entität liefert sie einen Typ und einen Wert zwischen 0 und 1, wie zentral sie für den ganzen Text ist; bei Google heißt das „salience“. Kennt Google die Entität, hängt die Schnittstelle ihre Knowledge-Graph-Kennung an. Der Prüfpunkt „Marke im Text erkannt“ zählt 10 von 100 Punkten. Voll zählt er, wenn Google deine Marke als Organisation, Produkt oder Begriff erkennt und sie unter den drei Entitäten mit dem meisten Gewicht steht. Gelb wird es in drei Fällen: Die Marke steht weiter hinten (5 Punkte), Google liest den Namen als etwas anderes, etwa als Person oder Ort (3 Punkte), oder die Marke fehlt ganz (0 Punkte). Ob dein Ort und dein Angebot erkannt werden, zeigt der Befund zusätzlich, ohne Punkte.

Haben wir keine belastbare Aussage, nehmen wir den Punkt aus der Wertung, statt ihn als verfehlt zu zählen: Dein Score wird dann ohne ihn berechnet. Das passiert, wenn die Schnittstelle nicht antwortet, bei uns gerade abgeschaltet ist oder unser Zähler ausfällt, wenn unser Kontingent für den Tag, den Monat oder für Abfragen aus deinem Netz erreicht ist, ab der dritten neuen Seite derselben Domain innerhalb von 24 Stunden, wenn auf der Seite zu wenig Text steht, und wenn dein Markenname auf der Seite nur schwach belegt ist, etwa nur durch die Domain: Dann würde „Marke fehlt“ nichts über deinen Text sagen. Eine schon geprüfte Seite mit unverändertem Text behält 24 Stunden lang ihr Ergebnis, auch wenn das Kontingent inzwischen erreicht ist.

Warum es zählt

Ein Sprachmodell kann nur zitieren, was im Text steht. Google sagt es für die KI-Funktionen nüchtern: Wichtiges gehört als Text auf die Seite, „available in textual form“. Stehen oben „Cookies“, „Newsletter“ und „Warenkorb“, erzählt deine Startseite einer Maschine vor allem etwas über ihre Technik. Die Grenze gehört dazu: Die Natural Language API ist ein Dienst von Google Cloud. Dass die Google-Suche oder ein Chatbot deinen Text genauso auswertet, dokumentiert Google nicht. Der Befund ist ein Spiegel, kein Ranking-Faktor, deshalb gelb und nicht rot.

So behebst du es

Die Liste der erkannten Entitäten zeigt der KI-Check: Im Ergebnis steht unter dem Textauszug „Was Google in deinem Text erkennt“, mit den fünf Entitäten mit dem meisten Gewicht. Der Website-Check zeigt nur den Befund. Geh die Liste von oben nach unten durch und stell drei Fragen. Steht deine Marke dabei, und zwar als Organisation? Steht dein Angebot unter den fünf wichtigsten Themen? Steht dein Ort dabei, wenn du lokal arbeitest? Hat deine Marke keine Knowledge-Graph-Kennung, lies weiter unter Marke als Entität: Das ist dieselbe Frage, nur vom Knowledge Graph aus gestellt.

Dann der Text, aber nicht mit mehr Wiederholungen: Google schreibt ausdrücklich, dass du für KI-Suchen nicht anders schreiben musst, weil die Systeme Synonyme und Bedeutungen verstehen. Was hilft, ist ein klarer erster Absatz: wer du bist, was du anbietest, für wen und wo, in ganzen Sätzen, mit deinem Firmennamen. Danach im KI-Check den Textauszug ansehen, er steht unter „Was eine KI als Erstes von deiner Startseite liest“: Füllen Cookie-Hinweis, Newsletter-Box oder Menü den Anfang, liegt das am Aufbau der Startseite, in WordPress am Theme, in Shopify an den Abschnitten der Startseite, in Shopware und JTL am Template. Beim nächsten Lauf des Checks siehst du, ob der Text jetzt richtig ankommt.

Quelle

Google Cloud, Natural Language API v1: Entity — salience „the importance or centrality of that entity to the entire document text“, Metadaten „Knowledge Graph MID (mid), if they are available“ (Stand 13.06.2025, abgerufen 26.09.2026) · Google Cloud, Natural Language API basics — „Entity analysis is useful for disambiguating similar entities“ (Stand 24.09.2026, abgerufen 26.09.2026) · Google Cloud, Language support — Deutsch für die Entitätsanalyse unterstützt (abgerufen 26.09.2026) · Google, AI features and your website — „Making sure that important content is available in textual form“ (Stand 10.12.2025, abgerufen 26.09.2026) · Google, AI Optimization Guide — „You don’t need to write in a specific way just for generative AI search“ (Stand 10.07.2026, abgerufen 26.09.2026).

Keine oder dünne llms.txt: die kürzeste Selbstbeschreibung fehlt

Was das heißt

Der Check ruft deine-domain.de/llms.txt ab und unterscheidet vier Fälle: Da liegt nichts. Die Datei ist da, liest sich aber wie Systemdokumentation der Shop-Plattform — viel Checkout, Cart, Endpoints, über die Marke kaum ein Wort. Die Datei ist da, hat aber keine Überschrift oder keinen Link und fällt damit durch die Lighthouse-Prüfung. Oder alles vorhanden, grün. Dazu bekommst du im Ergebnis einen fertigen llms.txt-Entwurf für deine Domain.

Warum es zählt

Für Google gar nicht: Google schreibt ausdrücklich, dass es keine zusätzlichen maschinenlesbaren Dateien braucht, weil die Suche sie selbst nicht verwendet. Wer dir llms.txt als Ranking-Maßnahme verkauft, hat die Doku nicht gelesen. Wert hat die Datei woanders — als knappste Selbstbeschreibung für Agenten und Werkzeuge, die gezielt lesen, und Lighthouse prüft sie im Bereich Agentic Browsing. Ausführlich mit Vorlage: llms.txt richtig anlegen.

So behebst du es

Leg eine Markdown-Datei unter /llms.txt ab; für Lighthouse braucht sie eine H1, mindestens einen Markdown-Link und mehr als 50 Zeichen. WordPress, Shopware und JTL: Datei ins Haupt- beziehungsweise öffentliche Verzeichnis legen und vom Caching ausnehmen. Shopify lässt dort keine freien Dateien zu — da brauchst du einen Dienst davor, etwa dein CDN. Und schreib sie selbst: die Plattform-Version erklärt, wie man kauft, nicht warum man empfehlen sollte. Aufbau, die drei Regeln und eine Vorlage zum Kopieren: llms.txt richtig anlegen.

Quelle

Google, AI Optimization Guide: „You don’t need to create new machine readable files, AI text files, markup, or Markdown to appear in Google Search (including its generative AI capabilities), as Google Search itself doesn’t use them“ (abgerufen 23.09.2026) · Standard-Vorschlag: llms.txt von Jeremy Howard, H1 als einzige Pflichtangabe (abgerufen 23.09.2026) · Prüfkriterien: Lighthouse-Audit llms-txt, Version 13 — H1, mindestens ein Link, mindestens 50 Zeichen (abgerufen 23.09.2026).

llms.txt nicht prüfbar: der Server lässt unseren Abruf nicht durch

Was das heißt

Beim Abruf von /llms.txt bekommt der Check keine Datei, sondern eine Abweisung (HTTP 401, 403, 406 oder 429) oder eine Prüfseite von Cloudflare, die einen Browser erwartet. Im Ergebnis steht dann gelb „llms.txt nicht prüfbar — der Server verweigert den Abruf“, dahinter der Grund. Den Punkt nehmen wir aus der Wertung, statt zu raten: Dein Score wird ohne ihn berechnet.

Warum es zählt

Ob dort eine Datei liegt, lässt sich von außen nicht sagen. Die Sperre trifft aber womöglich nicht nur uns: Server, Firewall oder CDN, die automatisierte Abrufe abweisen, können auch KI-Agenten abweisen. Google zählt es für die KI-Funktionen zu den Grundlagen, dass Crawling in der robots.txt erlaubt ist und „by any CDN or hosting infrastructure“. OpenAI rät, beim Hoster oder CDN den Verkehr von den veröffentlichten IP-Adressen des Such-Crawlers zuzulassen. Wir geben uns dabei nicht als fremder Crawler aus, ein Test als „GPTBot“ bewiese nichts, mehr dazu unter Cloudflare vor deiner Seite.

So behebst du es

Ruf deine-domain.de/llms.txt im Browser auf. Lädt die Datei dort, lässt die Regel Browser durch und automatisierte Abrufe nicht. Welche Regel greift, steht in den Bot- oder Firewall-Einstellungen von Hoster oder CDN, oft auch im Server-Log mit Uhrzeit und Statuscode.

Wenn Agenten die Datei lesen sollen, gib den Pfad /llms.txt in der Bot- oder Firewall-Regel frei, am saubersten als Ausnahme nur für diesen Pfad. Lass den Check danach noch einmal laufen: Dann bewertet er auch den Inhalt. Willst du überhaupt keine Agenten auf der Seite, ist die Sperre konsequent, und die Datei brauchst du dann auch nicht. Wie eine gute llms.txt aussieht: Keine oder dünne llms.txt.

Quelle

Google, AI features and your website — „Ensuring that crawling is allowed in robots.txt, and by any CDN or hosting infrastructure“ (Stand 10.12.2025, abgerufen 26.09.2026) · OpenAI-Hilfe, Searching the web with ChatGPT — „confirm that the website host or content delivery network allows traffic from OpenAI’s published searchbot IP addresses“ (abgerufen 26.09.2026).

Reihenfolge, wenn du nur eine Stunde hast: Erst die robots.txt und den Bot-Schutz — ohne Zugang zählt nichts anderes. Dann das Organisations-Markup auf der Startseite, damit klar ist, wer sendet. Die llms.txt zuletzt: nett, schnell gemacht, aber kein Ersatz für die beiden ersten Punkte.

Der nächste Schritt

Prüf deine Domain im Website-Check. Das Ergebnis des Website-Checks verlinkt bei jedem Befund genau hierher. Du siehst, welche der neun Kennungen lesen dürfen, ob Google deine Marke kennt und in deinem Text erkennt, was in deiner llms.txt steht, und bekommst einen Entwurf für die Datei dazu. Welche Entitäten Google in deinem Text genau erkennt und welchen Textauszug eine KI zuerst liest, zeigt der KI-Check. Ob KI-Assistenten wie ChatGPT, Gemini und Perplexity dich tatsächlich nennen, zeigt dort die Stichprobe im vollständigen Bericht, erklärt unter Nennt dich die KI?.

Kurz beantwortet.

Wenn ich die KI-Crawler sperre, hört ChatGPT dann ganz auf, meine Seite zu lesen?

Nein. Die robots.txt steuert die automatischen Crawler. Für Abrufe, die ein Mensch im Chat auslöst, gilt das nur eingeschränkt: OpenAI schreibt zu ChatGPT-User „Because these actions are initiated by a user, robots.txt rules may not apply“, Perplexity schreibt zu Perplexity-User „Since a user requested the fetch, this fetcher generally ignores robots.txt rules“ (beide abgerufen 23.09.2026). Für die Frage, ob du als Quelle in Antworten auftauchst, zählen trotzdem die Such-Crawler — und die halten sich an die robots.txt.

Kann ich das Training verbieten und trotzdem in den KI-Antworten vorkommen?

Ja, bei OpenAI ausdrücklich. In der Crawler-Dokumentation steht: „Each setting is independent of the others – for example, a webmaster can allow OAI-SearchBot in order to appear in search results while disallowing GPTBot to indicate that crawled content should not be used for training“ (abgerufen 23.09.2026). Anthropic und Perplexity trennen ihre Kennungen ebenfalls nach Suche und Training.

Sperrt Cloudflare KI-Crawler auf meiner Seite automatisch?

Nicht ohne dein Zutun. Bestehende Domains hat Cloudflare zum 15. September 2026 so umgestellt, dass die Wirkung der alten Einstellung gleich bleibt. Neue Domains bekommen bei der Anmeldung eine Voreinstellung angeboten: Mit Werbung ist Training untersagt und KI-Agenten sind auf Seiten mit Werbung gesperrt, ohne Werbung ist alles erlaubt. Was bei dir gilt, steht im Dashboard unter Security → Settings (Cloudflare-Blog vom 15.09.2026, abgerufen 25.09.2026).

Brauche ich eine llms.txt, damit ich bei Google in den KI-Übersichten erscheine?

Nein. Google schreibt im AI-Optimization-Guide: „You don’t need to create new machine readable files, AI text files, markup, or Markdown to appear in Google Search (including its generative AI capabilities), as Google Search itself doesn’t use them“ (abgerufen 23.09.2026). Die Datei ist ein Angebot an andere Agenten und Werkzeuge, kein Google-Hebel.

Wie schnell wirkt eine Änderung an der robots.txt?

Bei OpenAI dauert es laut Dokumentation rund 24 Stunden, bis sich die Suchsysteme auf eine geänderte robots.txt einstellen, Perplexity nennt ebenfalls bis zu 24 Stunden (beide abgerufen 23.09.2026). Ein Eintrag im Knowledge Graph ist etwas anderes: der kommt nach unserer Erfahrung in Monaten, nicht in Tagen.

Willst du wissen, wo deine Website heute steht?

20 Minuten, datenbasiert, unverbindlich. Ich schaue mir deine Domain vorher an — du bekommst keine Folien, sondern Befunde.

Kostenlosen Check anfragen