GEO-Datenreport 2026: Welche AI Crawler & LLM Bots nehmen am meisten und geben am wenigsten zurück?

Mistral crawlt 3.389 Seiten für jeden Referral, den es zurückschickt – jetzt der extraktivste AI Bot im Web, vor Anthropic (2.237:1) und OpenAI (217:1). Ich habe Cloudflare Radars globales Netzwerk gegen SEOmators eigenes Panel aus 500+ Seiten abgeglichen, um das Crawl-to-Refer-Verhältnis für Juli 2026 neu aufzubauen.

Veröffentlicht
GEO-Datenreport 2026: Welche AI Crawler & LLM Bots nehmen am meisten und geben am wenigsten zurück?

Mistrals Crawler holt sich inzwischen 3.389 Seiten für jeden Referral, den seine Plattform an einen Website-Betreiber zurückschickt – womit er im Juli 2026 der extraktivste AI Bot im offenen Web ist. Anthropics ClaudeBot, der diesen Titel früher im Jahr hielt, ist auf 2.237:1 gefallen; OpenAIs GPTBot liegt bei 217:1; DuckDuckGo läuft mit 2,5:1 nahezu auf Parität. Diese Werte stammen aus Cloudflare Radars gleitendem 28-Tage-Fenster bis zum 21. Juli 2026 – und ich habe jeden einzelnen gegen einen völlig unabhängigen Datensatz geprüft: SEOmators eigenes Messnetzwerk aus 500+ Seiten und 50 Mio.+ monatlichen Nutzern. Die beiden Netzwerke stimmen fast Zeile für Zeile überein, und genau das macht die Kennzahl im Zentrum dieses Reports vertrauenswürdig: das Crawl-to-Refer-Verhältnis – die Anzahl der Seiten, die ein AI Crawler oder LLM Bot crawlt, geteilt durch die Referrals, die seine Mutterplattform (ChatGPT, Claude, Perplexity, Mistral, Copilot) zurückschickt.

Datenquellen: Cloudflare Radar – Bot & Crawler Analytics (gleitendes 28-Tage-Fenster bis zum 21. Juli 2026), abgeglichen mit SEOmators eigenem Crawling- und Analytics-Netzwerk (500+ überwachte Seiten, 50 Mio.+ monatlich getrackte Nutzer, Januar–Juli 2026).

GEO-Datenreport 2026 zeigt, welche AI Crawler und LLM Bots die höchsten Crawl-to-Refer-Verhältnisse haben

Was ist das Crawl-to-Refer-Verhältnis und warum ist es für GEO und SEO wichtig?

Das Crawl-to-Refer-Verhältnis misst, wie viele Seiten ein AI Crawler oder LLM Bot von deiner Website crawlt für jeden Referral-Besuch, den er zurückschickt. Ein Verhältnis von 100:1 bedeutet, dass der Bot 100 deiner Seiten gecrawlt hat, bevor seine Mutterplattform einen einzigen Nutzer auf deine Seite gelenkt hat.

Diese Kennzahl ist wichtig, weil AI Crawler – GPTBot, ClaudeBot, PerplexityBot und andere – deine Serverressourcen verbrauchen (Bandbreite, Rechenleistung und Crawl-Budget), während sie deine Inhalte für ihre LLM-Modelle indexieren. Die Referral-Seite misst, ob sich diese Investition durch tatsächlichen Traffic auszahlt, der an deine Seite zurückfließt.

Für SEO- und GEO-Profis fungiert dieses Verhältnis als Return-on-Investment-Kennzahl für den Crawler-Zugriff. Jede Seite, die von einem LLM Bot gecrawlt wird, ist eine Seite, die stattdessen vom Googlebot hätte gecrawlt werden können – was sich direkt auf die Verteilung des Crawl-Budgets deiner Seite auswirkt. Und die Last ist längst kein Rundungsfehler mehr: Über die 500+ Seiten, die SEOmator überwacht, sind AI-bezogene Bots (Crawler, Assistenten und AI-Search-Fetcher zusammen) von rund 18 % des gesamten Bot-Traffics im Januar auf etwa 34 % bis Juli 2026 gewachsen – fast jede dritte Bot-Anfrage, auf einem Business-Web-Panel, das aggressiv blockiert.

Wie schneiden die führenden AI Crawler und LLM Bots beim Crawl-to-Refer-Verhältnis ab?

Die Spanne zwischen dem besten und dem schlechtesten Crawl-to-Refer-Verhältnis umfasst weiterhin drei Größenordnungen, doch die Rangfolge an der Spitze hat sich seit Jahresbeginn verändert. Mistral – im Frühjahr auf dieser Auswertung noch ein Rundungsfehler – ist an die extraktivste Position vorgeprescht, während Anthropic und OpenAI, einst die haushohen Spitzenreiter, ihre Verhältnisse um eine Größenordnung gesenkt haben.

BetreiberCrawl-to-Refer-Verhältnis (Juli 2026)Was das bedeutet
Mistral3.389:1Crawlt 3.389 Seiten pro 1 Referral – der neue extraktivste Betreiber
Anthropic (ClaudeBot)2.237:1Deutlich gefallen von fünfstelligen Verhältnissen früher im Jahr 2026
Perplexity (PerplexityBot)225:1Steigend – einer der wenigen Betreiber, die extraktiver werden
OpenAI (GPTBot)217:1Von vierstelligen Werten eingebrochen, als ChatGPT Search reifte
Microsoft (Copilot)35:1Umfasst Copilot- und Bing-AI-Funktionen
Yandex26:1Russische Suche mit wachsenden AI-Funktionen
Baidu12:1Chinesische Suche mit etablierten Referral-Mustern
ByteDance11:1TikToks Mutterkonzern – Referrals stiegen über H1
Google (Gemini / AI Overviews)4,6:1Klassische Suche treibt hohes Referral-Volumen
DuckDuckGo2,5:1Nahezu Parität – das effizienteste Verhältnis aller Betreiber

Mistral und Anthropic sitzen aus demselben strukturellen Grund am extraktiven Ende: Beide sind in erster Linie Modelltraining-Operationen, deren Verbraucheroberflächen wenig bis gar keinen klickbaren Referral-Traffic zurückschicken. Google und DuckDuckGo sitzen am effizienten Ende, weil ihre Kernfunktion darin besteht, Nutzer an Websites zu schicken – jeder Klick auf ein Suchergebnis ist ein Referral. Ich verfolge diese Betreiber seit fast einem Jahr in Server-Logs, und die Diskrepanz ist auf Ebene der einzelnen Seite immer noch frappierend.

Zwei unabhängige Netzwerke, eine Geschichte

Cloudflare Radar misst Cloudflares globales Netzwerk. SEOmators Agent Analytics misst eine völlig andere Population – 500+ überwiegend B2B-Seiten, 50 Mio.+ Nutzer im Monat – und berechnet dasselbe Verhältnis aus seinen eigenen Crawl-Logs und seinen eigenen Referral-Sessions. Wenn zwei Netzwerke ohne gemeinsame Infrastruktur auf denselben Zahlen landen, ist das Signal echt. Hier ist Juli 2026 nebeneinander:

BetreiberCloudflare Radar (global)SEOmator-Panel (B2B-gewichtet)
Mistral3.389:16.021:1
Anthropic2.237:12.363:1
Perplexity225:1263:1
OpenAI217:1179:1
Microsoft35:135:1
Google4,6:14,0:1
DuckDuckGo2,5:12,7:1

Die Übereinstimmung bei Anthropic (2.237 vs. 2.363), Microsoft (35 vs. 35) und Google (4,6 vs. 4,0) ist eng genug, um auszuschließen, dass einer der beiden Datensätze ein Artefakt ist. Beide markieren zudem unabhängig voneinander Mistral als den neuen Extraktions-Spitzenreiter und Perplexity als stillen Ausreißer, der sich in die falsche Richtung bewegt. Das Verständnis dieses Verhältnisses ist inzwischen ein Kernbestandteil jeder ernsthaften AI-Search-Optimierungsstrategie.

Warum ist die Extraktionslücke 2026 eingebrochen?

Googles struktureller Vorteil bei der AI-Suche: klassische Suche schickt Nutzer an Seiten, Trainings-Crawler nicht

Früher im Jahr 2026 war Anthropics Verhältnis eine fünfstellige Zahl und OpenAIs lag deutlich über tausend. Der Grund, warum beide so weit gefallen sind, ist nicht, dass sie weniger crawlen – sondern dass ihre Plattformen endlich begonnen haben, Traffic zurückzuschicken. Als ChatGPT Search und Claudes Oberflächen mit zitierten Quellen reiften, tauchten erstmals Referrals im Nenner des Verhältnisses auf, und die Zahl fiel schnell.

SEOmators Panel hat den Abstieg Monat für Monat erfasst, weil es beide Hälften der Gleichung gleichzeitig sieht:

BetreiberJanMärMaiJul*
Anthropic56.969:111.870:111.934:12.363:1
OpenAI1.264:11.416:11.225:1179:1
Perplexity116:1114:1175:1263:1
Mistral22:139:140:16.021:1
Google5,1:15,5:15,0:14,0:1

*Juli spiegelt einen unvollständigen Monat (1.–21. Juli) im SEOmator-Panel wider.

Die Anthropic-Linie ist das klarste Signal im Datensatz: Ein Betreiber, der im Januar rund 57.000 Seiten pro Referral nahm, war bis Juli auf die niedrigen Tausender gefallen, als Claudes nutzerseitige Oberflächen begannen, Klicks zurückzugeben. OpenAI folgte demselben Pfad von vierstelligen Werten zu den mittleren Hunderten. Das ist die Referral-Seite des Handels, die sich wieder durchsetzt – und es bestätigt eine Aussage, die ich das ganze Jahr über gegenüber Kunden gemacht habe: Extraktionsverhältnisse sind nicht fix und bewegen sich in dem Moment, in dem eine Plattform ein Produkt ausliefert, das nach außen verlinkt.

Warum ist Mistral plötzlich der extraktivste Betreiber?

Mistral ist das Spiegelbild der Anthropic-Geschichte. In den ersten fünf Monaten des Jahres 2026 war sein Crawler kaum sichtbar und sein Verhältnis lag im niedrigen zweistelligen Bereich. Dann, ab Juni, schoss sein Crawl-Volumen über beide Netzwerke hinweg nach oben, während seine Plattform praktisch keinen Referral-Traffic zurückschickte – was sein Verhältnis auf 3.389:1 in Cloudflares globalem Netzwerk und über 6.000:1 in SEOmators B2B-gewichtetem Panel trieb.

Diese Kombination – ein starker Anstieg des Crawlings ohne reziproken Referral-Mechanismus – ist genau das Profil, das ClaudeBot vor einem Jahr zum Aushängeschild der Extraktion machte. Wenn du dieses Quartal den AI-Crawler-Zugriff prüfst, sind Mistrals User-Agents (MistralAI-User und Mistrals Trainings-Crawler) die neuen Namen, die du in deinen Logs im Auge behalten solltest. Die Lehre aus Anthropic ist, dass sich das Verhältnis verbessern kann, sobald ein Verbraucherprodukt ausgeliefert wird; die Frage für Publisher ist, ob sie die Trainingsphase in der Zwischenzeit subventionieren wollen.

Wie viel deiner Crawl-Last ist tatsächlich AI – und was holen sich die Bots?

Bevor du entscheidest, was du blockierst, hilft es, die Zusammensetzung des Traffics zu sehen. In Cloudflares Netzwerk teilen sich Menschen und AI Bots den Anfragestrom so auf:

Client-TypAnteil am Traffic (Juli 2026)
Nicht-AI-Bot48,6 %
Mensch42,4 %
AI Bot5,7 %
Gemischter Zweck3,3 %

Die 5,7-%-Zahl für „AI Bot" untertreibt den Druck auf Content-Seiten im Speziellen. SEOmators Panel – gewichtet in Richtung der Docs, Blogs und Changelogs, die prime Trainingskorpus sind – zeigt, dass AI Bots B2B-SaaS-Seiten mit 38 % des gesamten Bot-Traffics treffen (Momentaufnahme Juli 2026), wobei mehr als die Hälfte dieses Crawlings als trainingszweckbezogen deklariert ist. E-Commerce-Seiten sehen relativ weniger Trainings-Crawling, aber proportional mehr Search-/Answer-Retrieval, weil Produktanfragen live Seiten abrufen.

Was holen sich all diese Bots eigentlich? Diese Aufschlüsselung fehlte in der ursprünglichen Ausgabe dieses Reports, und sie ist eine der nützlicheren Ergänzungen. Nach deklariertem Crawl-Zweck über AI Bots hinweg:

Crawl-ZweckAnteil an AI-Bot-Anfragen
Training46,5 %
Gemischter Zweck39,3 %
Search / Answer-Retrieval11,1 %
Nutzer-ausgelöste Aktion2,5 %
Nicht deklariert0,6 %

Training ist mit 46,5 % inzwischen der größte einzelne deklarierte Zweck – und SEOmators Panel zeigt dieselbe Verschiebung, von 39 % im Januar auf rund 46 % bis Juli, während das Search-/Answer-Crawling von 8 % auf 12 % kletterte. Die praktische Lesart: AI Bots crawlen deine Seite zunehmend, um live Nutzerfragen zu beantworten, nicht nur zum Trainieren – und das ist genau der Traffic, für den du zitierbar sein willst.

Und nach Content-Typ sind AI Crawler überwältigend auf deine Prosa aus, nicht auf deine Assets:

Content-TypAnteil an AI-Bot-Anfragen
HTML72,9 %
JSON6,9 %
JavaScript5,6 %
Bilder5,4 %
Klartext5,1 %
XML / CSS / sonstige4,2 %

Fast drei Viertel der AI-Crawler-Anfragen zielen auf HTML. Deine geschriebenen Inhalte – Artikel, Dokumentation, Produktbeschreibungen – sind der Korpus. Das ist zugleich das Risiko (er wird genommen) und die Chance (er ist das, was zitiert wird).

Welche AI Crawler und LLM Bots crawlen tatsächlich die meisten Seiten?

Betrachtet man den Gesamtanteil der User-Agents am gesamten Crawler-Traffic (nicht nur AI), führt Googlebot weiterhin – doch der Bot auf dem zweiten Platz ist keine Suchmaschine mehr. Es ist Claude-User, Anthropics On-Demand-Agent, der Seiten abruft, wenn ein Claude-Nutzer eine Frage stellt.

User-AgentAnteil am gesamten Crawler-Traffic (Juli 2026)Kategorie
Googlebot12,97 %Suchmaschine
Claude-User (Anthropic)10,10 %AI-Assistent
Meta-ExternalAgent (Meta AI)6,35 %AI Crawler / LLM Bot
GPTBot (ChatGPT)5,38 %AI Crawler / LLM Bot
Bingbot4,93 %Suchmaschine
Google AdsBot3,68 %Werbung
facebookexternalhit3,55 %Social Preview
Applebot3,38 %Suche / AI
Amazonbot3,32 %AI Crawler / LLM Bot

Innerhalb der AI-Crawler-Population im Speziellen ist die Anthropic-über-OpenAI-Umkehr sogar noch deutlicher. ClaudeBot nimmt jetzt einen Anteil von 18,2 % an den AI- und AI-nahen Crawler-Anfragen – fast das Doppelte von GPTBots 9,8 % – und Anthropics Crawler zusammen (ClaudeBot plus Claude-SearchBot) sind der größte AI-spezifische Betreiber im Web. SEOmators Panel erfasste dieselbe Umkehr: ClaudeBot überholte GPTBot im Juni und hält den Spitzenplatz unter den AI-Crawlern bis Juli. Das ist eine grundlegende Verschiebung gegenüber vor einem Jahr, als OpenAI der Standardname in jedem AI-Crawler-Gespräch war. Unsere frühere Recherche zu AI-SEO-Statistiken hat diese Umkehr vorweggenommen, auch wenn Anthropics konkreter Anstieg die Prognose übertraf.

Woher stammt der Referral-Traffic tatsächlich?

Trotz all des Crawlings ist der Referral-Traffic nach wie vor überwältigend Google. Aber die bemerkenswerte Zeile hier ist ChatGPT – und es bewegte sich schneller, als die ursprüngliche Ausgabe dieses Reports vorhersagte.

ReferrerAnteil am gesamten Referral-Traffic (Juli 2026)
Google88,15 %
Bing3,10 %
TikTok2,43 %
Yandex1,77 %
DuckDuckGo1,26 %
ChatGPT1,05 %
Baidu (mobil)0,89 %
Bing China (cn.bing.com)0,61 %
Baidu (Desktop)0,46 %

ChatGPTs Anteil an den Referrals hat 1 % überschritten – ein Anstieg um rund das 5-Fache gegenüber den 0,20 %, die dieser Report im Frühjahr festhielt. Die frühere Ausgabe prognostizierte, dass chatgpt.com „bis Ende 2026" 1 % erreichen würde; es war schon Mitte Juli so weit, neben DuckDuckGo und Baidu als messbare Traffic-Quelle.

SEOmators Analytics-Panel erzählt die Referral-Geschichte von der anderen Seite – als Anteil an den Sessions statt an den Referrer-Treffern – und der Trend reimt sich:

AI-EngineAnteil an allen Sessions (Juli 2026, SEOmator-Panel)
Alle AI-Engines1,19 %
— ChatGPT0,65 %
— Perplexity0,20 %
— Gemini0,15 %
— Claude0,10 %

Über die Seiten, die SEOmator trackt, schickten AI-Engines im Juli rund 1,2 % aller Sessions – fast doppelt so viel wie Januars 0,6 % und der am schnellsten wachsende Kanal im Panel. ChatGPT treibt rund 55 % davon. Der spannende strategische Teil ist der Branchen-Cut: B2B-SaaS-Seiten sehen etwa 1,6 % der Sessions aus AI-Antworten gegenüber 0,7 % bei E-Commerce – AI-Oberflächen schicken Rechercheure, keine Käufer. Kombiniere das mit den fallenden Extraktionsverhältnissen oben und das Bild ist stimmig: Als die Crawler weniger extraktiv wurden, tauchten die Referrals endlich auf.

Welche Branchen werden von AI Crawlern und LLM Bots am meisten gecrawlt?

Retail- und Infrastruktur-Inhalte absorbieren einen überproportionalen Anteil der Crawler-Aufmerksamkeit relativ zu ihrem Fußabdruck im Web.

BrancheAnteil am Crawler-Traffic (Juli 2026)
Shopping & Handelswaren26,4 %
Internet & Telekommunikation20,6 %
Computer & Elektronik18,8 %
News, Medien & Publikationen9,2 %
Glücksspiel6,7 %
Business & Industrie3,6 %
Professionelle Dienstleistungen2,7 %
Finance2,5 %

Shopping-Seiten absorbieren über ein Viertel des gesamten Crawler-Traffics – und erhalten, wie die Extraktionsverhältnisse zeigten, einige der geringsten Referral-Gegenwerte pro Crawl. Diese doppelte Strafe macht E-Commerce zum größten einzelnen Subventionierer des LLM-Modelltrainings. SEOmators B2B-gewichtetes Panel sieht dasselbe Muster aus einer anderen Ausgangsmischung: Shopping macht etwa 20 % seiner Kunden aus, aber rund 21 % aller Crawler-Treffer – pro Seite punktet Retail also weit über seinem Gewicht. Wenn ich technische SEO-Audits für SaaS-Kunden durchführe, sind branchenspezifische Crawl-Muster immer das Erste, was ich prüfe – ein Finance-SaaS und ein Unterhaltungselektronik-Händler bekommen von derselben Bot-Gruppe grundlegend andere Gegenleistungen. Ich habe verwandte AI-Bot-Traffic-Muster nach Ländern in einer früheren Analyse dokumentiert, in der die Geografie vergleichbare Variation antrieb.

Ist das Web tatsächlich bereit für die AI-Agenten, die es crawlen?

Hier ist eine Lücke, die die ganze „Soll ich blockieren?"-Frage neu einordnet. SEOmator hat im Juli 2026 die AI-Readiness-Checks seiner Audit-Engine über rund 109.000 Top-Domains laufen lassen; Cloudflares unabhängiger Scan von ~106.000 Domains fand nahezu identische Werte. Beide erzählen dieselbe Geschichte:

SignalAnteil der Domains (Juli 2026)
robots.txt mit AI-Crawler-Regeln~80–81 %
XML-Sitemap~69–70 %
Liefert Markdown an Agenten~7 %
MCP-Server-Card (agenten-nativ)~0,3 %
Web Bot Auth<0,1 %

Rund vier von fünf Top-Seiten schreiben inzwischen explizite AI-Crawler-Regeln – doch weniger als 7 % liefern sauberes Markdown an Agenten, und agenten-native Protokolle (MCP, Web Bot Auth) sind faktisch bei null. Das Web schreibt Regeln für AI-Agenten, die es gar nicht gut zu bedienen imstande ist. Wenn du entscheidest, wie du mit AI Crawlern umgehst, ist das der wahre Stand der Technik: Die meisten Seiten kämpfen noch den letzten Krieg (Allow/Deny in der robots.txt) statt des nächsten (Agenten strukturierte, effiziente Inhalte zu liefern).

Wie viele Websites blockieren AI Crawler und LLM Bots?

Website-Betreiber reagieren auf ungünstige Verhältnisse, indem sie AI Crawler in ihren robots.txt-Dateien benennen – und die beiden Namen an der Spitze jeder Liste sind die beiden größten Extrahierer. SEOmators Crawler hat am 20. Juli 2026 4.257 Top-Domain-robots.txt-Dateien geparst:

AgentDateien, die ihn nennenBetreiber
GPTBot773OpenAI
ClaudeBot629Anthropic
Google-Extended578Google (AI-Opt-out)
CCBot568Common Crawl
Bytespider507ByteDance
meta-externalagent495Meta
Amazonbot477Amazon
PerplexityBot470Perplexity
Applebot-Extended420Apple (AI-Opt-out)
ChatGPT-User375OpenAI

Cloudflares unabhängiger robots.txt-Scan produziert dieselben Top zwei – GPTBot (738 Direktiven) und ClaudeBot (652) – und bestätigt, dass AI-Opt-out inzwischen der dominierende Grund ist, aus dem Seiten überhaupt Crawler-Regeln schreiben. Technologie- und Business-Domains führen beim Blockieren an, genau wie im Frühjahr:

Domain-KategorieDomains mit AI-Crawler-Regeln (Cloudflare-Scan)
Technologie934
Business786
Tracker / Analytics317
E-Commerce300
Suchmaschinen263
Content-Server202

Bemerkenswert: Das Blockieren steigt, obwohl sich die Verhältnisse verbessern. In SEOmators Panel kletterte die Crawler-Ablehnungsrate (4xx-Antworten) von rund 35 % im Januar auf 37 % bis zur Jahresmitte – mehr als jede dritte Crawler-Anfrage wird nun abgewiesen – und der tatsächlich ausgelieferte Anteil (2xx) ist unter 50 % gerutscht. Falls du unsicher bist, wie deine eigene robots.txt für LLM Bots konfiguriert ist, lies unseren Leitfaden zu LLMs.txt – was es ist und wie man es generiert als Teil einer umfassenderen AI-Crawler-Zugriffsstrategie.

Solltest du AI Crawler und LLM Bots auf Basis dieser Daten blockieren?

Die Entscheidung hängt von deiner Branche, deinen Traffic-Zielen und deiner langfristigen GEO-Strategie ab. Auf Basis der Daten vom Juli 2026 sortieren sich die Betreiber in vier Gruppen – und die Zusammensetzung hat sich seit Jahresbeginn verschoben.

Mit gutem Gewissen blockieren: Mistral (3.389:1) und Meta-ExternalAgent. Mistral ist jetzt der extraktivste Crawler im Web ohne nennenswertes Referral-Produkt, und Meta-ExternalAgent hatte nie eines. Diese liefern nahezu null Gegenwert und verbrauchen Ressourcen ausschließlich zum Vorteil des Betreibers.

Sorgfältig abwägen: ClaudeBot (2.237:1) und GPTBot (217:1). Beide trainieren nach wie vor Modelle mit deinen Inhalten, aber beide haben sich um eine Größenordnung verbessert, als Claude und ChatGPT Search begannen, Traffic zurückzugeben. Sie jetzt zu blockieren bedeutet auch, die Repräsentation in den zwei am schnellsten wachsenden AI-Answer-Oberflächen aufzugeben – ein realer AI-Search-Optimierungs-Preis, den es nicht gab, als ihre Verhältnisse fünfstellig waren.

Strategisch zulassen: Microsoft Copilot (35:1). Moderates Verhältnis, wachsender Referral-Traffic über Bing- und Copilot-Oberflächen und prominente Quellenangabe. Behalte PerplexityBot (225:1) im Auge: Es ist einer der wenigen Betreiber, die 2026 extraktiver werden, und hat sich damit von „zulassen" in Richtung „abwägen" bewegt.

Unblockiert lassen: Google (4,6:1), DuckDuckGo (2,5:1) und klassische Such-Crawler. Diese liefern messbaren Referral-Traffic, der ihr Crawl-Volumen rechtfertigt.

Ein Vorbehalt, bevor du irgendeine robots.txt-Regel schreibst: Referrals sind nicht der einzige Gegenwert dafür, gecrawlt zu werden. Ein Bot kann prägen, wie ein Assistent deine Marke beschreibt, ohne je einen Klick zu schicken – Blockieren ist also keine kostenlose Handlung. Und für die Betreiber, die du zulässt, ist der Zugriff nicht der einzige Hebel – du kannst eine llms.txt-Datei generieren, um diesen Bots zu sagen, welche deiner Seiten tatsächlich wichtig sind, statt sie das aus einem vollständigen Crawl ableiten zu lassen.

Was bedeutet das für die Zukunft von GEO, AI-Suche und Publisher-Beziehungen?

Die Crawl-to-Refer-Daten aus der ersten Jahreshälfte 2026 revidieren die Geschichte, die sich das Web 2025 selbst erzählte. Die Befürchtung war, dass LLM-Plattformen endlos crawlen und nie Traffic zurückschicken würden. Was tatsächlich passiert ist, ist nuancierter: Die größten Extrahierer verbesserten sich dramatisch in dem Moment, in dem sie Verbraucherprodukte auslieferten, die nach außen verlinken – während ein neuer Betreiber (Mistral) an ihrer Stelle die Extraktionsführung übernahm. Drei Trends zeigen, wohin die Reise geht:

1. Extraktionsverhältnisse sind elastisch, nicht fix. Anthropic ging in sechs Monaten von ~57.000:1 auf ~2.300:1 und OpenAI von vierstelligen Werten auf die mittleren Hunderter, allein weil Referrals auftauchten. Jeder Betreiber, der ein Produkt mit zitierten Antworten startet, kann derselben Kurve folgen – was bedeutet, dass der schlimmste Übeltäter von heute nicht zwangsläufig der von morgen ist.

2. ChatGPT-Referrals überschritten 1 % vor dem Zeitplan. Die Frühjahrsausgabe dieses Reports prognostizierte diesen Meilenstein für Ende 2026; er kam im Juli. Mit der Reifung der AI-Answer-Engines hört die GEO-Optimierung für sie auf, spekulativ zu sein, und beginnt, in den Analytics aufzutauchen.

3. Die Readiness-Lücke ist das nächste Schlachtfeld. Mit ~80 % der Seiten, die AI-Regeln schreiben, aber nur ~7 %, die Markdown an Agenten liefern, werden die Gewinner der nächsten Phase nicht die Seiten sein, die am härtesten blockieren – sondern die, die AI-Agenten effiziente, strukturierte, zitierbare Inhalte liefern. Blockieren ist Verteidigung; zitierbar zu sein ist Angriff.

Website-Betreiber, die diese Verhältnisse vierteljährlich überwachen und ihren AI-Crawler-Zugriff anhand messbarer Erträge anpassen, werden diejenigen übertreffen, die entweder alles blockieren oder alles zulassen. Das ist das Fundament einer datengetriebenen GEO-Strategie.

So überwachst du das Crawl-to-Refer-Verhältnis deiner Seite

Während Cloudflare Radar und SEOmator netzwerkweite Aggregate liefern, können einzelne Seitenbetreiber ihre eigenen Crawl-to-Refer-Verhältnisse anhand von Server-Logs und Analytics annähern. Hier ist der Prozess, dem ich bei Kunden folge:

  1. Server-Log-Analyse: Zähle die Anfragen von bekannten AI-Crawler- und LLM-Bot-User-Agents (GPTBot, ClaudeBot, Claude-User, MistralAI-User, Meta-ExternalAgent, PerplexityBot) über einen Zeitraum von 30 Tagen
  2. Referral-Tracking: Filtere in Google Analytics 4 oder deiner Analytics-Plattform den Referral-Traffic von chatgpt.com, perplexity.ai, gemini.google.com und anderen LLM-gestützten Oberflächen
  3. Verhältnis berechnen: Teile die gesamten AI-Crawler-Anfragen durch die gesamten von AI verwiesenen Besuche, pro Betreiber
  4. Mit Benchmarks vergleichen: Nutze die Juli-2026-Verhältnisse aus diesem Report als Ausgangswerte und prüfe vierteljährlich nach – wie die Anthropic- und Mistral-Ausschläge zeigen, bewegen sich die Zahlen schnell

Falls du keinen Server-Log-Zugriff hast, deckt ein AI-Crawler-Zugriffsreport die Crawl-Hälfte der Gleichung ab – er zeigt, welche LLM Bots deine robots.txt aktuell zulässt oder blockiert, also den Input, den du tatsächlich ändern kannst.

SEO-Tools wie SEOmator können die technische Seite automatisieren – sie analysieren deine robots.txt-Konfiguration, überwachen AI-Crawler-Zugriffsmuster und identifizieren, welche LLM Bots dein Crawl-Budget verbrauchen, ohne proportionalen Wert zu liefern.

Methodik

Dieser Report stützt sich auf zwei unabhängige Datensätze, die bewusst gegeneinander abgeglichen wurden.

Cloudflare Radar überwacht den Traffic über Cloudflares globales Netzwerk hinweg, einen erheblichen Teil des gesamten Internet-Traffics, was seine Bot- und Crawler-Daten weitgehend repräsentativ für web-weite Muster macht. Alle Cloudflare-Werte nutzen ein gleitendes 28-Tage-Fenster bis zum 21. Juli 2026.

SEOmators Werte stammen aus dem eigenen Crawling- und Analytics-Netzwerk: 500+ von Agent Analytics überwachte Seiten (50 Mio.+ monatlich getrackte Nutzer), eine Audit-Engine über 100.000+ Seiten und ein Prompt-Tracker, der monatlich 1 Mio.+ Keywords und Prompts durchläuft, über Januar–Juli 2026. Weil dieses Panel in Richtung B2B SaaS gewichtet ist (~60 % der Kunden), beschreiben seine Anteile, wie sich das Business-Web verhält, nicht das Verbraucher-Internet insgesamt – was es zu einer nützlichen zweiten Meinung zu Cloudflares breiterem Netzwerk macht.

Verwendete Datendimensionen:

  • Crawl-to-Refer-Verhältnis: Gecrawlte Seiten pro gesendetem Referral, nach Betreiber (beide Netzwerke)
  • Referral-Quellenanteil: Referral-Traffic nach Quell-Domain (Cloudflare) und AI-Engine-Session-Anteil (SEOmator)
  • Client-Typ / Bot-Kategorie: Traffic-Klassifizierung (Mensch, Nicht-AI-Bot, AI Bot, Gemischt)
  • User-Agent + Crawl-Zweck + Content-Typ: Crawler-Identifikation und was AI Bots abrufen
  • Vertical / Branche: Traffic-Segmentierung nach Website-Kategorie
  • Agent-Readiness + robots.txt-Analyse: AI-Regel- und Agenten-Protokoll-Adoption über ~106.000–109.000 Domains

Zeitraum: Cloudflare – 28 Tage bis zum 21. Juli 2026. SEOmator – 1. Januar – 21. Juli 2026 (Juli ist ein unvollständiger Monat, 1.–21. Juli).

Einschränkungen: Netzwerkweite Verhältnisse messen aggregiertes Verhalten; die Verhältnisse einzelner Seiten variieren je nach Content-Typ, Domain-Autorität und Traffic-Mustern. Die Referral-Attribution unterschätzt möglicherweise AI-getriebene Besuche, die über Zwischenseiten ankommen oder keinen Referrer-Header tragen. SEOmators Panel ist bewusst B2B-gewichtet und berichtet Anteile über die Seiten, die es trackt, nicht über das Internet als Ganzes.

Cloudflare-Daten stammen aus Cloudflare Radar Bot & Crawler Analytics (28 Tage bis zum 21. Juli 2026). Quelle: SEOmator Crawling- und Analytics-Daten, Januar–Juli 2026 (500+ überwachte Seiten / 50 Mio.+ monatlich getrackte Nutzer / 1 Mio.+ monatlich getrackte Keywords & Prompts). Zuletzt aktualisiert: 21. Juli 2026.

Weitere Beiträge entdecken