KI-Zugangsindex

Fortlaufende Messung von 600 deutschen Domains, wie viele davon KI-Crawlern per robots.txt den Zugriff auf / verweigern. Bisherige Messpunkte: 1. Stand: 2026-08-25.

77 von 235 = 32,8 %
Die 300 meistbesuchten .de-Domains

31 von 210 = 14,8 %
300 kleine .de-Domains (Rang über 50.000)

Gezählt werden Domains, die mindestens einen der vier großen Crawler sperren: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot.

This page tracks which German-language websites block AI crawlers via robots.txt. The panel consists of 600 .de domains split into two groups: the 300 most-visited and a systematic sample (every 88th) of 300 low-traffic domains (rank > 50,000). Among the top-300 domains with a parseable robots.txt (235 of 300), 77 of 235 (32,8 %) block at least one of the four major AI crawlers (GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot). Among the small-domain group (210 of 300 with valid robots.txt), the figure is 31 of 210 (14,8 %). Raw data and the parser are in the repository at github.com/peppe1337/ki-zugangsindex. This is the first measurement point of an ongoing series.

Alle 14 Crawler im Überblick

Die vier mit ★ markierten Crawler bilden die Basis für den Hauptindikator (mindestens einer gesperrt). Alle anderen werden zusätzlich ausgewiesen. Prozentwerte berechnet als blockiert ÷ Nenner.

Crawler Top 300 gesperrt Anteil % Klein 300 gesperrt Anteil %
GPTBot 70/235 29,8 % 27/210 12,9 %
OAI-SearchBot 18/235 7,7 % 12/210 5,7 %
ChatGPT-User 24/235 10,2 % 16/210 7,6 %
ClaudeBot 62/235 26,4 % 29/210 13,8 %
Claude-User 13/235 5,5 % 10/210 4,8 %
anthropic-ai 38/235 16,2 % 15/210 7,1 %
PerplexityBot 38/235 16,2 % 14/210 6,7 %
Perplexity-User 16/235 6,8 % 10/210 4,8 %
Google-Extended 54/235 23,0 % 23/210 11,0 %
Applebot-Extended 57/235 24,3 % 21/210 10,0 %
CCBot 69/235 29,4 % 25/210 11,9 %
Bytespider 62/235 26,4 % 25/210 11,9 %
meta-externalagent 54/235 23,0 % 22/210 10,5 %
Amazonbot 39/235 16,6 % 29/210 13,8 %

Hervorgehoben (★): GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot.

Veränderung gegenüber Vormesspunkt

Für diesen ersten Messpunkt gibt es noch keinen Vorgänger — die Reihe kann daher noch keine Veränderung zeigen. Genau das ist der Zweck dieser Seite: Sie wird mit jedem weiteren Messpunkt fortgeschrieben, und die erste Veränderung wird ab dem zweiten Messpunkt sichtbar.

Verfahren

Stichprobenrahmen: Tranco Top 1M, abgerufen 2026-08-25. Darin 27.599 Domains mit Endung .de.

Gruppe top300: die 300 bestplatzierten .de-Domains (Rang 204–15.893).

Gruppe klein300: von allen 26.525 .de-Domains mit Rang > 50.000 jede 88., davon die ersten 300 (Rang 50.030–994.089).

Für jede Domain wird https://<domain>/robots.txt abgerufen, mit bis zu 5 Weiterleitungen und einer Zeitgrenze von 15 Sekunden. Schlägt der HTTPS-Abruf fehl, wird auf http:// zurückgefallen. Die Datei wird mit einem eigenen Gruppenparser nach robots.txt-Semantik ausgewertet: aufeinanderfolgende User-agent-Zeilen bilden eine Gruppe, ein exakter Treffer schlägt *, der längste passende Pfad gewinnt, bei Gleichstand gewinnt Allow.

Was es schon gibt

Damit es niemand erst nachtragen muss: Aggregatzahlen zu diesem Thema gibt es, und es lohnt sich, genau zu sein, was sie abdecken.

Damit ist die Momentaufnahme kein Alleinstellungsmerkmal dieser Seite, und „Deutschland“ allein auch nicht. Wer die Crawlora-Rohdaten herunterlädt, kann den deutschen Schnitt für den 20. Juni selbst rechnen — wir haben genau das getan, siehe unten. Was bleibt, ist die Wiederholung auf einem festen Panel: dieselben 600 Domains, immer wieder, damit eine Veränderung eine Veränderung ist und kein Stichprobenwechsel. Die Einzelabfrage „sperrt meine Seite GPTBot?“ verschenken ohnehin mehrere Anbieter — daran ist hier nichts neu.

Unabhängige Gegenprobe

Ein zweiter, völlig unabhängiger Datensatz misst dasselbe: AI-Crawler Blocking Index von Crawlora (998497 Domains der Tranco Top 1M, davon 28761 mit Endung .de, Messtag 2026-06-20, CC BY 4.0, DOI 10.5281/zenodo.20774249). Anderes Team, anderer Programmcode, anderer Abruf, 66 Tage früher.

Der Messtag steht nicht in der Rohdatei. Belegt ist er durch den Commit, mit dem der Datensatz veroeffentlicht wurde: Crawlora-org/ai-crawler-blocking-index-data, 2026-06-20T11:03:09Z, Nachricht "Add AI-Crawler Blocking Index dataset (Tranco top 1M, run aicrawler-20260620, CC BY 4.0)" — die Laufkennung nennt das Datum. Zusaetzlich nennt die Datensatzseite datePublished 2026-06-20.

Wir haben aus dessen Rohdaten die Domains unseres Panels herausgeschnitten und dieselbe Kennzahl gerechnet. Verglichen wird nur, was an beiden Tagen auswertbar war.

Gruppe beidseitig auswertbar 2026-06-20 (fremd) 2026-08-25 (eigen) Δ
Top 300 229 74 (32,3 %) 73 (31,9 %) -1
Klein 300 163 20 (12,3 %) 24 (14,7 %) +4

Das ist die bislang stärkste Prüfung dieser Zahlen: eine fremde Erhebung kommt auf demselben Panelausschnitt auf praktisch dasselbe Ergebnis. Umgekehrt heißt es auch, dass an der Momentaufnahme nichts Seltenes ist.

In 66 Tagen haben von 392 beidseitig auswertbaren Domains 5 ihr Verdikt gewechselt. Neu gesperrt: worldofplayers.de, friedwald.de, elroq-forum.de, yogamagie.de. Sperre entfallen: berliner-zeitung.de.

Was daraus nicht folgt.

Panel B — größere Stichprobe

Am 2026-08-25 wurde ein zweites, größeres Panel gemessen: 5.520 .de-Domains (Panel B). Davon lieferten 3.630 eine syntaktisch auswertbare robots.txt. 591 davon = 16,3 % sperren mindestens einen der vier großen KI-Crawler (GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot).

Ziehungsregel: jede 5. Zeile der 27.598 .de-Domains aus Tranco Top 1M, Ränge 204–999.938 (awk NR%5==1), deterministisch. Die Domainliste liegt als data/panel-b.json bei.

Crawler gesperrt / Nenner Anteil %
GPTBot 552/3630 15,2 %
OAI-SearchBot 252/3630 6,9 %
ChatGPT-User 302/3630 8,3 %
ClaudeBot 509/3630 14,0 %
Claude-User 230/3630 6,3 %
anthropic-ai 315/3630 8,7 %
PerplexityBot 303/3630 8,3 %
Perplexity-User 227/3630 6,3 %
Google-Extended 467/3630 12,9 %
Applebot-Extended 450/3630 12,4 %
CCBot 444/3630 12,2 %
Bytespider 428/3630 11,8 %
meta-externalagent 481/3630 13,3 %
Amazonbot 501/3630 13,8 %

Hervorgehoben (★): GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot.

Was nicht beiliegt. Die 67 MB Rohantworten (5.520 vollständige robots.txt-Abrufe) liegen aus Größengründen NICHT im Repository. Beiliegen: roh.json.gz (Verdikte je Domain, 171 KB) und panel-b.tsv (Domainliste). Der Auswertungscode ist derselbe wie für Panel A (tools/kicrawler.mjs, unverändert).

Plausibilitätsprüfung: Panel A misst 32,8 % in den Top 300 und 14,8 % bei Rang > 50.000. Panel B mittelt über den gesamten Rangbereich und landet bei 16,3 % — zwischen den beiden Gruppen, näher am kleinen Ende, weil 94,6 % seiner Domains unterhalb der Top 300 liegen. Konsistent.

Was diese Messung nicht sagt

Nenner und Ausschlüsse

In den Nenner gehen nur Domains ein, bei denen eine syntaktisch auswertbare robots.txt vorlag. Für die Top-300-Gruppe sind das 235 Domains, für die kleine Gruppe 210 Domains.

Ausschlussgrund Top 300 Klein 300 Gesamt
netz-fehler 22 28 50
http-status-404 19 27 46
html-statt-robots 9 27 36
http-status-403 10 3 13
leer 0 3 3
http-status-410 2 0 2
http-status-400 1 1 2
http-status-500 1 0 1
http-status-429 1 0 1
keine-user-agent-zeile 0 1 1

4 Domains lieferten HTTP 200 mit leerer oder User-agent-loser Datei. Nach der Norm bedeutet das alles erlaubt; hier zählen sie konservativ als unbekannt und stehen nicht im Nenner. Würde man sie als erlaubt zählen, sänken die Quoten um höchstens 0,3 Punkte.

Rohdaten und Nachprüfung

Jede Zahl auf dieser Seite wird aus den folgenden Dateien errechnet, nicht eingetippt: