Deutsche Kleinunternehmen sperren ChatGPT kaum bewusst aus — aber ihr Hosting tut es für sie
Wir haben 346 echte lokale Betriebe (Apotheke, Café, Handwerk, Praxis, Hotel) daraufhin gemessen, ob sie die KI-Crawler draußen halten. Das Ergebnis dreht die naheliegende Vermutung um.
der lokalen Betriebe zeigen einem Menschen die Seite normal (HTTP 200) — und blocken den echten GPTBot, meist mit einem 403. Rund jeder Achte. Fast keiner davon hat das entschieden.
Zwei sehr verschiedene Metriken
Wir messen getrennt, weil zwei völlig verschiedene Ursachen dahinterstecken. Metrik A ist eine bewusste Regel in der robots.txt, die einen KI-Bot per Name aussperrt. Metrik B ist der Server selbst (bzw. sein CDN/WAF/Baukasten), der dem echten GPTBot-User-Agent den Zugriff verweigert — meist ohne dass der Betreiber je davon wusste.
Ergebnis A: Nur 3.7% der Betriebe sperren *überhaupt einen* KI-Crawler bewusst per robots.txt aus. Kleinunternehmen fassen ihre robots.txt schlicht nicht an.
Ergebnis B: 12.7% aber liefern dem GPTBot ein Block-Signal, während ein normaler Browser die Seite ganz normal bekommt. Das ist kein Zufallsrauschen — bei allen nachgeprüften Fällen war der 403 stabil reproduzierbar (Hausarztpraxis, Bar, Café, Klavierbauer, Feinkostladen).
Warum das die Angst-Geschichte umdreht
Die naheliegende Vermutung lautet: „SMBs sperren ChatGPT bewusst aus." Falsch. Sie sperren fast nie *bewusst* — aber ihr Hosting sperrt viel häufiger, still und unbemerkt. Cloudflare-Bot-Fight-Mode, eine Managed-WAF-Regel, ein Baukasten-Default: die Tür geht zu, ohne dass jemand sie zugemacht hat.
Die Wirkung ist trotzdem hart: Bekommt OpenAIs Crawler ein 403, kann die Seite in ChatGPT nicht auftauchen. Kein SEO-Tool und kein „AI-Readiness-Score" zeigt dir das — sie prüfen dasselbe leere Skelett, das auch der Bot bekäme, und geben dir trotzdem grünes Licht.
Stichprobe & Methodik — offen und nachbaubar
Quelle: OpenStreetMap via Overpass-API (frei, ohne Key, die Query ist im Werkzeug nachbaubar). Rahmen: 9.232 eindeutige Domains — alle OSM-Betriebe mit hinterlegter Website (Handel, Handwerk, Büro, Gastro, Gesundheit, Hotel) in 8 mittelgroßen deutschen Städten: Bonn, Freiburg, Erfurt, Regensburg, Münster, Heidelberg, Rostock, Kassel. (Kiel und Osnabrück liefen bei Overpass in einen Timeout und sind ehrlich nicht enthalten.)
Gemessene Stichprobe: deterministische systematische 1-aus-23-Ziehung → 402 Domains, davon 346 per Browser erreichbar und 327 mit lesbarer robots.txt. Die Liste steht fest, bevor gemessen wird — kein Cherry-Pick.
Grenzen: Nur Betriebe mit hinterlegter Website (leicht Richtung „etwas etablierter" verzerrt); 8 Städte, kein Bundesland-Proporz; ein 403 an den GPTBot-UA ist oft eine generische Bot-Sperre, keine bewusste Anti-KI-Entscheidung — die Wirkung ist identisch. Bei n=346 liegt das 95-%-Konfidenzintervall der 12.7%-Zahl bei ±3.5 Prozentpunkten. Die Zahl gilt für *diese offengelegte Stichprobe*, nicht als „exakt X% aller deutschen Betriebe".
FAQ
Heißt ein 403 an den GPTBot, dass der Betrieb ChatGPT absichtlich aussperrt?
Meist nicht. Nur 3.7% sperren AI-Crawler bewusst per robots.txt. Der 403 kommt fast immer vom Hosting/CDN/WAF (z. B. Cloudflare-Bot-Schutz), ohne dass der Betreiber davon weiß. Die Wirkung ist trotzdem, dass GPTBot die Seite nicht laden kann.
Woher stammt die Stichprobe?
Aus OpenStreetMap via Overpass-API: alle Betriebe mit hinterlegter Website in 8 mittelgroßen deutschen Städten (9.232 Domains), daraus eine systematische Stichprobe von 402. Quelle offen, Werkzeug im Repo, 1:1 nachbaubar.
Wie prüfe ich, ob meine eigene Seite betroffen ist?
Schneller Selbsttest: ruf deine Startseite mit dem GPTBot-User-Agent ab, z. B. `curl -A "GPTBot/1.2" -I https://deine-domain.de` — kommt ein 403/429 statt 200, blockt dein Hosting den Crawler. Den sichtbaren Effekt zeigt der kostenlose deeploupe-Checker: ob ChatGPT & Co. dich überhaupt erwähnen. Ohne Anmeldung.
Stand: Juli 2026