Was ist CCBot?
CCBot ist der Crawler der gemeinnützigen Common Crawl Foundation, die ein frei verfügbares Archiv grosser Teile des öffentlichen Webs aufbaut. Dieses Archiv ist eine verbreitete Rohdatenquelle für die Forschung und für das Training von Sprachmodellen.
Common Crawl betreibt keine Suchmaschine und keinen Chatbot. Die Organisation stellt ihre Daten frei zur Verfügung, und viele Projekte nutzen sie weiter. Deshalb taucht CCBot in fast jeder Liste von KI-relevanten Crawlern auf, obwohl er selbst keine Antworten erzeugt.
Eine Sperre von CCBot wirkt nach vorn: Neue Crawls erfassen die Seite nicht mehr. Was schon in früheren Archiven liegt, bleibt dort. Common Crawl beschreibt die Sperre selbst mit einer robots.txt-Gruppe für CCBot und einem Disallow für alles.
Common Crawl weist ausserdem darauf hin, dass sich fremde Crawler fälschlich als CCBot ausgeben. Ein Eintrag mit diesem User-Agent in den Logs stammt also nicht sicher von Common Crawl. Wer sperren oder freigeben will, sollte das bedenken, wenn Firewall-Regeln nur nach dem Namen filtern.
Was das für deine Website heisst
Entscheide, ob deine Inhalte in einem offenen Archiv landen sollen, das andere für Modelltraining nutzen. Wenn nicht, sperre CCBot in der robots.txt. Der deeploupe GPTBot-Check liest die Regel für CCBot aus und zeigt, ob sie greift. Einen Live-Abruf mit dem CCBot-User-Agent macht er nicht. Bedenke, dass eine Sperre nur neue Crawls betrifft und bereits archivierte Fassungen deiner Seite nicht entfernt.
Verwandte Begriffe
Weiter auf deeploupe
Quellen
Begriffe helfen beim Verstehen. Ob KI-Crawler deine Seite erreichen, zeigt die Messung.
Website gratis prüfenkostenlos · keine Anmeldung · keine Kreditkarte