Archive/Data Crawlers

CCBot Checker

CCBot · Common Crawl · Zuletzt geprüft: 2026-10-01

Überblick

Zweck

Builds the Common Crawl public web corpus.

Exakter User-Agent

CCBot

robots.txt

Allow-Beispiel

User-agent: CCBot
Allow: /

Block-Beispiel

User-agent: CCBot
Disallow: /

Wichtige Einschränkung

Das robots.txt-Ergebnis beschreibt die veröffentlichte Regel für den getesteten Pfad. Es beweist weder Crawling noch Indexierung, Training oder Zitate.

Häufige Frage

Steuert diese Regel alle Produkte desselben Betreibers?

Nein. Betreiber können getrennte User-Agents für Training, Suche und nutzergesteuerten Abruf veröffentlichen.

Offizielle Quelle

Common Crawl documentation ↗