CCBot: ein Trainings-Crawler, den Common Crawl betreibt
CCBot ist ein Trainings-Crawler. Er sammelt Seiten für den jeweiligen Zweck (der offene Datensatz, mit dem die meisten Modelle trainiert werden). Betrieben wird er von Common Crawl.
Auf einen Blick
- Betreiber
- Common Crawl
- robots.txt-Token
CCBot- Zweck
- Training. Trainings-Crawler sammeln Seiten für künftige Modelle. Wenn Sie sie aussperren, halten Sie damit nicht die Crawler auf, die Seiten für Antworten abrufen. Diese haben eigene Namen.
- Wofür er Daten liefert
- der offene Datensatz, mit dem die meisten Modelle trainiert werden
Was sich durch das Blockieren ändert
Wenn Sie CCBot aussperren, werden Ihre Seiten nicht für den jeweiligen Zweck (der offene Datensatz, mit dem die meisten Modelle trainiert werden) gesammelt. Die Crawler, die Seiten für Antworten abrufen, haben eigene Namen und können Ihre Website weiterhin lesen.
User-Agent
Der vollständige User-Agent aus der Dokumentation des Betreibers. Wenn CCBot eine Anfrage sendet, enthält sie diesen Text. Er erscheint auch im Serverprotokoll.
CCBot/2.0 (https://commoncrawl.org/faq/)robots.txt-Zeilen für CCBot
robots.txt ist eine reine Textdatei im Stammverzeichnis einer Website (yoursite.com/robots.txt). Eine Gruppe beginnt mit einer oder mehreren User-agent-Zeilen, die Crawler benennen. Darauf folgen Allow- und Disallow-Zeilen für Pfade. Ein Crawler, der in einer Gruppe namentlich genannt wird, befolgt die Gruppen mit seinem Namen und ignoriert die Gruppe für alle Crawler (User-agent: *).
Zulassen
User-agent: CCBot
Allow: /Sperren
User-agent: CCBot
Disallow: /Lässt Ihre Website den Crawler zu?
Die kostenlose Crawler-Prüfung liest Ihre robots.txt für CCBot und ruft Ihre Seite mit dessen User-Agent auf. So zeigt sie, ob eine robots.txt-Regel oder eine Firewall den Crawler abweist.