CCBot: een trainingscrawler van Common Crawl
CCBot is een trainingscrawler. Hij verzamelt pagina's voor de open dataset waarop de meeste modellen worden getraind. Common Crawl beheert deze crawler.
In één oogopslag
- Beheerder
- Common Crawl
- robots.txt-token
CCBot- Doel
- Training. Trainingscrawlers verzamelen pagina's voor toekomstige modellen. Als je ze weert, kunnen crawlers die pagina's ophalen voor antwoorden je site nog steeds lezen. Die hebben eigen namen.
- Waarvoor de gegevens worden gebruikt
- de open dataset waarop de meeste modellen worden getraind
Wat blokkeren verandert
Als je CCBot weert, worden je pagina's niet verzameld voor de open dataset waarop de meeste modellen worden getraind. Crawlers die pagina's ophalen voor antwoorden hebben eigen namen en kunnen je site dus nog steeds lezen.
User-agent
De volledige user-agent volgens de documentatie van de beheerder. Een verzoek van CCBot bevat deze tekst, die ook in serverlogs te zien is.
CCBot/2.0 (https://commoncrawl.org/faq/)robots.txt-regels voor CCBot
robots.txt is een tekstbestand in de hoofdmap van een site (yoursite.com/robots.txt). Een groep begint met één of meer User-agent-regels die crawlers benoemen, gevolgd door Allow- en Disallow-regels voor paden. Een crawler die in een groep wordt genoemd, volgt de groepen met zijn naam en negeert de groep voor alle crawlers (User-agent: *).
Toelaten
User-agent: CCBot
Allow: /Blokkeren
User-agent: CCBot
Disallow: /Laat jouw site deze crawler toe?
De gratis crawlercheck leest je robots.txt voor CCBot en vraagt je pagina op met de bijbehorende user-agent. Zo zie je of een robots.txt-regel of een firewall deze crawler weert.