CCBot: En træningscrawler, som drives af Common Crawl
CCBot er en træningscrawler. Den indsamler sider til det åbne datasæt, som de fleste modeller trænes på. Operatøren er Common Crawl.
Overblik
- Ansvarlig virksomhed
- Common Crawl
- robots.txt-token
CCBot- Formål
- Træning. Træningscrawlere indsamler sider til fremtidige modeller. Hvis du blokerer dem, stopper det ikke de crawlere, der henter sider til svar. De har deres egne navne.
- Hvad den leverer data til
- det åbne datasæt, som de fleste modeller trænes på
Hvad det ændrer at blokere den
Hvis du blokerer CCBot, kommer dine sider ikke med i det, den indsamler til det åbne datasæt, som de fleste modeller trænes på. De crawlere, der henter sider til svar, har deres egne navne og kan derfor stadig læse dit website.
User agent
Den fulde user agent fra operatørens dokumentation. En forespørgsel fra CCBot indeholder denne tekst, som kan ses i serverloggen.
CCBot/2.0 (https://commoncrawl.org/faq/)Linjer i robots.txt for CCBot
robots.txt er en almindelig tekstfil i roden af et website (yoursite.com/robots.txt). En gruppe begynder med en eller flere User-agent-linjer, der navngiver crawlere, efterfulgt af Allow- og Disallow-linjer for stier. En crawler, der er nævnt i en gruppe, følger de grupper, hvor dens navn står, og ignorerer gruppen for alle crawlere (User-agent: *).
Tillad adgang
User-agent: CCBot
Allow: /Blokér adgang
User-agent: CCBot
Disallow: /Giver dit website adgang?
Det gratis crawlertjek læser din robots.txt for CCBot og henter din side med crawlerens user agent. Så kan du se, om en regel i robots.txt eller en firewall afviser den.