CCBot: en treningsrobot drevet av Common Crawl
CCBot er en treningsrobot. Den samler inn sider til det åpne datasettet som de fleste modeller trenes på og drives av Common Crawl.
Kort fortalt
- Driftsansvarlig
- Common Crawl
- navn i robots.txt
CCBot- Formål
- Trening. Treningsroboter samler inn sider til fremtidige modeller. Hvis du holder dem ute, kan robotene som henter sider for å gi svar, fortsatt slippe inn. De har egne navn.
- Hva den bidrar til
- det åpne datasettet som de fleste modeller trenes på
Hva som skjer når den blokkeres
Hvis du holder CCBot ute, blir ikke sidene dine med i det roboten samler inn til det åpne datasettet som de fleste modeller trenes på. Robotene som henter sider for å gi svar, har egne navn og kan fortsatt lese nettstedet ditt.
Brukeragent
Den fullstendige brukeragenten fra dokumentasjonen til den som driver roboten. En forespørsel fra CCBot inneholder denne teksten, som vises i serverloggen.
CCBot/2.0 (https://commoncrawl.org/faq/)Linjer i robots.txt for CCBot
robots.txt er en ren tekstfil i roten av et nettsted (yoursite.com/robots.txt). En gruppe begynner med én eller flere User-agent-linjer som navngir roboter, etterfulgt av Allow- og Disallow-linjer for stier. En robot som er navngitt i en gruppe, følger gruppene der den er navngitt og ignorerer gruppen for alle roboter (User-agent: *).
For å slippe den inn
User-agent: CCBot
Allow: /For å holde den ute
User-agent: CCBot
Disallow: /Slipper nettstedet ditt den inn?
Den gratis robotsjekken leser robots.txt-filen din for CCBot og ber om siden din med robotens brukeragent. Slik ser du om en regel i robots.txt eller en brannmur avviser den.