CCBot: en träningscrawlare som drivs av Common Crawl
CCBot är en träningscrawlare. Den samlar in sidor till den öppna datamängd som de flesta modeller tränas på och drivs av Common Crawl.
Översikt
- Ansvarig för webbplatsen
- Common Crawl
- robots.txt-token
CCBot- Syfte
- Träning. Träningscrawlare samlar in sidor till framtida modeller. Att stänga ute dem stoppar inte de crawlare som hämtar sidor för att ge svar. De har egna namn.
- Vad den bidrar till
- den öppna datamängd som de flesta modeller tränas på
Vad som händer om du blockerar den
Om du stänger ute CCBot kommer dina sidor inte med i det som samlas in till den öppna datamängd som de flesta modeller tränas på. Crawlarna som hämtar sidor för att ge svar har egna namn och kan därför fortfarande läsa din webbplats.
Användaragent
Den fullständiga användaragenten enligt operatörens dokumentation. En förfrågan från CCBot innehåller den här texten, som också syns i serverloggen.
CCBot/2.0 (https://commoncrawl.org/faq/)Rader i robots.txt för CCBot
robots.txt är en vanlig textfil i en webbplats rotkatalog (yoursite.com/robots.txt). En grupp börjar med en eller flera User-agent-rader som namnger crawlare, följt av Allow- och Disallow-rader för sökvägar. En crawlare som namnges i en grupp följer grupperna där den namnges och ignorerar gruppen för alla crawlare (User-agent: *).
För att släppa in den
User-agent: CCBot
Allow: /För att stänga den ute
User-agent: CCBot
Disallow: /Släpper din webbplats in den?
Den kostnadsfria kontrollen läser din robots.txt för CCBot och begär din sida med dess användaragent. Då ser du om en regel i robots.txt eller en brandvägg stänger den ute.