ClaudeBot: een trainingscrawler van Anthropic
ClaudeBot is een trainingscrawler. Hij verzamelt pagina's voor toekomstige Claude-modellen. Anthropic beheert deze crawler.
In één oogopslag
- Beheerder
- Anthropic
- robots.txt-token
ClaudeBot- Doel
- Training. Trainingscrawlers verzamelen pagina's voor toekomstige modellen. Als je ze weert, kunnen crawlers die pagina's ophalen voor antwoorden je site nog steeds lezen. Die hebben eigen namen.
- Waarvoor de gegevens worden gebruikt
- toekomstige Claude-modellen
Wat blokkeren verandert
Als je ClaudeBot weert, worden je pagina's niet verzameld voor toekomstige Claude-modellen. Crawlers die pagina's ophalen voor antwoorden hebben eigen namen en kunnen je site dus nog steeds lezen.
User-agent
De volledige user-agent volgens de documentatie van de beheerder. Een verzoek van ClaudeBot bevat deze tekst, die ook in serverlogs te zien is.
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; [email protected])robots.txt-regels voor ClaudeBot
robots.txt is een tekstbestand in de hoofdmap van een site (yoursite.com/robots.txt). Een groep begint met één of meer User-agent-regels die crawlers benoemen, gevolgd door Allow- en Disallow-regels voor paden. Een crawler die in een groep wordt genoemd, volgt de groepen met zijn naam en negeert de groep voor alle crawlers (User-agent: *).
Toelaten
User-agent: ClaudeBot
Allow: /Blokkeren
User-agent: ClaudeBot
Disallow: /Laat jouw site deze crawler toe?
De gratis crawlercheck leest je robots.txt voor ClaudeBot en vraagt je pagina op met de bijbehorende user-agent. Zo zie je of een robots.txt-regel of een firewall deze crawler weert.