AI-crawlers: wat elke bot doet en wat blokkeren verandert
De crawlers die websites lezen voor AI-assistenten: wie ze beheert, waarvoor ze gegevens verzamelen en met welke robots.txt-regels je ze toelaat of blokkeert.
AI-crawlers zijn bots die websites lezen voor AI-assistenten. Zoekcrawlers zoals OAI-SearchBot bouwen de index op waaruit een assistent citeert. Crawlers voor gebruikersverzoeken zoals ChatGPT-User openen een pagina wanneer iemand daarom vraagt. Trainingscrawlers zoals GPTBot verzamelen pagina's voor toekomstige modellen. Deze lijst bevat 22 crawlers, elk met eigen robots.txt-regels.
Drie soorten AI-crawlers
- Zoeken
- Zoekcrawlers lezen pagina's om de index op te bouwen waarin een assistent zoekt wanneer die antwoord geeft. Een pagina die ze niet kunnen lezen, kan niet in die antwoorden worden gevonden of geciteerd.
- Verzoek van gebruiker
- Crawlers voor gebruikersverzoeken openen een pagina wanneer iemand een assistent vraagt die te lezen. Als ze de pagina niet kunnen lezen, kan de assistent die in dat gesprek niet openen.
- Training
- Trainingscrawlers verzamelen pagina's voor toekomstige modellen. Als je ze weert, kunnen crawlers die pagina's ophalen voor antwoorden je site nog steeds lezen. Die hebben eigen namen.
Alle crawlers, ingedeeld naar waarvoor ze gegevens verzamelen
Elke naam is het bijbehorende robots.txt-token. Open een crawler om de user-agent en regels te bekijken.
Zoekcrawlers
| Crawler | Beheerder | Waarvoor de gegevens worden gebruikt |
|---|---|---|
| OAI-SearchBot | OpenAI | ChatGPT-zoekfunctie |
| Claude-SearchBot | Anthropic | Claude-zoekfunctie |
| PerplexityBot | Perplexity | Perplexity |
| Googlebot | Google Search en AI Overviews | |
| Bingbot | Microsoft | Bing en Copilot |
| Applebot | Apple | Siri en Spotlight |
| DuckAssistBot | DuckDuckGo | antwoorden van DuckDuckGo |
| Amazonbot | Amazon | Alexa en Rufus |
| YouBot | You.com | antwoorden van You.com |
Crawlers voor gebruikersverzoeken
| Crawler | Beheerder | Waarvoor de gegevens worden gebruikt |
|---|---|---|
| ChatGPT-User | OpenAI | ChatGPT |
| Claude-User | Anthropic | Claude |
| Perplexity-User | Perplexity | Perplexity |
| MistralAI-User | Mistral | Le Chat |
| Meta-ExternalFetcher | Meta | Meta AI |
Trainingscrawlers
| Crawler | Beheerder | Waarvoor de gegevens worden gebruikt |
|---|---|---|
| GPTBot | OpenAI | toekomstige OpenAI-modellen |
| ClaudeBot | Anthropic | toekomstige Claude-modellen |
| Google-Extended | Gemini-training en onderbouwing van antwoorden | |
| Applebot-Extended | Apple | training van Apple Intelligence |
| Meta-ExternalAgent | Meta | Meta AI |
| CCBot | Common Crawl | de open dataset waarop de meeste modellen worden getraind |
| Bytespider | ByteDance | Doubao |
| cohere-ai | Cohere | Cohere-modellen |
Een robots.txt-sjabloon
robots.txt is een tekstbestand in de hoofdmap van een site (yoursite.com/robots.txt). Een groep begint met één of meer User-agent-regels die crawlers benoemen, gevolgd door Allow- en Disallow-regels voor paden. Een crawler die in een groep wordt genoemd, volgt de groepen met zijn naam en negeert de groep voor alle crawlers (User-agent: *).
Deze regels laten alle crawlers toe die pagina's ophalen voor antwoorden. De trainingscrawlers staan achter #-tekens: je kiest zelf of je ze toelaat.
Voeg deze regels toe aan het robots.txt-bestand in de hoofdmap van de site en verwijder elke groep die deze crawlers blokkeert. Een crawler die in een eigen groep staat, volgt alleen die groep. Kopieer daarom alle Disallow-regels die moeten blijven gelden naar die groep.
# Crawlers die pagina's ophalen voor antwoorden
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: Bingbot
User-agent: Applebot
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: Meta-ExternalFetcher
User-agent: Amazonbot
User-agent: YouBot
Allow: /
# Trainingscrawlers: aan jou de keuze. Verwijder de # tekens om ze toegang te geven.
# User-agent: GPTBot
# User-agent: ClaudeBot
# User-agent: Google-Extended
# User-agent: Applebot-Extended
# User-agent: Meta-ExternalAgent
# User-agent: CCBot
# User-agent: Bytespider
# User-agent: cohere-ai
# Allow: /Welke van deze crawlers laat jouw site toe?
Met robots.txt kun je een crawler weren. Dat kan ook met een instelling van je CDN of firewall, terwijl je site er in een browser gewoon goed uitziet. De gratis crawlercheck leest je robots.txt en vraagt je pagina als elke crawler op. Dat duurt een paar seconden.
Vragen over AI-crawlers
Kunnen AI-assistenten jouw site lezen?
De gratis crawlercheck geeft binnen een paar seconden antwoord, zonder account of e-mailadres.