AI-crawlere: Hvad hver bot gør, og hvad det ændrer at blokere den
Crawlerne, der læser websites for AI-assistenter: Hvem der står bag hver enkelt, hvad den leverer data til, og hvilke linjer i robots.txt der tillader eller blokerer den.
AI-crawlere er botter, der læser websites for AI-assistenter. Søgecrawlere som OAI-SearchBot opbygger det indeks, en assistent citerer fra. Crawlere til brugerforespørgsler som ChatGPT-User åbner en side, når nogen beder om det, mens træningscrawlere som GPTBot indsamler sider til fremtidige modeller. Listen omfatter 22 crawlere med robots.txt-regler for hver enkelt.
Tre typer AI-crawlere
- Søgning
- Søgecrawlere læser sider for at opbygge det indeks, en assistent søger i, når den svarer. Hvis de ikke kan læse en side, kan den hverken findes eller citeres i de svar.
- Brugerforespørgsel
- Crawlere til brugerforespørgsler åbner en bestemt side, når nogen beder en assistent om at læse den. Hvis de ikke kan læse siden, kan den ikke åbnes i samtalen.
- Træning
- Træningscrawlere indsamler sider til fremtidige modeller. Hvis du blokerer dem, stopper det ikke de crawlere, der henter sider til svar. De har deres egne navne.
Alle crawlere efter, hvad de leverer data til
Hvert navn er et robots.txt-token. Åbn en crawler for at se dens user agent og regler.
Søgecrawlere
| Crawler | Ansvarlig virksomhed | Hvad den leverer data til |
|---|---|---|
| OAI-SearchBot | OpenAI | ChatGPT-søgning |
| Claude-SearchBot | Anthropic | Claude-søgning |
| PerplexityBot | Perplexity | Perplexity |
| Googlebot | Google Search og AI Overviews | |
| Bingbot | Microsoft | Bing og Copilot |
| Applebot | Apple | Siri og Spotlight |
| DuckAssistBot | DuckDuckGo | svar fra DuckDuckGo |
| Amazonbot | Amazon | Alexa og Rufus |
| YouBot | You.com | svar fra You.com |
Crawlere til brugerforespørgsler
| Crawler | Ansvarlig virksomhed | Hvad den leverer data til |
|---|---|---|
| ChatGPT-User | OpenAI | ChatGPT |
| Claude-User | Anthropic | Claude |
| Perplexity-User | Perplexity | Perplexity |
| MistralAI-User | Mistral | Le Chat |
| Meta-ExternalFetcher | Meta | Meta AI |
Træningscrawlere
| Crawler | Ansvarlig virksomhed | Hvad den leverer data til |
|---|---|---|
| GPTBot | OpenAI | fremtidige OpenAI-modeller |
| ClaudeBot | Anthropic | fremtidige Claude-modeller |
| Google-Extended | træning og grounding af Gemini | |
| Applebot-Extended | Apple | træning af Apple Intelligence |
| Meta-ExternalAgent | Meta | Meta AI |
| CCBot | Common Crawl | det åbne datasæt, som de fleste modeller trænes på |
| Bytespider | ByteDance | Doubao |
| cohere-ai | Cohere | Cohere-modeller |
En skabelon til robots.txt
robots.txt er en almindelig tekstfil i roden af et website (yoursite.com/robots.txt). En gruppe begynder med en eller flere User-agent-linjer, der navngiver crawlere, efterfulgt af Allow- og Disallow-linjer for stier. En crawler, der er nævnt i en gruppe, følger de grupper, hvor dens navn står, og ignorerer gruppen for alle crawlere (User-agent: *).
Disse linjer giver adgang til alle crawlere, der henter sider til svar. Træningscrawlerne står efter #-tegn: Du bestemmer selv, om de skal have adgang.
Tilføj disse linjer i robots.txt-filen i websitets rodmappe, og fjern eventuelle grupper, der blokerer disse crawlere. En crawler, der står i sin egen gruppe, følger kun den gruppe. Kopiér derfor de Disallow-linjer, den fortsat skal følge, ind i gruppen.
# Crawlere, der henter sider til svar
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: Bingbot
User-agent: Applebot
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: Meta-ExternalFetcher
User-agent: Amazonbot
User-agent: YouBot
Allow: /
# Træningscrawlere: Du bestemmer. Fjern #-tegnene for at give dem adgang.
# User-agent: GPTBot
# User-agent: ClaudeBot
# User-agent: Google-Extended
# User-agent: Applebot-Extended
# User-agent: Meta-ExternalAgent
# User-agent: CCBot
# User-agent: Bytespider
# User-agent: cohere-ai
# Allow: /Hvilke af dem giver dit website adgang til?
robots.txt er én måde at afvise en crawler på. En indstilling i dit CDN eller din firewall er en anden, og websitet ser stadig normalt ud i browseren. Det gratis crawlertjek læser din robots.txt og henter din side som hver crawler på få sekunder.
Spørgsmål om AI-crawlere
Kan AI-assistenter læse dit website?
Det gratis crawlertjek giver svar på få sekunder, uden konto og uden e-mailadresse.