AI-crawlare: vad varje robot gör och vad som händer om du blockerar den
Crawlarna som läser webbplatser åt AI-assistenter: vem som driver dem, vad de bidrar till och vilka rader i robots.txt som tillåter eller blockerar dem.
AI-crawlare är robotar som läser webbplatser åt AI-assistenter. Sökcrawlare som OAI-SearchBot bygger indexet som en assistent citerar, crawlare för användarförfrågningar som ChatGPT-User öppnar en sida när någon ber om det, och träningscrawlare som GPTBot samlar in sidor till framtida modeller. Listan omfattar 22 crawlare, med robots.txt-regler för var och en.
Tre typer av AI-crawlare
- Sökning
- Sökcrawlare läser sidor för att bygga det index som en assistent söker i när den svarar. En sida de inte kan läsa kan inte hittas eller citeras i de svaren.
- Användarförfrågan
- Crawlare för användarförfrågningar öppnar en sida när någon ber en assistent att läsa den. Om de inte kan läsa sidan kan assistenten inte öppna den i samtalet.
- Träning
- Träningscrawlare samlar in sidor till framtida modeller. Att stänga ute dem stoppar inte de crawlare som hämtar sidor för att ge svar. De har egna namn.
Alla crawlare, grupperade efter vad de bidrar till
Varje namn är en robots.txt-token. Öppna en crawlare för att se dess användaragent och regler.
Sökcrawlare
| Sökrobot | Ansvarig för webbplatsen | Vad den bidrar till |
|---|---|---|
| OAI-SearchBot | OpenAI | ChatGPT-sökning |
| Claude-SearchBot | Anthropic | Claude-sökning |
| PerplexityBot | Perplexity | Perplexity |
| Googlebot | Google Search och AI Overviews | |
| Bingbot | Microsoft | Bing och Copilot |
| Applebot | Apple | Siri och Spotlight |
| DuckAssistBot | DuckDuckGo | svar från DuckDuckGo |
| Amazonbot | Amazon | Alexa och Rufus |
| YouBot | You.com | svar från You.com |
Crawlare för användarförfrågningar
| Sökrobot | Ansvarig för webbplatsen | Vad den bidrar till |
|---|---|---|
| ChatGPT-User | OpenAI | ChatGPT |
| Claude-User | Anthropic | Claude |
| Perplexity-User | Perplexity | Perplexity |
| MistralAI-User | Mistral | Le Chat |
| Meta-ExternalFetcher | Meta | Meta AI |
Träningscrawlare
| Sökrobot | Ansvarig för webbplatsen | Vad den bidrar till |
|---|---|---|
| GPTBot | OpenAI | framtida OpenAI-modeller |
| ClaudeBot | Anthropic | framtida Claude-modeller |
| Google-Extended | Gemini-träning och faktaunderlag | |
| Applebot-Extended | Apple | träning av Apple Intelligence |
| Meta-ExternalAgent | Meta | Meta AI |
| CCBot | Common Crawl | den öppna datamängd som de flesta modeller tränas på |
| Bytespider | ByteDance | Doubao |
| cohere-ai | Cohere | Cohere-modeller |
En mall för robots.txt
robots.txt är en vanlig textfil i en webbplats rotkatalog (yoursite.com/robots.txt). En grupp börjar med en eller flera User-agent-rader som namnger crawlare, följt av Allow- och Disallow-rader för sökvägar. En crawlare som namnges i en grupp följer grupperna där den namnges och ignorerar gruppen för alla crawlare (User-agent: *).
De här raderna släpper in alla crawlare som hämtar sidor för att ge svar. Träningscrawlarna står efter #-tecken. Du väljer själv om du vill släppa in dem.
Lägg till de här raderna i filen robots.txt i webbplatsens rotkatalog och ta bort eventuella grupper som blockerar dessa sökrobotar. En sökrobot som har en egen grupp följer bara den gruppen. Kopiera därför in de Disallow-rader som fortfarande ska gälla för den.
# Sökrobotar som hämtar sidor för att ge svar
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: Bingbot
User-agent: Applebot
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: Meta-ExternalFetcher
User-agent: Amazonbot
User-agent: YouBot
Allow: /
# Sökrobotar för träning: du väljer. Ta bort #-tecknen för att släppa in dem.
# User-agent: GPTBot
# User-agent: ClaudeBot
# User-agent: Google-Extended
# User-agent: Applebot-Extended
# User-agent: Meta-ExternalAgent
# User-agent: CCBot
# User-agent: Bytespider
# User-agent: cohere-ai
# Allow: /Vilka av dem släpper din webbplats in?
robots.txt är ett sätt att stänga ute en crawlare. En inställning i ett CDN eller en brandvägg är ett annat, och webbplatsen kan ändå se ut som vanligt i webbläsaren. Den kostnadsfria kontrollen läser din robots.txt och begär din sida som varje crawlare på några sekunder.
Frågor om AI-sökrobotar
Kan AI-assistenter läsa din webbplats?
Den kostnadsfria kontrollen ger svar på några sekunder, utan konto eller e-postadress.