KI-roboter: hva hver robot gjør, og hva som skjer når du blokkerer den
Robotene som leser nettsteder for KI-assistenter: hvem som står bak hver enkelt, hva de bidrar til, og hvilke linjer i robots.txt som tillater eller blokkerer dem.
KI-roboter leser nettsteder for KI-assistenter. Søkeroboter som OAI-SearchBot bygger indeksen en assistent siterer. Roboter som ChatGPT-User åpner sider når noen ber om det, mens treningsroboter som GPTBot samler inn sider til fremtidige modeller. Denne listen dekker 22 roboter, med regler for hver enkelt i robots.txt.
Tre typer KI-roboter
- Søk
- Søkeroboter leser sider for å bygge søkeindeksen en assistent bruker når den svarer. En side de ikke kan lese, kan ikke bli funnet eller sitert i disse svarene.
- Brukerforespørsel
- Roboter som svarer på brukerforespørsler, åpner en side når noen ber en assistent lese den. En side de ikke kan lese, kan ikke åpnes i den samtalen.
- Trening
- Treningsroboter samler inn sider til fremtidige modeller. Hvis du holder dem ute, kan robotene som henter sider for å gi svar, fortsatt slippe inn. De har egne navn.
Alle robotene, gruppert etter hva de bidrar til
Hvert navn er navnet roboten bruker i robots.txt. Åpne en robot for å se brukeragenten og reglene.
Søkeroboter
| Søkerobot | Driftsansvarlig | Hva den bidrar til |
|---|---|---|
| OAI-SearchBot | OpenAI | ChatGPT-søk |
| Claude-SearchBot | Anthropic | Claude-søk |
| PerplexityBot | Perplexity | Perplexity |
| Googlebot | Google Search og AI Overviews | |
| Bingbot | Microsoft | Bing og Copilot |
| Applebot | Apple | Siri og Spotlight |
| DuckAssistBot | DuckDuckGo | svar fra DuckDuckGo |
| Amazonbot | Amazon | Alexa og Rufus |
| YouBot | You.com | svar fra You.com |
Roboter for brukerforespørsler
| Søkerobot | Driftsansvarlig | Hva den bidrar til |
|---|---|---|
| ChatGPT-User | OpenAI | ChatGPT |
| Claude-User | Anthropic | Claude |
| Perplexity-User | Perplexity | Perplexity |
| MistralAI-User | Mistral | Le Chat |
| Meta-ExternalFetcher | Meta | Meta AI |
Treningsroboter
| Søkerobot | Driftsansvarlig | Hva den bidrar til |
|---|---|---|
| GPTBot | OpenAI | fremtidige OpenAI-modeller |
| ClaudeBot | Anthropic | fremtidige Claude-modeller |
| Google-Extended | Gemini-trening og faktagrunnlag | |
| Applebot-Extended | Apple | trening av Apple Intelligence |
| Meta-ExternalAgent | Meta | Meta AI |
| CCBot | Common Crawl | det åpne datasettet som de fleste modeller trenes på |
| Bytespider | ByteDance | Doubao |
| cohere-ai | Cohere | Cohere-modeller |
En mal for robots.txt
robots.txt er en ren tekstfil i roten av et nettsted (yoursite.com/robots.txt). En gruppe begynner med én eller flere User-agent-linjer som navngir roboter, etterfulgt av Allow- og Disallow-linjer for stier. En robot som er navngitt i en gruppe, følger gruppene der den er navngitt og ignorerer gruppen for alle roboter (User-agent: *).
Disse linjene slipper inn alle roboter som henter sider for å gi svar. Robotene som samler inn treningsdata, står bak #-tegn: Du velger selv om du vil slippe dem inn.
Legg til disse linjene i robots.txt-filen i rotmappen på nettstedet, og fjern grupper som blokkerer disse crawlerne. En crawler som har sin egen gruppe, følger bare den gruppen. Kopier derfor inn eventuelle Disallow-linjer som fortsatt skal gjelde for den.
# Crawlere som henter sider for å svare på spørsmål
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: Bingbot
User-agent: Applebot
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: Meta-ExternalFetcher
User-agent: Amazonbot
User-agent: YouBot
Allow: /
# Treningscrawlere: Du velger. Fjern #-tegnene for å gi dem tilgang.
# User-agent: GPTBot
# User-agent: ClaudeBot
# User-agent: Google-Extended
# User-agent: Applebot-Extended
# User-agent: Meta-ExternalAgent
# User-agent: CCBot
# User-agent: Bytespider
# User-agent: cohere-ai
# Allow: /Hvilke av dem slipper nettstedet ditt inn?
robots.txt er én måte å avvise en robot på. Innstillinger i et CDN eller en brannmur er en annen, og nettstedet kan fortsatt se helt fint ut i en nettleser. Den gratis robotsjekken leser robots.txt-filen din og ber om en side som hver enkelt robot. Det tar bare noen sekunder.
Spørsmål om KI-crawlere
Kan KI-assistenter lese nettstedet ditt?
Den gratis robotsjekken gir deg svar på noen sekunder, uten konto eller e-postadresse.