KI-Crawler: Was die einzelnen Bots tun und was sich durch das Blockieren ändert
Die Crawler, die Websites für KI-Assistenten lesen: wer sie betreibt, wofür sie Daten liefern und mit welchen robots.txt-Zeilen Sie sie zulassen oder sperren.
KI-Crawler sind Bots, die Websites für KI-Assistenten lesen. Such-Crawler wie OAI-SearchBot bauen den Index auf, aus dem ein Assistent Quellen zitiert. Nutzer-Crawler wie ChatGPT-User öffnen eine Seite auf Anfrage. Trainings-Crawler wie GPTBot sammeln Seiten für künftige Modelle. Diese Liste umfasst 22 Crawler mit den jeweiligen robots.txt-Regeln.
Drei Arten von KI-Crawlern
- Suche
- Such-Crawler lesen Seiten, um den Index aufzubauen, den ein Assistent für seine Antworten durchsucht. Kann er eine Seite nicht lesen, kann sie in diesen Antworten weder gefunden noch zitiert werden.
- Nutzeranfrage
- Nutzer-Crawler öffnen eine einzelne Seite, wenn jemand einen Assistenten bittet, sie zu lesen. Können sie die Seite nicht lesen, lässt sie sich in diesem Gespräch nicht öffnen.
- Training
- Trainings-Crawler sammeln Seiten für künftige Modelle. Wenn Sie sie aussperren, halten Sie damit nicht die Crawler auf, die Seiten für Antworten abrufen. Diese haben eigene Namen.
Alle Crawler nach Verwendungszweck
Die Namen sind die jeweiligen robots.txt-Token. Öffnen Sie einen Eintrag, um den User-Agent und die Regeln zu sehen.
Such-Crawler
| Crawler | Betreiber | Wofür er Daten liefert |
|---|---|---|
| OAI-SearchBot | OpenAI | ChatGPT-Suche |
| Claude-SearchBot | Anthropic | Claude-Suche |
| PerplexityBot | Perplexity | Perplexity |
| Googlebot | Google Search und AI Overviews | |
| Bingbot | Microsoft | Bing und Copilot |
| Applebot | Apple | Siri und Spotlight |
| DuckAssistBot | DuckDuckGo | Antworten von DuckDuckGo |
| Amazonbot | Amazon | Alexa und Rufus |
| YouBot | You.com | Antworten von You.com |
Nutzer-Crawler
| Crawler | Betreiber | Wofür er Daten liefert |
|---|---|---|
| ChatGPT-User | OpenAI | ChatGPT |
| Claude-User | Anthropic | Claude |
| Perplexity-User | Perplexity | Perplexity |
| MistralAI-User | Mistral | Le Chat |
| Meta-ExternalFetcher | Meta | Meta AI |
Trainings-Crawler
| Crawler | Betreiber | Wofür er Daten liefert |
|---|---|---|
| GPTBot | OpenAI | künftige OpenAI-Modelle |
| ClaudeBot | Anthropic | künftige Claude-Modelle |
| Google-Extended | Training und Fundierung von Gemini | |
| Applebot-Extended | Apple | Training von Apple Intelligence |
| Meta-ExternalAgent | Meta | Meta AI |
| CCBot | Common Crawl | der offene Datensatz, mit dem die meisten Modelle trainiert werden |
| Bytespider | ByteDance | Doubao |
| cohere-ai | Cohere | Cohere-Modelle |
Eine robots.txt-Vorlage
robots.txt ist eine reine Textdatei im Stammverzeichnis einer Website (yoursite.com/robots.txt). Eine Gruppe beginnt mit einer oder mehreren User-agent-Zeilen, die Crawler benennen. Darauf folgen Allow- und Disallow-Zeilen für Pfade. Ein Crawler, der in einer Gruppe namentlich genannt wird, befolgt die Gruppen mit seinem Namen und ignoriert die Gruppe für alle Crawler (User-agent: *).
Diese Zeilen lassen alle Crawler zu, die Seiten für Antworten abrufen. Die Trainings-Crawler stehen hinter #-Zeichen. Ob Sie sie zulassen, entscheiden Sie.
Fügen Sie diese Zeilen in die robots.txt-Datei im Stammverzeichnis der Website ein und entfernen Sie alle Gruppen, die diese Crawler ausschließen. Ein Crawler mit einer eigenen Gruppe beachtet nur diese Gruppe. Kopieren Sie deshalb alle Disallow-Zeilen hinein, die weiterhin gelten sollen.
# Crawler, die Seiten für Antworten abrufen
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: Bingbot
User-agent: Applebot
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: Meta-ExternalFetcher
User-agent: Amazonbot
User-agent: YouBot
Allow: /
# Trainings-Crawler: Sie entscheiden. Entfernen Sie die #-Zeichen, um sie zuzulassen.
# User-agent: GPTBot
# User-agent: ClaudeBot
# User-agent: Google-Extended
# User-agent: Applebot-Extended
# User-agent: Meta-ExternalAgent
# User-agent: CCBot
# User-agent: Bytespider
# User-agent: cohere-ai
# Allow: /Welche davon lässt Ihre Website zu?
Mit robots.txt können Sie einen Crawler abweisen. Das geht auch über eine CDN- oder Firewall-Einstellung, während die Website im Browser weiterhin normal aussieht. Die kostenlose Crawler-Prüfung liest Ihre robots.txt und ruft Ihre Seite innerhalb weniger Sekunden als jeder einzelne Crawler auf.
Fragen zu KI-Crawlern
Können KI-Assistenten Ihre Website lesen?
Die kostenlose Crawler-Prüfung liefert in wenigen Sekunden eine Antwort, ohne Konto und ohne E-Mail-Adresse.