Robots d’exploration IA : le rôle de chacun et les conséquences de son blocage
Les robots qui parcourent les sites pour les assistants IA : qui exploite chacun, à quoi servent les pages collectées et quelles lignes robots.txt permettent de l’autoriser ou de le bloquer.
Les robots d’exploration IA parcourent les sites pour les assistants IA. Les robots de recherche comme OAI-SearchBot constituent l’index dans lequel un assistant puise ses citations, les robots déclenchés par l’utilisateur comme ChatGPT-User ouvrent une page à la demande d’une personne, et les robots d’entraînement comme GPTBot collectent des pages pour les futurs modèles. Cette liste en présente 22, avec les règles robots.txt pour chacun.
Trois types de robots d’exploration IA
- Recherche
- Les robots de recherche lisent les pages pour constituer l’index qu’un assistant consulte lorsqu’il répond. Si un robot ne peut pas lire une page, elle ne peut pas être trouvée ni citée dans ces réponses.
- Demande d’un utilisateur
- Les robots déclenchés par l’utilisateur ouvrent une page lorsqu’une personne demande à un assistant de la lire. S’ils ne peuvent pas y accéder, cette page ne peut pas être ouverte dans la conversation.
- Entraînement
- Les robots d’entraînement collectent des pages pour les futurs modèles. Les bloquer n’empêche pas les robots qui récupèrent des pages pour répondre de fonctionner : ils portent d’autres noms.
Tous les robots, classés selon leur usage
Chaque nom est celui utilisé dans robots.txt. Ouvrez sa fiche pour voir son agent utilisateur et les règles correspondantes.
Robots de recherche
| Robot d’exploration | Exploitant | À quoi servent les pages collectées |
|---|---|---|
| OAI-SearchBot | OpenAI | Recherche ChatGPT |
| Claude-SearchBot | Anthropic | Recherche Claude |
| PerplexityBot | Perplexity | Perplexity |
| Googlebot | Google Search et AI Overviews | |
| Bingbot | Microsoft | Bing et Copilot |
| Applebot | Apple | Siri et Spotlight |
| DuckAssistBot | DuckDuckGo | Réponses de DuckDuckGo |
| Amazonbot | Amazon | Alexa et Rufus |
| YouBot | You.com | Réponses de You.com |
Robots déclenchés par l’utilisateur
| Robot d’exploration | Exploitant | À quoi servent les pages collectées |
|---|---|---|
| ChatGPT-User | OpenAI | ChatGPT |
| Claude-User | Anthropic | Claude |
| Perplexity-User | Perplexity | Perplexity |
| MistralAI-User | Mistral | Le Chat |
| Meta-ExternalFetcher | Meta | Meta AI |
Robots d’entraînement
| Robot d’exploration | Exploitant | À quoi servent les pages collectées |
|---|---|---|
| GPTBot | OpenAI | Futurs modèles OpenAI |
| ClaudeBot | Anthropic | Futurs modèles Claude |
| Google-Extended | Entraînement et ancrage de Gemini | |
| Applebot-Extended | Apple | Entraînement d’Apple Intelligence |
| Meta-ExternalAgent | Meta | Meta AI |
| CCBot | Common Crawl | Le jeu de données ouvert utilisé pour entraîner la plupart des modèles |
| Bytespider | ByteDance | Doubao |
| cohere-ai | Cohere | Modèles Cohere |
Un modèle de fichier robots.txt
robots.txt est un fichier texte brut à la racine d’un site (yoursite.com/robots.txt). Un groupe commence par une ou plusieurs lignes User-agent qui nomment les robots, suivies de lignes Allow et Disallow définissant les chemins. Un robot nommé dans un groupe suit les groupes qui portent son nom et ignore celui destiné à tous les robots (User-agent: *).
Ces lignes autorisent tous les robots qui récupèrent des pages pour fournir des réponses. Les robots d’entraînement sont précédés du signe # : à vous de décider si vous souhaitez les autoriser.
Ajoutez ces lignes au fichier robots.txt à la racine du site et supprimez tout groupe qui interdit l’accès à ces robots. Un robot nommé dans son propre groupe ne suit que les règles de ce groupe : recopiez-y donc les lignes Disallow qui doivent continuer à s’appliquer.
# Robots d’exploration qui récupèrent des pages pour répondre aux questions
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: Bingbot
User-agent: Applebot
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: Meta-ExternalFetcher
User-agent: Amazonbot
User-agent: YouBot
Allow: /
# Robots d’exploration utilisés pour l’entraînement : à vous de choisir. Retirez les signes # pour leur autoriser l’accès.
# User-agent: GPTBot
# User-agent: ClaudeBot
# User-agent: Google-Extended
# User-agent: Applebot-Extended
# User-agent: Meta-ExternalAgent
# User-agent: CCBot
# User-agent: Bytespider
# User-agent: cohere-ai
# Allow: /Lesquels votre site autorise-t-il ?
Le fichier robots.txt est un moyen de refuser l’accès à un robot. Un réglage du CDN ou du pare-feu peut aussi le faire, sans que rien ne paraisse anormal dans un navigateur. La vérification gratuite lit votre fichier robots.txt et demande votre page en se présentant comme chacun des robots, en quelques secondes.
Questions sur les robots d’exploration IA
Les assistants IA peuvent-ils lire votre site ?
La vérification gratuite vous répond en quelques secondes, sans compte ni adresse e-mail.