CCBot : un robot d’entraînement exploité par Common Crawl
CCBot est un robot d’entraînement. Il collecte des pages pour ce produit ou service (Le jeu de données ouvert utilisé pour entraîner la plupart des modèles). Il est exploité par Common Crawl.
En un coup d’œil
- Exploitant
- Common Crawl
- Nom dans robots.txt
CCBot- Rôle
- Entraînement. Les robots d’entraînement collectent des pages pour les futurs modèles. Les bloquer n’empêche pas les robots qui récupèrent des pages pour répondre de fonctionner : ils portent d’autres noms.
- À quoi servent les pages collectées
- Le jeu de données ouvert utilisé pour entraîner la plupart des modèles
Conséquences du blocage
Si vous bloquez CCBot, vos pages seront exclues de sa collecte pour ce produit ou service (Le jeu de données ouvert utilisé pour entraîner la plupart des modèles). Les robots qui récupèrent des pages pour répondre portent d’autres noms et peuvent donc toujours lire votre site.
Agent utilisateur
L’agent utilisateur complet, tel qu’il figure dans la documentation de son exploitant. Ce texte apparaît dans les requêtes de CCBot et dans les journaux du serveur.
CCBot/2.0 (https://commoncrawl.org/faq/)Lignes robots.txt pour CCBot
robots.txt est un fichier texte brut à la racine d’un site (yoursite.com/robots.txt). Un groupe commence par une ou plusieurs lignes User-agent qui nomment les robots, suivies de lignes Allow et Disallow définissant les chemins. Un robot nommé dans un groupe suit les groupes qui portent son nom et ignore celui destiné à tous les robots (User-agent: *).
Pour l’autoriser
User-agent: CCBot
Allow: /Pour le bloquer
User-agent: CCBot
Disallow: /Votre site l’autorise-t-il ?
La vérification lit votre fichier robots.txt pour CCBot et demande votre page avec son agent utilisateur. Elle indique ainsi si une règle robots.txt ou un pare-feu le bloque.