GPTBot : un robot d’entraînement exploité par OpenAI
GPTBot est un robot d’entraînement. Il collecte des pages pour ce produit ou service (Futurs modèles OpenAI). Il est exploité par OpenAI.
En un coup d’œil
- Exploitant
- OpenAI
- Nom dans robots.txt
GPTBot- Rôle
- Entraînement. Les robots d’entraînement collectent des pages pour les futurs modèles. Les bloquer n’empêche pas les robots qui récupèrent des pages pour répondre de fonctionner : ils portent d’autres noms.
- À quoi servent les pages collectées
- Futurs modèles OpenAI
Conséquences du blocage
Si vous bloquez GPTBot, vos pages seront exclues de sa collecte pour ce produit ou service (Futurs modèles OpenAI). Les robots qui récupèrent des pages pour répondre portent d’autres noms et peuvent donc toujours lire votre site.
Agent utilisateur
L’agent utilisateur complet, tel qu’il figure dans la documentation de son exploitant. Ce texte apparaît dans les requêtes de GPTBot et dans les journaux du serveur.
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbotLignes robots.txt pour GPTBot
robots.txt est un fichier texte brut à la racine d’un site (yoursite.com/robots.txt). Un groupe commence par une ou plusieurs lignes User-agent qui nomment les robots, suivies de lignes Allow et Disallow définissant les chemins. Un robot nommé dans un groupe suit les groupes qui portent son nom et ignore celui destiné à tous les robots (User-agent: *).
Pour l’autoriser
User-agent: GPTBot
Allow: /Pour le bloquer
User-agent: GPTBot
Disallow: /Votre site l’autorise-t-il ?
La vérification lit votre fichier robots.txt pour GPTBot et demande votre page avec son agent utilisateur. Elle indique ainsi si une règle robots.txt ou un pare-feu le bloque.