GPTBot: een trainingscrawler van OpenAI
GPTBot is een trainingscrawler. Hij verzamelt pagina's voor toekomstige OpenAI-modellen. OpenAI beheert deze crawler.
In één oogopslag
- Beheerder
- OpenAI
- robots.txt-token
GPTBot- Doel
- Training. Trainingscrawlers verzamelen pagina's voor toekomstige modellen. Als je ze weert, kunnen crawlers die pagina's ophalen voor antwoorden je site nog steeds lezen. Die hebben eigen namen.
- Waarvoor de gegevens worden gebruikt
- toekomstige OpenAI-modellen
Wat blokkeren verandert
Als je GPTBot weert, worden je pagina's niet verzameld voor toekomstige OpenAI-modellen. Crawlers die pagina's ophalen voor antwoorden hebben eigen namen en kunnen je site dus nog steeds lezen.
User-agent
De volledige user-agent volgens de documentatie van de beheerder. Een verzoek van GPTBot bevat deze tekst, die ook in serverlogs te zien is.
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbotrobots.txt-regels voor GPTBot
robots.txt is een tekstbestand in de hoofdmap van een site (yoursite.com/robots.txt). Een groep begint met één of meer User-agent-regels die crawlers benoemen, gevolgd door Allow- en Disallow-regels voor paden. Een crawler die in een groep wordt genoemd, volgt de groepen met zijn naam en negeert de groep voor alle crawlers (User-agent: *).
Toelaten
User-agent: GPTBot
Allow: /Blokkeren
User-agent: GPTBot
Disallow: /Laat jouw site deze crawler toe?
De gratis crawlercheck leest je robots.txt voor GPTBot en vraagt je pagina op met de bijbehorende user-agent. Zo zie je of een robots.txt-regel of een firewall deze crawler weert.