GPTBot: En træningscrawler, som drives af OpenAI
GPTBot er en træningscrawler. Den indsamler sider til fremtidige OpenAI-modeller. Operatøren er OpenAI.
Overblik
- Ansvarlig virksomhed
- OpenAI
- robots.txt-token
GPTBot- Formål
- Træning. Træningscrawlere indsamler sider til fremtidige modeller. Hvis du blokerer dem, stopper det ikke de crawlere, der henter sider til svar. De har deres egne navne.
- Hvad den leverer data til
- fremtidige OpenAI-modeller
Hvad det ændrer at blokere den
Hvis du blokerer GPTBot, kommer dine sider ikke med i det, den indsamler til fremtidige OpenAI-modeller. De crawlere, der henter sider til svar, har deres egne navne og kan derfor stadig læse dit website.
User agent
Den fulde user agent fra operatørens dokumentation. En forespørgsel fra GPTBot indeholder denne tekst, som kan ses i serverloggen.
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbotLinjer i robots.txt for GPTBot
robots.txt er en almindelig tekstfil i roden af et website (yoursite.com/robots.txt). En gruppe begynder med en eller flere User-agent-linjer, der navngiver crawlere, efterfulgt af Allow- og Disallow-linjer for stier. En crawler, der er nævnt i en gruppe, følger de grupper, hvor dens navn står, og ignorerer gruppen for alle crawlere (User-agent: *).
Tillad adgang
User-agent: GPTBot
Allow: /Blokér adgang
User-agent: GPTBot
Disallow: /Giver dit website adgang?
Det gratis crawlertjek læser din robots.txt for GPTBot og henter din side med crawlerens user agent. Så kan du se, om en regel i robots.txt eller en firewall afviser den.