GPTBot: en träningscrawlare som drivs av OpenAI
GPTBot är en träningscrawlare. Den samlar in sidor till framtida OpenAI-modeller och drivs av OpenAI.
Översikt
- Ansvarig för webbplatsen
- OpenAI
- robots.txt-token
GPTBot- Syfte
- Träning. Träningscrawlare samlar in sidor till framtida modeller. Att stänga ute dem stoppar inte de crawlare som hämtar sidor för att ge svar. De har egna namn.
- Vad den bidrar till
- framtida OpenAI-modeller
Vad som händer om du blockerar den
Om du stänger ute GPTBot kommer dina sidor inte med i det som samlas in till framtida OpenAI-modeller. Crawlarna som hämtar sidor för att ge svar har egna namn och kan därför fortfarande läsa din webbplats.
Användaragent
Den fullständiga användaragenten enligt operatörens dokumentation. En förfrågan från GPTBot innehåller den här texten, som också syns i serverloggen.
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbotRader i robots.txt för GPTBot
robots.txt är en vanlig textfil i en webbplats rotkatalog (yoursite.com/robots.txt). En grupp börjar med en eller flera User-agent-rader som namnger crawlare, följt av Allow- och Disallow-rader för sökvägar. En crawlare som namnges i en grupp följer grupperna där den namnges och ignorerar gruppen för alla crawlare (User-agent: *).
För att släppa in den
User-agent: GPTBot
Allow: /För att stänga den ute
User-agent: GPTBot
Disallow: /Släpper din webbplats in den?
Den kostnadsfria kontrollen läser din robots.txt för GPTBot och begär din sida med dess användaragent. Då ser du om en regel i robots.txt eller en brandvägg stänger den ute.