GPTBot: rastreador de treino operado por OpenAI
GPTBot é um rastreador de treino. Recolhe páginas para este fim (futuros modelos da OpenAI). A empresa responsável é OpenAI.
Visão geral
- Entidade responsável
- OpenAI
- Identificador no robots.txt
GPTBot- Finalidade
- Treino. Os rastreadores de treino recolhem páginas para futuros modelos. Bloqueá-los não impede o acesso dos rastreadores que obtêm páginas para responder a perguntas, pois estes têm nomes próprios.
- O que alimenta
- futuros modelos da OpenAI
O que muda ao bloqueá-lo
Se bloquear GPTBot, as suas páginas ficarão fora do material recolhido para este fim (futuros modelos da OpenAI). Os rastreadores que obtêm páginas para responder a perguntas têm nomes próprios e, por isso, poderão continuar a ler o seu site.
User agent
O user agent completo, segundo a documentação de quem o opera. Um pedido de GPTBot inclui este texto, que aparece nos registos do servidor.
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbotLinhas de robots.txt para GPTBot
O robots.txt é um ficheiro de texto simples na raiz de um site (yoursite.com/robots.txt). Um grupo começa com uma ou mais linhas User-agent que identificam rastreadores, seguidas de linhas Allow e Disallow para os caminhos. Um rastreador identificado num grupo segue os grupos que o nomeiam e ignora o grupo geral para todos os rastreadores (User-agent: *).
Para permitir o acesso
User-agent: GPTBot
Allow: /Para impedir o acesso
User-agent: GPTBot
Disallow: /O seu site permite o acesso?
A verificação de rastreadores lê o seu robots.txt para GPTBot e solicita a sua página com o respetivo user agent. Assim, mostra se uma regra do robots.txt ou uma firewall impede o acesso.