CCBot: rastreador de treino operado por Common Crawl
CCBot é um rastreador de treino. Recolhe páginas para este fim (o conjunto de dados aberto usado para treinar a maioria dos modelos). A empresa responsável é Common Crawl.
Visão geral
- Entidade responsável
- Common Crawl
- Identificador no robots.txt
CCBot- Finalidade
- Treino. Os rastreadores de treino recolhem páginas para futuros modelos. Bloqueá-los não impede o acesso dos rastreadores que obtêm páginas para responder a perguntas, pois estes têm nomes próprios.
- O que alimenta
- o conjunto de dados aberto usado para treinar a maioria dos modelos
O que muda ao bloqueá-lo
Se bloquear CCBot, as suas páginas ficarão fora do material recolhido para este fim (o conjunto de dados aberto usado para treinar a maioria dos modelos). Os rastreadores que obtêm páginas para responder a perguntas têm nomes próprios e, por isso, poderão continuar a ler o seu site.
User agent
O user agent completo, segundo a documentação de quem o opera. Um pedido de CCBot inclui este texto, que aparece nos registos do servidor.
CCBot/2.0 (https://commoncrawl.org/faq/)Linhas de robots.txt para CCBot
O robots.txt é um ficheiro de texto simples na raiz de um site (yoursite.com/robots.txt). Um grupo começa com uma ou mais linhas User-agent que identificam rastreadores, seguidas de linhas Allow e Disallow para os caminhos. Um rastreador identificado num grupo segue os grupos que o nomeiam e ignora o grupo geral para todos os rastreadores (User-agent: *).
Para permitir o acesso
User-agent: CCBot
Allow: /Para impedir o acesso
User-agent: CCBot
Disallow: /O seu site permite o acesso?
A verificação de rastreadores lê o seu robots.txt para CCBot e solicita a sua página com o respetivo user agent. Assim, mostra se uma regra do robots.txt ou uma firewall impede o acesso.