CCBot: crawler per l’addestramento gestito da Common Crawl
CCBot è un crawler per l’addestramento. Raccoglie pagine per questo prodotto: il dataset aperto su cui viene addestrata la maggior parte dei modelli. È gestito da Common Crawl.
In breve
- Gestore
- Common Crawl
- Identificativo robots.txt
CCBot- Scopo
- Addestramento. I crawler per l’addestramento raccolgono pagine per i modelli futuri. Bloccarli non ferma i crawler che recuperano pagine per fornire risposte, perché hanno nomi distinti.
- Cosa alimenta
- il dataset aperto su cui viene addestrata la maggior parte dei modelli
Effetti del blocco
Se blocchi CCBot, le tue pagine resteranno fuori dai contenuti che raccoglie per questo prodotto: il dataset aperto su cui viene addestrata la maggior parte dei modelli. I crawler che recuperano pagine per fornire risposte hanno nomi distinti e potranno comunque leggere il tuo sito.
User agent
Questo è lo user agent completo riportato nella documentazione del gestore. Le richieste di CCBot lo includono e puoi vederlo nei log del server.
CCBot/2.0 (https://commoncrawl.org/faq/)Regole robots.txt per CCBot
robots.txt è un file di testo semplice nella directory principale di un sito (yoursite.com/robots.txt). Un gruppo inizia con una o più righe User-agent che indicano i crawler, seguite da righe Allow e Disallow per i percorsi. Un crawler indicato in un gruppo segue i gruppi che lo nominano e ignora quello valido per tutti i crawler (User-agent: *).
Per consentire l’accesso
User-agent: CCBot
Allow: /Per bloccare l’accesso
User-agent: CCBot
Disallow: /Il tuo sito gli consente l’accesso?
Il controllo dei crawler legge il tuo robots.txt per CCBot e richiede una pagina usando il suo user agent. Ti mostra così se a bloccarlo è una regola robots.txt o un firewall.