CCBot: rastreador de entrenamiento operado por Common Crawl
CCBot es un rastreador de entrenamiento. Recopila páginas para el conjunto de datos abierto con el que se entrenan la mayoría de los modelos. Lo opera Common Crawl.
De un vistazo
- Responsable del sitio
- Common Crawl
- Identificador en robots.txt
CCBot- Función
- Entrenamiento. Los rastreadores de entrenamiento recopilan páginas para futuros modelos. Bloquearlos no impide el acceso a los rastreadores que consultan páginas para elaborar respuestas, ya que tienen nombres distintos.
- Qué alimenta
- el conjunto de datos abierto con el que se entrenan la mayoría de los modelos
Qué cambia al bloquearlo
Si bloqueas CCBot, tus páginas quedarán fuera de lo que recopila para el conjunto de datos abierto con el que se entrenan la mayoría de los modelos. Los rastreadores que consultan páginas para elaborar respuestas tienen nombres distintos, así que podrán seguir leyendo tu sitio.
Agente de usuario
El agente de usuario completo, según la documentación de quien lo opera. Las solicitudes de CCBot incluyen este texto, que aparece en los registros del servidor.
CCBot/2.0 (https://commoncrawl.org/faq/)Reglas de robots.txt para CCBot
robots.txt es un archivo de texto sin formato situado en la raíz de un sitio (yoursite.com/robots.txt). Un grupo empieza con una o varias líneas User-agent que nombran rastreadores, seguidas de líneas Allow y Disallow para las rutas. Un rastreador nombrado en un grupo sigue los grupos que lo nombran e ignora el grupo general (User-agent: *).
Para permitirle el acceso
User-agent: CCBot
Allow: /Para bloquearle el acceso
User-agent: CCBot
Disallow: /¿Tu sitio le permite el acceso?
La comprobación de rastreadores lee tu robots.txt para CCBot y solicita tu página con su agente de usuario. Así muestra si lo bloquea una regla de robots.txt o un firewall.