CCBot: robot treningowy, za którego odpowiada Common Crawl
CCBot to robot treningowy. Zbiera strony na potrzeby otwarty zbiór danych, na którym trenuje się większość modeli. Za robota odpowiada Common Crawl.
W skrócie
- Podmiot prowadzący stronę
- Common Crawl
- nazwa robota w robots.txt
CCBot- Zastosowanie
- Trenowanie. Roboty treningowe zbierają strony na potrzeby przyszłych modeli. Ich zablokowanie nie zatrzymuje robotów pobierających strony na potrzeby odpowiedzi, ponieważ działają one pod innymi nazwami.
- Do czego służy
- otwarty zbiór danych, na którym trenuje się większość modeli
Co zmienia zablokowanie
Jeśli CCBot nie ma dostępu do twoich stron, otwarty zbiór danych, na którym trenuje się większość modeli nie uwzględni ich w zbieranych danych. Roboty pobierające strony na potrzeby odpowiedzi działają pod innymi nazwami, więc nadal mogą czytać twoją witrynę.
Identyfikator User-Agent
Pełny identyfikator User-Agent z dokumentacji operatora. Żądania wysyłane przez CCBot zawierają ten tekst, który widać w logach serwera.
CCBot/2.0 (https://commoncrawl.org/faq/)Reguły robots.txt: CCBot
robots.txt to zwykły plik tekstowy w katalogu głównym witryny (yoursite.com/robots.txt). Grupa zaczyna się od jednego lub kilku wierszy User-agent z nazwami robotów, po których następują reguły Allow i Disallow dla ścieżek. Robot wymieniony w grupie stosuje reguły grup, w których podano jego nazwę, i ignoruje grupę ogólną dla wszystkich robotów (User-agent: *).
Aby zezwolić na dostęp
User-agent: CCBot
Allow: /Aby zablokować dostęp
User-agent: CCBot
Disallow: /Czy ma dostęp do twojej strony?
Bezpłatny test sprawdza reguły robots.txt, a następnie wysyła żądanie z identyfikatorem User-Agent, którego używa CCBot. Dzięki temu pokazuje, czy dostęp blokuje reguła robots.txt lub zapora sieciowa.