Roboty AI: co robi każdy z nich i co zmienia jego zablokowanie
Roboty czytające strony na potrzeby asystentów AI: kto je obsługuje, do czego służą oraz jak je wpuszczać lub blokować w robots.txt.
Roboty AI czytają strony internetowe na potrzeby asystentów AI. Roboty wyszukiwarek, takie jak OAI-SearchBot, budują indeks wykorzystywany przez asystenta w cytowanych odpowiedziach. Roboty działające na żądanie użytkownika, takie jak ChatGPT-User, otwierają stronę, gdy ktoś o to poprosi. Roboty treningowe, takie jak GPTBot, zbierają strony na potrzeby przyszłych modeli. Lista obejmuje 22 roboty wraz z regułami robots.txt dla każdego z nich.
Trzy rodzaje robotów AI
- Wyszukiwanie
- Roboty wyszukiwarek czytają strony, aby zbudować indeks, który asystent przeszukuje podczas udzielania odpowiedzi. Strony, której nie mogą odczytać, nie znajdą ani nie zacytują w tych odpowiedziach.
- Żądanie użytkownika
- Roboty działające na żądanie użytkownika otwierają konkretną stronę, gdy ktoś poprosi asystenta o jej przeczytanie. Jeśli nie mogą jej odczytać, asystent nie otworzy jej w tej rozmowie.
- Trenowanie
- Roboty treningowe zbierają strony na potrzeby przyszłych modeli. Ich zablokowanie nie zatrzymuje robotów pobierających strony na potrzeby odpowiedzi, ponieważ działają one pod innymi nazwami.
Roboty według zastosowania
Każda nazwa jest używana w robots.txt. Otwórz szczegóły robota, aby zobaczyć jego identyfikator User-Agent i reguły.
Roboty wyszukiwarek
| Bot indeksujący | Podmiot prowadzący stronę | Do czego służy |
|---|---|---|
| OAI-SearchBot | OpenAI | wyszukiwanie w ChatGPT |
| Claude-SearchBot | Anthropic | wyszukiwanie w Claude |
| PerplexityBot | Perplexity | Perplexity |
| Googlebot | Google Search i AI Overviews | |
| Bingbot | Microsoft | Bing i Copilot |
| Applebot | Apple | Siri i Spotlight |
| DuckAssistBot | DuckDuckGo | odpowiedzi DuckDuckGo |
| Amazonbot | Amazon | Alexa i Rufus |
| YouBot | You.com | odpowiedzi You.com |
Roboty działające na żądanie użytkownika
| Bot indeksujący | Podmiot prowadzący stronę | Do czego służy |
|---|---|---|
| ChatGPT-User | OpenAI | ChatGPT |
| Claude-User | Anthropic | Claude |
| Perplexity-User | Perplexity | Perplexity |
| MistralAI-User | Mistral | Le Chat |
| Meta-ExternalFetcher | Meta | Meta AI |
Roboty treningowe
| Bot indeksujący | Podmiot prowadzący stronę | Do czego służy |
|---|---|---|
| GPTBot | OpenAI | przyszłe modele OpenAI |
| ClaudeBot | Anthropic | przyszłe modele Claude |
| Google-Extended | trenowanie i ugruntowywanie odpowiedzi Gemini | |
| Applebot-Extended | Apple | trenowanie Apple Intelligence |
| Meta-ExternalAgent | Meta | Meta AI |
| CCBot | Common Crawl | otwarty zbiór danych, na którym trenuje się większość modeli |
| Bytespider | ByteDance | Doubao |
| cohere-ai | Cohere | modele Cohere |
Szablon robots.txt
robots.txt to zwykły plik tekstowy w katalogu głównym witryny (yoursite.com/robots.txt). Grupa zaczyna się od jednego lub kilku wierszy User-agent z nazwami robotów, po których następują reguły Allow i Disallow dla ścieżek. Robot wymieniony w grupie stosuje reguły grup, w których podano jego nazwę, i ignoruje grupę ogólną dla wszystkich robotów (User-agent: *).
Te reguły wpuszczają wszystkie roboty pobierające strony na potrzeby odpowiedzi. Reguły dotyczące robotów treningowych poprzedzono znakiem #. To ty decydujesz, czy je wpuszczać.
Dodaj te wiersze do pliku robots.txt w katalogu głównym witryny i usuń każdą grupę, która blokuje tym robotom dostęp. Robot wymieniony we własnej grupie stosuje tylko jej reguły, więc skopiuj do niej wszystkie dyrektywy Disallow, które nadal mają go obowiązywać.
# Roboty pobierające strony na potrzeby odpowiedzi
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: Bingbot
User-agent: Applebot
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: Meta-ExternalFetcher
User-agent: Amazonbot
User-agent: YouBot
Allow: /
# Roboty zbierające dane treningowe: wybór należy do ciebie. Usuń znaki #, aby je wpuścić.
# User-agent: GPTBot
# User-agent: ClaudeBot
# User-agent: Google-Extended
# User-agent: Applebot-Extended
# User-agent: Meta-ExternalAgent
# User-agent: CCBot
# User-agent: Bytespider
# User-agent: cohere-ai
# Allow: /Które z tych robotów mają dostęp do twojej strony?
robots.txt to jeden ze sposobów blokowania robota. Można go też zablokować w ustawieniach CDN lub zapory sieciowej, a strona nadal będzie wyglądać poprawnie w przeglądarce. Bezpłatny test odczytuje twój plik robots.txt i w kilka sekund wysyła żądania do twojej strony jako poszczególne roboty.
Pytania o roboty AI
Czy asystenci AI mogą czytać twoją stronę?
Bezpłatny test daje odpowiedź w kilka sekund. Bez konta i bez podawania adresu e-mail.