Rastreadores de IA: o que faz cada robô e o que muda ao bloqueá-lo
Os rastreadores que leem sites para assistentes de IA: quem opera cada um, o que alimentam e as linhas de robots.txt para permitir ou impedir o acesso.
Os rastreadores de IA são robôs que leem sites para assistentes de IA. Rastreadores de pesquisa como OAI-SearchBot criam o índice que um assistente cita, rastreadores acionados a pedido como ChatGPT-User abrem uma página quando alguém pede, e rastreadores de treino como GPTBot recolhem páginas para futuros modelos. Esta lista reúne 22 rastreadores, com regras de robots.txt para cada um.
Três tipos de rastreadores de IA
- Pesquisa
- Os rastreadores de pesquisa leem páginas para criar o índice que um assistente consulta ao responder. Se não conseguirem ler uma página, ela não poderá ser encontrada nem citada nessas respostas.
- A pedido
- Os rastreadores acionados a pedido abrem uma página quando alguém pede a um assistente que a leia. Se não conseguirem ler a página, o assistente não poderá abri-la nessa conversa.
- Treino
- Os rastreadores de treino recolhem páginas para futuros modelos. Bloqueá-los não impede o acesso dos rastreadores que obtêm páginas para responder a perguntas, pois estes têm nomes próprios.
Todos os rastreadores, agrupados pelo que alimentam
Cada nome corresponde ao identificador usado no robots.txt. Abra um deles para ver o respetivo user agent e as regras.
Rastreadores de pesquisa
| Crawler | Entidade responsável | O que alimenta |
|---|---|---|
| OAI-SearchBot | OpenAI | Pesquisa do ChatGPT |
| Claude-SearchBot | Anthropic | Pesquisa do Claude |
| PerplexityBot | Perplexity | Perplexity |
| Googlebot | Google Search e AI Overviews | |
| Bingbot | Microsoft | Bing e Copilot |
| Applebot | Apple | Siri e Spotlight |
| DuckAssistBot | DuckDuckGo | respostas do DuckDuckGo |
| Amazonbot | Amazon | Alexa e Rufus |
| YouBot | You.com | respostas do You.com |
Rastreadores acionados a pedido
| Crawler | Entidade responsável | O que alimenta |
|---|---|---|
| ChatGPT-User | OpenAI | ChatGPT |
| Claude-User | Anthropic | Claude |
| Perplexity-User | Perplexity | Perplexity |
| MistralAI-User | Mistral | Le Chat |
| Meta-ExternalFetcher | Meta | Meta AI |
Rastreadores de treino
| Crawler | Entidade responsável | O que alimenta |
|---|---|---|
| GPTBot | OpenAI | futuros modelos da OpenAI |
| ClaudeBot | Anthropic | futuros modelos do Claude |
| Google-Extended | treino e fundamentação do Gemini | |
| Applebot-Extended | Apple | treino do Apple Intelligence |
| Meta-ExternalAgent | Meta | Meta AI |
| CCBot | Common Crawl | o conjunto de dados aberto usado para treinar a maioria dos modelos |
| Bytespider | ByteDance | Doubao |
| cohere-ai | Cohere | modelos da Cohere |
Um modelo de robots.txt
O robots.txt é um ficheiro de texto simples na raiz de um site (yoursite.com/robots.txt). Um grupo começa com uma ou mais linhas User-agent que identificam rastreadores, seguidas de linhas Allow e Disallow para os caminhos. Um rastreador identificado num grupo segue os grupos que o nomeiam e ignora o grupo geral para todos os rastreadores (User-agent: *).
Estas linhas permitem o acesso de todos os rastreadores que obtêm páginas para responder a perguntas. Os rastreadores de treino estão precedidos de #. Cabe-lhe decidir se lhes permite o acesso.
Adicione estas linhas ao ficheiro robots.txt na raiz do site e remova qualquer grupo que bloqueie esses rastreadores. Um rastreador identificado num grupo próprio segue apenas as regras desse grupo. Por isso, copie para esse grupo as linhas Disallow que devem continuar a aplicar-se.
# Rastreadores que consultam páginas para gerar respostas
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: Bingbot
User-agent: Applebot
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: Meta-ExternalFetcher
User-agent: Amazonbot
User-agent: YouBot
Allow: /
# Rastreadores de treino: a escolha é sua. Remova os sinais # para permitir o acesso.
# User-agent: GPTBot
# User-agent: ClaudeBot
# User-agent: Google-Extended
# User-agent: Applebot-Extended
# User-agent: Meta-ExternalAgent
# User-agent: CCBot
# User-agent: Bytespider
# User-agent: cohere-ai
# Allow: /A quais deles o seu site permite o acesso?
O robots.txt é uma forma de impedir o acesso de um rastreador. Uma configuração da CDN ou da firewall é outra, mesmo que o site continue a funcionar normalmente no navegador. A verificação gratuita de rastreadores lê o seu robots.txt e solicita a sua página como cada rastreador, em poucos segundos.
Perguntas sobre rastreadores de IA
Os assistentes de IA conseguem ler o seu site?
A verificação gratuita de rastreadores dá-lhe a resposta em poucos segundos, sem conta nem email.