Respostas rápidas

AIGrow oferece monitorização da visibilidade em IA, um assistente para empresas, publicação de artigos no blog e serviços de automação com escopo definido. Comece pela análise gratuita para avaliar o resultado antes de pagar.

Faça a análise gratuita

A análise é gratuita e os planos de monitorização começam em 29 € por mês. A auditoria de operações custa 290 €, a auditoria de visibilidade custa 490 € e os projetos personalizados recebem um preço por escrito antes do início do trabalho.

Ver os planos

Faça a análise gratuita. Ela lê o seu site, pergunta a vários assistentes de IA o que os seus clientes perguntam e indica-lhe uma coisa. Não é necessário criar uma conta e a análise dirá se não precisa de nós.

Comece agora

Sim. Use o formulário de contacto para questões sobre o produto, faturação, suporte ou projetos. Descreva o objetivo e o sistema envolvido para que a primeira resposta possa ser específica.

Contactar a AIGrow
Rastreadores de IA

Rastreadores de IA: o que faz cada robô e o que muda ao bloqueá-lo

Os rastreadores que leem sites para assistentes de IA: quem opera cada um, o que alimentam e as linhas de robots.txt para permitir ou impedir o acesso.

Os rastreadores de IA são robôs que leem sites para assistentes de IA. Rastreadores de pesquisa como OAI-SearchBot criam o índice que um assistente cita, rastreadores acionados a pedido como ChatGPT-User abrem uma página quando alguém pede, e rastreadores de treino como GPTBot recolhem páginas para futuros modelos. Esta lista reúne 22 rastreadores, com regras de robots.txt para cada um.

Três tipos de rastreadores de IA

Pesquisa
Os rastreadores de pesquisa leem páginas para criar o índice que um assistente consulta ao responder. Se não conseguirem ler uma página, ela não poderá ser encontrada nem citada nessas respostas.
A pedido
Os rastreadores acionados a pedido abrem uma página quando alguém pede a um assistente que a leia. Se não conseguirem ler a página, o assistente não poderá abri-la nessa conversa.
Treino
Os rastreadores de treino recolhem páginas para futuros modelos. Bloqueá-los não impede o acesso dos rastreadores que obtêm páginas para responder a perguntas, pois estes têm nomes próprios.

Todos os rastreadores, agrupados pelo que alimentam

Cada nome corresponde ao identificador usado no robots.txt. Abra um deles para ver o respetivo user agent e as regras.

Rastreadores de pesquisa

CrawlerEntidade responsávelO que alimenta
OAI-SearchBotOpenAIPesquisa do ChatGPT
Claude-SearchBotAnthropicPesquisa do Claude
PerplexityBotPerplexityPerplexity
GooglebotGoogleGoogle Search e AI Overviews
BingbotMicrosoftBing e Copilot
ApplebotAppleSiri e Spotlight
DuckAssistBotDuckDuckGorespostas do DuckDuckGo
AmazonbotAmazonAlexa e Rufus
YouBotYou.comrespostas do You.com

Rastreadores acionados a pedido

CrawlerEntidade responsávelO que alimenta
ChatGPT-UserOpenAIChatGPT
Claude-UserAnthropicClaude
Perplexity-UserPerplexityPerplexity
MistralAI-UserMistralLe Chat
Meta-ExternalFetcherMetaMeta AI

Rastreadores de treino

CrawlerEntidade responsávelO que alimenta
GPTBotOpenAIfuturos modelos da OpenAI
ClaudeBotAnthropicfuturos modelos do Claude
Google-ExtendedGoogletreino e fundamentação do Gemini
Applebot-ExtendedAppletreino do Apple Intelligence
Meta-ExternalAgentMetaMeta AI
CCBotCommon Crawlo conjunto de dados aberto usado para treinar a maioria dos modelos
BytespiderByteDanceDoubao
cohere-aiCoheremodelos da Cohere

Um modelo de robots.txt

O robots.txt é um ficheiro de texto simples na raiz de um site (yoursite.com/robots.txt). Um grupo começa com uma ou mais linhas User-agent que identificam rastreadores, seguidas de linhas Allow e Disallow para os caminhos. Um rastreador identificado num grupo segue os grupos que o nomeiam e ignora o grupo geral para todos os rastreadores (User-agent: *).

Estas linhas permitem o acesso de todos os rastreadores que obtêm páginas para responder a perguntas. Os rastreadores de treino estão precedidos de #. Cabe-lhe decidir se lhes permite o acesso.

Adicione estas linhas ao ficheiro robots.txt na raiz do site e remova qualquer grupo que bloqueie esses rastreadores. Um rastreador identificado num grupo próprio segue apenas as regras desse grupo. Por isso, copie para esse grupo as linhas Disallow que devem continuar a aplicar-se.

# Rastreadores que consultam páginas para gerar respostas
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: Bingbot
User-agent: Applebot
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: Meta-ExternalFetcher
User-agent: Amazonbot
User-agent: YouBot
Allow: /

# Rastreadores de treino: a escolha é sua. Remova os sinais # para permitir o acesso.
# User-agent: GPTBot
# User-agent: ClaudeBot
# User-agent: Google-Extended
# User-agent: Applebot-Extended
# User-agent: Meta-ExternalAgent
# User-agent: CCBot
# User-agent: Bytespider
# User-agent: cohere-ai
# Allow: /

Crie um robots.txt completo para IA

A quais deles o seu site permite o acesso?

O robots.txt é uma forma de impedir o acesso de um rastreador. Uma configuração da CDN ou da firewall é outra, mesmo que o site continue a funcionar normalmente no navegador. A verificação gratuita de rastreadores lê o seu robots.txt e solicita a sua página como cada rastreador, em poucos segundos.

Faça a verificação gratuita de rastreadores

Perguntas sobre rastreadores de IA

Ambos são operados pela OpenAI. OAI-SearchBot é um rastreador de pesquisa: lê páginas para a pesquisa do ChatGPT. GPTBot é um rastreador de treino: recolhe páginas para futuros modelos da OpenAI. O robots.txt permite bloquear um e autorizar o outro.

Adicione um grupo com o nome de um rastreador, ou de vários, seguido de “Disallow: /”. Um rastreador nomeado num grupo segue os grupos que o nomeiam. Por isso, as regras gerais para todos os rastreadores (User-agent: *) deixam de se aplicar a ele.

Os rastreadores de treino e os que obtêm páginas para responder a perguntas têm nomes diferentes. Um site pode bloquear os primeiros e continuar a permitir o acesso dos segundos.

A verificação gratuita de rastreadores lê o seu robots.txt para todos os 22 rastreadores desta lista e solicita uma página como cada um dos que têm user agent. Depois, mostra quais conseguem aceder e quais são bloqueados.

Os assistentes de IA conseguem ler o seu site?

A verificação gratuita de rastreadores dá-lhe a resposta em poucos segundos, sem conta nem email.