Rastreadores de IA: qué hace cada bot y qué cambia al bloquearlo
Los rastreadores que leen sitios web para los asistentes de IA: quién opera cada uno, para qué sirve y las líneas de robots.txt para permitirlo o bloquearlo.
Los rastreadores de IA son bots que leen sitios web para los asistentes de IA. Los de búsqueda, como OAI-SearchBot, crean el índice que consulta un asistente para citar fuentes; los que actúan a petición del usuario, como ChatGPT-User, abren una página cuando alguien lo pide; y los de entrenamiento, como GPTBot, recopilan páginas para futuros modelos. Esta lista incluye 22 rastreadores, con reglas de robots.txt para cada uno.
Tres tipos de rastreadores de IA
- Búsqueda
- Los rastreadores de búsqueda leen páginas para crear el índice que consulta un asistente al responder. Si no pueden leer una página, no podrán encontrarla ni citarla en sus respuestas.
- Solicitud del usuario
- Los rastreadores que actúan a petición del usuario abren una página cuando alguien pide a un asistente que la lea. Si no pueden leerla, el asistente no podrá abrirla en esa conversación.
- Entrenamiento
- Los rastreadores de entrenamiento recopilan páginas para futuros modelos. Bloquearlos no impide el acceso a los rastreadores que consultan páginas para elaborar respuestas, ya que tienen nombres distintos.
Todos los rastreadores, según su función
Cada nombre es el identificador usado en robots.txt. Abre uno para ver su agente de usuario y sus reglas.
Rastreadores de búsqueda
| Rastreador | Responsable del sitio | Qué alimenta |
|---|---|---|
| OAI-SearchBot | OpenAI | Búsqueda de ChatGPT |
| Claude-SearchBot | Anthropic | Búsqueda de Claude |
| PerplexityBot | Perplexity | Perplexity |
| Googlebot | Google Search y AI Overviews | |
| Bingbot | Microsoft | Bing y Copilot |
| Applebot | Apple | Siri y Spotlight |
| DuckAssistBot | DuckDuckGo | Respuestas de DuckDuckGo |
| Amazonbot | Amazon | Alexa y Rufus |
| YouBot | You.com | Respuestas de You.com |
Rastreadores que actúan a petición del usuario
| Rastreador | Responsable del sitio | Qué alimenta |
|---|---|---|
| ChatGPT-User | OpenAI | ChatGPT |
| Claude-User | Anthropic | Claude |
| Perplexity-User | Perplexity | Perplexity |
| MistralAI-User | Mistral | Le Chat |
| Meta-ExternalFetcher | Meta | Meta AI |
Rastreadores de entrenamiento
| Rastreador | Responsable del sitio | Qué alimenta |
|---|---|---|
| GPTBot | OpenAI | Futuros modelos de OpenAI |
| ClaudeBot | Anthropic | Futuros modelos de Claude |
| Google-Extended | Entrenamiento y fundamentación de Gemini | |
| Applebot-Extended | Apple | Entrenamiento de Apple Intelligence |
| Meta-ExternalAgent | Meta | Meta AI |
| CCBot | Common Crawl | el conjunto de datos abierto con el que se entrenan la mayoría de los modelos |
| Bytespider | ByteDance | Doubao |
| cohere-ai | Cohere | Modelos de Cohere |
Una plantilla de robots.txt
robots.txt es un archivo de texto sin formato situado en la raíz de un sitio (yoursite.com/robots.txt). Un grupo empieza con una o varias líneas User-agent que nombran rastreadores, seguidas de líneas Allow y Disallow para las rutas. Un rastreador nombrado en un grupo sigue los grupos que lo nombran e ignora el grupo general (User-agent: *).
Estas líneas permiten el acceso a todos los rastreadores que consultan páginas para elaborar respuestas. Los rastreadores de entrenamiento aparecen detrás del símbolo #: tú decides si les permites el acceso.
Añade estas líneas al archivo robots.txt en la raíz del sitio y elimina cualquier grupo que bloquee a estos rastreadores. Si un rastreador tiene su propio grupo, solo sigue las reglas de ese grupo. Copia en él las líneas Disallow que deban mantenerse.
# Rastreadores que obtienen páginas para responder
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: Bingbot
User-agent: Applebot
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: Meta-ExternalFetcher
User-agent: Amazonbot
User-agent: YouBot
Allow: /
# Rastreadores de entrenamiento: tú decides. Quita los signos # para permitirles el acceso.
# User-agent: GPTBot
# User-agent: ClaudeBot
# User-agent: Google-Extended
# User-agent: Applebot-Extended
# User-agent: Meta-ExternalAgent
# User-agent: CCBot
# User-agent: Bytespider
# User-agent: cohere-ai
# Allow: /¿A cuáles permite el acceso tu sitio?
robots.txt es una forma de impedir el acceso a un rastreador. También puedes hacerlo desde la configuración de una CDN o un firewall, sin que el sitio deje de verse bien en un navegador. La comprobación gratuita de rastreadores lee tu robots.txt y solicita tu página como cada rastreador en unos segundos.
Preguntas sobre los rastreadores de IA
¿Pueden leer tu sitio los asistentes de IA?
La comprobación gratuita de rastreadores te da la respuesta en unos segundos, sin cuenta ni correo electrónico.