Crawler AI: cosa fa ogni bot e quali effetti ha bloccarlo
I crawler che leggono i siti web per gli assistenti AI: chi gestisce ciascuno, cosa alimenta e le regole robots.txt per consentirne o impedirne l’accesso.
I crawler AI sono bot che leggono i siti web per gli assistenti AI. I crawler di ricerca come OAI-SearchBot costruiscono l’indice da cui un assistente trae le pagine da citare, quelli attivati dall’utente come ChatGPT-User aprono una pagina su richiesta, mentre quelli per l’addestramento come GPTBot raccolgono pagine per i modelli futuri. Questo elenco ne comprende 22, con le regole robots.txt per ciascuno.
Tre tipi di crawler AI
- Ricerca
- I crawler di ricerca leggono le pagine per costruire l’indice che un assistente consulta quando risponde. Se non possono leggere una pagina, questa non può comparire né essere citata in quelle risposte.
- Richiesta dell’utente
- I crawler attivati dall’utente aprono una pagina quando qualcuno chiede a un assistente di leggerla. Se non possono leggerla, l’assistente non può aprirla durante quella conversazione.
- Addestramento
- I crawler per l’addestramento raccolgono pagine per i modelli futuri. Bloccarli non ferma i crawler che recuperano pagine per fornire risposte, perché hanno nomi distinti.
Tutti i crawler, suddivisi per ciò che alimentano
Ogni nome è l’identificativo usato in robots.txt. Apri la relativa pagina per vedere lo user agent e le regole.
Crawler di ricerca
| Crawler | Gestore | Cosa alimenta |
|---|---|---|
| OAI-SearchBot | OpenAI | Ricerca di ChatGPT |
| Claude-SearchBot | Anthropic | Ricerca di Claude |
| PerplexityBot | Perplexity | Perplexity |
| Googlebot | Google Search e AI Overviews | |
| Bingbot | Microsoft | Bing e Copilot |
| Applebot | Apple | Siri e Spotlight |
| DuckAssistBot | DuckDuckGo | risposte di DuckDuckGo |
| Amazonbot | Amazon | Alexa e Rufus |
| YouBot | You.com | risposte di You.com |
Crawler attivati dall’utente
| Crawler | Gestore | Cosa alimenta |
|---|---|---|
| ChatGPT-User | OpenAI | ChatGPT |
| Claude-User | Anthropic | Claude |
| Perplexity-User | Perplexity | Perplexity |
| MistralAI-User | Mistral | Le Chat |
| Meta-ExternalFetcher | Meta | Meta AI |
Crawler per l’addestramento
| Crawler | Gestore | Cosa alimenta |
|---|---|---|
| GPTBot | OpenAI | futuri modelli OpenAI |
| ClaudeBot | Anthropic | futuri modelli Claude |
| Google-Extended | addestramento e grounding di Gemini | |
| Applebot-Extended | Apple | addestramento di Apple Intelligence |
| Meta-ExternalAgent | Meta | Meta AI |
| CCBot | Common Crawl | il dataset aperto su cui viene addestrata la maggior parte dei modelli |
| Bytespider | ByteDance | Doubao |
| cohere-ai | Cohere | modelli Cohere |
Un modello di robots.txt
robots.txt è un file di testo semplice nella directory principale di un sito (yoursite.com/robots.txt). Un gruppo inizia con una o più righe User-agent che indicano i crawler, seguite da righe Allow e Disallow per i percorsi. Un crawler indicato in un gruppo segue i gruppi che lo nominano e ignora quello valido per tutti i crawler (User-agent: *).
Queste righe consentono l’accesso a tutti i crawler che recuperano pagine per fornire risposte. I crawler usati per l’addestramento sono preceduti dal simbolo #: sta a te decidere se consentire anche a loro l’accesso.
Aggiungi queste righe al file robots.txt nella directory principale del sito e rimuovi gli eventuali gruppi che bloccano questi crawler. Un crawler indicato in un gruppo dedicato segue solo le regole di quel gruppo: copia al suo interno le righe Disallow che vuoi mantenere.
# Crawler che recuperano pagine per fornire risposte
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: Bingbot
User-agent: Applebot
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: Meta-ExternalFetcher
User-agent: Amazonbot
User-agent: YouBot
Allow: /
# Crawler usati per l’addestramento: la scelta è tua. Rimuovi i simboli # per consentire l’accesso.
# User-agent: GPTBot
# User-agent: ClaudeBot
# User-agent: Google-Extended
# User-agent: Applebot-Extended
# User-agent: Meta-ExternalAgent
# User-agent: CCBot
# User-agent: Bytespider
# User-agent: cohere-ai
# Allow: /A quali di questi crawler consente l’accesso il tuo sito?
robots.txt è uno dei modi per bloccare un crawler. Puoi farlo anche tramite le impostazioni di una CDN o di un firewall, mentre il sito continua a funzionare normalmente nel browser. Il controllo gratuito legge il tuo robots.txt e richiede una pagina fingendosi ciascun crawler, in pochi secondi.
Domande sui crawler AI
Gli assistenti AI possono leggere il tuo sito?
Scoprilo in pochi secondi con il controllo gratuito dei crawler, senza account né email.