Risposte rapide

AIGrow offre il monitoraggio della visibilità AI, un assistente aziendale, la pubblicazione di articoli sul blog e servizi di automazione mirati. Inizia dalla scansione gratuita per esaminare il risultato prima di pagare.

Esegui la scansione gratuita

La scansione è gratuita e i piani di monitoraggio partono da 29 € al mese. L’audit operativo costa 290 €, l’audit della visibilità costa 490 € e per le realizzazioni personalizzate riceverai un prezzo scritto prima dell’inizio dei lavori.

Vedi i piani

Esegui la scansione gratuita. Analizza il tuo sito, chiede a diversi assistenti AI quali domande fanno i tuoi clienti e ti indica una cosa su cui intervenire. Non è richiesta alcuna registrazione e ti dirà se non hai bisogno di noi.

Inizia ora

Sì. Usa il modulo di contatto per domande sul prodotto, sulla fatturazione, sull’assistenza o sul progetto. Descrivi l’obiettivo e il sistema coinvolto, così la prima risposta potrà essere precisa.

Contatta AIGrow
Crawler AI

Crawler AI: cosa fa ogni bot e quali effetti ha bloccarlo

I crawler che leggono i siti web per gli assistenti AI: chi gestisce ciascuno, cosa alimenta e le regole robots.txt per consentirne o impedirne l’accesso.

I crawler AI sono bot che leggono i siti web per gli assistenti AI. I crawler di ricerca come OAI-SearchBot costruiscono l’indice da cui un assistente trae le pagine da citare, quelli attivati dall’utente come ChatGPT-User aprono una pagina su richiesta, mentre quelli per l’addestramento come GPTBot raccolgono pagine per i modelli futuri. Questo elenco ne comprende 22, con le regole robots.txt per ciascuno.

Tre tipi di crawler AI

Ricerca
I crawler di ricerca leggono le pagine per costruire l’indice che un assistente consulta quando risponde. Se non possono leggere una pagina, questa non può comparire né essere citata in quelle risposte.
Richiesta dell’utente
I crawler attivati dall’utente aprono una pagina quando qualcuno chiede a un assistente di leggerla. Se non possono leggerla, l’assistente non può aprirla durante quella conversazione.
Addestramento
I crawler per l’addestramento raccolgono pagine per i modelli futuri. Bloccarli non ferma i crawler che recuperano pagine per fornire risposte, perché hanno nomi distinti.

Tutti i crawler, suddivisi per ciò che alimentano

Ogni nome è l’identificativo usato in robots.txt. Apri la relativa pagina per vedere lo user agent e le regole.

Crawler di ricerca

CrawlerGestoreCosa alimenta
OAI-SearchBotOpenAIRicerca di ChatGPT
Claude-SearchBotAnthropicRicerca di Claude
PerplexityBotPerplexityPerplexity
GooglebotGoogleGoogle Search e AI Overviews
BingbotMicrosoftBing e Copilot
ApplebotAppleSiri e Spotlight
DuckAssistBotDuckDuckGorisposte di DuckDuckGo
AmazonbotAmazonAlexa e Rufus
YouBotYou.comrisposte di You.com

Crawler attivati dall’utente

CrawlerGestoreCosa alimenta
ChatGPT-UserOpenAIChatGPT
Claude-UserAnthropicClaude
Perplexity-UserPerplexityPerplexity
MistralAI-UserMistralLe Chat
Meta-ExternalFetcherMetaMeta AI

Crawler per l’addestramento

CrawlerGestoreCosa alimenta
GPTBotOpenAIfuturi modelli OpenAI
ClaudeBotAnthropicfuturi modelli Claude
Google-ExtendedGoogleaddestramento e grounding di Gemini
Applebot-ExtendedAppleaddestramento di Apple Intelligence
Meta-ExternalAgentMetaMeta AI
CCBotCommon Crawlil dataset aperto su cui viene addestrata la maggior parte dei modelli
BytespiderByteDanceDoubao
cohere-aiCoheremodelli Cohere

Un modello di robots.txt

robots.txt è un file di testo semplice nella directory principale di un sito (yoursite.com/robots.txt). Un gruppo inizia con una o più righe User-agent che indicano i crawler, seguite da righe Allow e Disallow per i percorsi. Un crawler indicato in un gruppo segue i gruppi che lo nominano e ignora quello valido per tutti i crawler (User-agent: *).

Queste righe consentono l’accesso a tutti i crawler che recuperano pagine per fornire risposte. I crawler usati per l’addestramento sono preceduti dal simbolo #: sta a te decidere se consentire anche a loro l’accesso.

Aggiungi queste righe al file robots.txt nella directory principale del sito e rimuovi gli eventuali gruppi che bloccano questi crawler. Un crawler indicato in un gruppo dedicato segue solo le regole di quel gruppo: copia al suo interno le righe Disallow che vuoi mantenere.

# Crawler che recuperano pagine per fornire risposte
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Googlebot
User-agent: Bingbot
User-agent: Applebot
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: Meta-ExternalFetcher
User-agent: Amazonbot
User-agent: YouBot
Allow: /

# Crawler usati per l’addestramento: la scelta è tua. Rimuovi i simboli # per consentire l’accesso.
# User-agent: GPTBot
# User-agent: ClaudeBot
# User-agent: Google-Extended
# User-agent: Applebot-Extended
# User-agent: Meta-ExternalAgent
# User-agent: CCBot
# User-agent: Bytespider
# User-agent: cohere-ai
# Allow: /

Crea un robots.txt completo per l’AI

A quali di questi crawler consente l’accesso il tuo sito?

robots.txt è uno dei modi per bloccare un crawler. Puoi farlo anche tramite le impostazioni di una CDN o di un firewall, mentre il sito continua a funzionare normalmente nel browser. Il controllo gratuito legge il tuo robots.txt e richiede una pagina fingendosi ciascun crawler, in pochi secondi.

Esegui il controllo gratuito dei crawler

Domande sui crawler AI

Entrambi sono gestiti da OpenAI. OAI-SearchBot è un crawler di ricerca: legge le pagine per la ricerca di ChatGPT. GPTBot è un crawler per l’addestramento: raccoglie pagine per i futuri modelli OpenAI. Con robots.txt puoi bloccare l’uno e consentire l’accesso all’altro.

Aggiungi un gruppo che indichi il nome di un crawler, o di più crawler, seguito da “Disallow: /”. Un crawler indicato in un gruppo segue i gruppi che lo nominano, quindi le regole per tutti i crawler (User-agent: *) non si applicano più a lui.

I crawler per l’addestramento e quelli che recuperano pagine per fornire risposte hanno nomi diversi. Puoi bloccare i primi e continuare a consentire l’accesso ai secondi.

Il controllo gratuito legge il tuo robots.txt per tutti i 22 crawler di questo elenco e richiede una pagina fingendosi ciascuno di quelli che hanno uno user agent. Poi ti mostra quali possono accedere e quali vengono bloccati.

Gli assistenti AI possono leggere il tuo sito?

Scoprilo in pochi secondi con il controllo gratuito dei crawler, senza account né email.