Risposte rapide

AIGrow offre il monitoraggio della visibilità AI, un assistente aziendale, la pubblicazione di articoli sul blog e servizi di automazione mirati. Inizia dalla scansione gratuita per esaminare il risultato prima di pagare.

Esegui la scansione gratuita

La scansione è gratuita e i piani di monitoraggio partono da $29 al mese. L’audit operativo costa $290, l’audit della visibilità costa $490 e per le realizzazioni personalizzate riceverai un prezzo scritto prima dell’inizio dei lavori.

Vedi i piani

Esegui la scansione gratuita. Analizza il tuo sito, chiede a diversi assistenti AI quali domande fanno i tuoi clienti e ti indica una cosa su cui intervenire. Non è richiesta alcuna registrazione e ti dirà se non hai bisogno di noi.

Inizia ora

Sì. Usa il modulo di contatto per domande sul prodotto, sulla fatturazione, sull’assistenza o sul progetto. Descrivi l’obiettivo e il sistema coinvolto, così la prima risposta potrà essere precisa.

Contatta AIGrow
Benchmark · edizione di ottobre 2026 · pilota

36 modelli AI alle prese con 20 attività reali delle piccole imprese

Fatture, preventivi, turni, risposte alle recensioni e smistamento delle email: ogni attività nasconde una trappola per chi risponde con poca attenzione. Ogni risposta supera o non supera la prova nel suo insieme, e per ogni prova superata viene calcolato il costo.

Un test pilota: 20 delle 40 attività dell’edizione, con 1 esecuzioni per modello.

Percentuale di successo più alta
95%A pari merito fra 3 modelli, ciascuno con 19 prove superate su 20
Modelli
36
Attività
20 di 40
Sessioni
720
Valutatore della rubrica
Calibrato

Eseguito a ottobre 2026. Dati pubblicati con licenza CC BY 4.0.

Il benchmark AIGROW per le piccole imprese sottopone 20 attività d’ufficio quotidiane a 36 modelli AI e valuta ogni risposta come prova superata o non superata in base a controlli scritti. Nell'edizione di ottobre 2026, 3 modelli si sono classificati a pari merito al primo posto con 95%, mentre gpt-oss-120b ha ottenuto il costo più basso per le prove superate: $0.422 ogni mille. Ogni attività, verifica e risultato è pubblicato.

Risultati

Cosa mostra l’edizione di ottobre 2026 e quanto sono attendibili i risultati.

  1. Qwen3.8 Flash, Kimi K3 e Gemini 3.1 Pro (preview) hanno superato ciascuno il 95% delle proprie prove, il tasso più alto di questa edizione.

    Gli intervalli al 95% di 6 modelli altri raggiungono quel tasso. Con 20 prove per modello, non è possibile distinguerli da il primo; le barre della classifica mostrano quanto potrebbe variare il risultato di ciascuno.

  2. Mille prove superate costano da $0.422 a $33.11, una differenza di 78×.

    gpt-oss-120b ha ottenuto le prove superate meno costose e Claude Fable 5.1 quelle più costose. I modelli che falliscono spesso ne pagano il prezzo, perché il calcolo include il costo di ogni prova effettuata.

  3. Rispondi pubblicamente a una recensione negativa di un ristorante senza divulgare dettagli privati è stata l’attività più difficile: superato il 22% delle prove.

    Un'attività in inglese della categoria risposte alle recensioni. La pagina elenca le insidie e i criteri di verifica che la maggior parte dei modelli non ha soddisfatto.

  4. Le attività in italiano hanno superato il 83% delle prove, contro il 65% di quelle in inglese.

    Le attività in italiano sono state create appositamente per le imprese italiane, tenendo conto delle norme fiscali e delle regole di etichettatura locali: non sono traduzioni delle attività in inglese. La differenza nei risultati riflette sia la lingua sia la difficoltà.

  5. Il tempo di risposta mediano va da 1.2 s per Gemini 3.5 Flash-Lite a 43 s per Qwen3.8 Max.

    Misurato dall’invio della richiesta fino all’ultima parola della risposta, escludendo le chiamate fallite. La colonna p90 mostra quanto può allungarsi l’attesa per un cliente.

La classifica

Tutti i modelli su tutte le attività, ordinati in base alla frequenza con cui le loro risposte superano la prova. Ordina per costo per vedere quanto costa una prova superata, oppure per velocità per scoprire chi risponde prima.

Prima il tasso di successo più alto.

Tasso di successo, costo per mille prove superate e tempo di risposta di 36 modelli AI
#ModelloPercentuale di successoPer 1.000 prove superateMedianap90IngleseItaliano
1Qwen3.8 FlashAlibaba (Qwen)95%Intervallo al 95%: da 76 a 99%$1.0929 s44 s92%100%
1Kimi K3Moonshot AI · pesi aperti95%Intervallo al 95%: da 76 a 99%$18.4415 s78 s100%86%
1Gemini 3.1 Pro (preview)Google95%Intervallo al 95%: da 76 a 99%$29.6717 s21 s92%100%
4GLM-5.3-FlashZ.ai · pesi aperti90%Intervallo al 95%: da 70 a 97%$0.83115 s31 s92%86%
4DeepSeek V4.1 FlashDeepSeek · pesi aperti90%Intervallo al 95%: da 70 a 97%$1.0514 s127 s85%100%
4DeepSeek V4 ProDeepSeek · pesi aperti90%Intervallo al 95%: da 70 a 97%$5.1421 s49 s85%100%
4GLM-5.3Z.ai · pesi aperti90%Intervallo al 95%: da 70 a 97%$7.029.2 s31 s92%86%
4Gemini 3.8 FlashGoogle90%Intervallo al 95%: da 70 a 97%$7.1711 s16 s85%100%
4Grok 4.7xAI90%Intervallo al 95%: da 70 a 97%$9.4117 s27 s92%86%
10Qwen3.7 PlusAlibaba (Qwen)85%Intervallo al 95%: da 64 a 95%$3.5829 s41 s77%100%
10Claude Sonnet 5Anthropic85%Intervallo al 95%: da 64 a 95%$6.70*25 s51 s77%100%
10GPT-5.6 SolOpenAI85%Intervallo al 95%: da 64 a 95%$11.33*27 s37 s77%100%
10Qwen3.8 MaxAlibaba (Qwen)85%Intervallo al 95%: da 64 a 95%$16.3243 s82 s77%100%
10Claude Opus 5Anthropic85%Intervallo al 95%: da 64 a 95%$16.89*27 s83 s77%100%
10GPT-5.5OpenAI85%Intervallo al 95%: da 64 a 95%$17.02*22 s34 s77%100%
10GPT-6 AstraOpenAI85%Intervallo al 95%: da 64 a 95%$27.91*11 s38 s77%100%
10Claude Fable 5.1Anthropic85%Intervallo al 95%: da 64 a 95%$33.11*26 s51 s77%100%
18GPT-5.6 LunaOpenAI80%Intervallo al 95%: da 58 a 92%$0.677*28 s34 s69%100%
18Muse Glimmer 30BMeta · pesi aperti80%Intervallo al 95%: da 58 a 92%$3.1013 s27 s69%100%
18Grok 4.3xAI80%Intervallo al 95%: da 58 a 92%$4.107.4 s9.7 s77%86%
18GPT-5.6 TerraOpenAI80%Intervallo al 95%: da 58 a 92%$6.68*29 s36 s69%100%
18Qwen3.8 27BAlibaba (Qwen) · pesi aperti80%Intervallo al 95%: da 58 a 92%$7.3043 s89 s77%86%
23gpt-oss-120bOpenAI · pesi aperti75%Intervallo al 95%: da 53 a 89%$0.42233 s69 s77%71%
23MiniMax M3MiniMax · pesi aperti75%Intervallo al 95%: da 53 a 89%$1.826.4 s45 s77%71%
23Claude Sonnet 4.6Anthropic75%Intervallo al 95%: da 53 a 89%$11.24*28 s54 s62%100%
23Kimi K2.6Moonshot AI · pesi aperti75%Intervallo al 95%: da 53 a 89%$11.6828 s73 s69%86%
27Gemma 4 31BGoogle · pesi aperti60%Intervallo al 95%: da 39 a 78%$0.55811 s36 s46%86%
28Llama 4 MaverickMeta · pesi aperti45%Intervallo al 95%: da 26 a 66%$0.66514 s21 s38%57%
28Gemini 3.1 Flash-LiteGoogle45%Intervallo al 95%: da 26 a 66%$1.411.7 s3.2 s38%57%
30GPT-5.4 miniOpenAI40%Intervallo al 95%: da 22 a 61%$3.351.7 s2.3 s23%71%
30Mistral Medium 3.5Mistral · pesi aperti40%Intervallo al 95%: da 22 a 61%$7.401.6 s2.3 s38%43%
32Gemini 3.5 Flash-LiteGoogle35%Intervallo al 95%: da 18 a 57%$2.471.2 s1.5 s23%57%
32Claude Haiku 4.5Anthropic35%Intervallo al 95%: da 18 a 57%$6.622.5 s3.4 s23%57%
34GPT-5.4 nanoOpenAI30%Intervallo al 95%: da 15 a 52%$1.512.7 s3.8 s23%43%
35Ministral 3 14BMistral · pesi aperti20%Intervallo al 95%: da 8 a 42%$1.073.9 s5.4 s8%43%
35Mistral Small 4Mistral · pesi aperti20%Intervallo al 95%: da 8 a 42%$1.332.0 s20 s15%29%

Il tasso di successo è la quota di prove superate. L’intervallo al 95% è mostrato sotto: il tasso effettivo del modello potrebbe trovarsi in qualsiasi punto della barra. Il costo per prova superata divide il costo di tutte le prove, comprese quelle fallite, per il numero di prove superate. L’asterisco indica un costo calcolato in base al listino del produttore, quando il fornitore non ne ha comunicato uno.

Per tipo di lavoro

La quota di prove superate per ciascun tipo di attività, considerando tutti i modelli, e i modelli che le hanno superate più spesso.

Percentuale di successo per tipo di attività
Tipo di attivitàAttivitàProve superateSuperata più spesso da
Smistamento delle richieste296%33 modelli al 100%
Estrazione dei dati dalle fatture290%29 modelli al 100%
Classificazione delle email183%30 modelli al 100%
Riepiloghi delle riunioni183%30 modelli al 100%
Calcoli aziendali276%19 modelli al 100%
Qualificazione dei lead172%26 modelli al 100%
Contabilità271%24 modelli al 100%
Pianificazione degli appuntamenti269%21 modelli al 100%
Domande sulle policy169%25 modelli al 100%
Assistenza clienti267%17 modelli al 100%
Descrizioni dei prodotti158%21 modelli al 100%
Preventivi251%9 modelli al 100%
Risposte alle recensioni122%8 modelli al 100%

Le attività

Dalle più difficili. Ogni pagina mostra l’attività così come l’hanno vista i modelli, le trappole che contiene, tutti i controlli spiegati a parole e gli errori commessi da ciascun modello.

Le attività, dalle più difficili
AttivitàTipoLinguaProve superate
Rispondi pubblicamente a una recensione negativa di un ristorante senza divulgare dettagli privatiRisposte alle recensioniInglese8 su 36
Invia via email un preventivo per la sistemazione del giardino, gestendo una richiesta sull’IVA e la presenza di un albero protettoPreventiviInglese16 su 36
Rispondi a una cliente che chiede un rimborso oltre il termine previstoAssistenza clientiInglese17 su 36
Calcola la retribuzione lorda settimanale di un addetto alle pulizie, tenendo conto di pause, straordinari e maggiorazione domenicaleCalcoli aziendaliInglese19 su 36
Scrivi una descrizione in italiano per la vendita di un olio d’oliva conforme alle norme sull’etichettaturaDescrizioni dei prodottiItaliano21 su 36
Calcola un preventivo per lavori di tinteggiatura dalle misure rilevate nel sopralluogo e dal listino prezziPreventiviInglese21 su 36
Organizza una chiamata tra Londra e New York nella settimana in cui cambia la differenza di fuso orarioPianificazione degli appuntamentiInglese23 su 36
Classificare i movimenti dell'estratto conto mensile di un bar e calcolare i costi operativiContabilitàInglese24 su 36
Rispondi alle domande sui permessi di un dipendente part-time usando il manuale del personaleDomande sulle policyInglese25 su 36
Assegna un punteggio a cinque lead in entrata per servizi di pulizia secondo le regole del team commercialeQualificazione dei leadInglese26 su 36
Classificare i movimenti dell'estratto conto di un bar italiano e calcolarne i totaliContabilitàItaliano27 su 36
Trova un appuntamento per l’igiene dentale vicino a un giorno festivo, in italianoPianificazione degli appuntamentiItaliano27 su 36
Trasforma la riunione del team di una panetteria in decisioni, responsabili e scadenzeRiepiloghi delle riunioniInglese30 su 36
Smista le email del lunedì di un’azienda di catering, inclusi un messaggio di phishing e una richiesta di modifica delle coordinate bancarieClassificazione delle emailInglese30 su 36
Estrai i dati da una fattura italiana di un fornitore che comprende una spesa esclusa dalla base imponibileEstrazione dei dati dalle fattureItaliano31 su 36
Rispondi in italiano a una cliente che crede erroneamente che la sua garanzia sia scadutaAssistenza clientiItaliano31 su 36
Smista dieci messaggi degli inquilini al team giusto, con la giusta prioritàSmistamento delle richiesteInglese33 su 36
Estrai i dati da una fattura fornitore di due pagine per la contabilità fornitoriEstrazione dei dati dalle fattureInglese34 su 36
Calcolare due fatture di un professionista italiano con contributo previdenziale, IVA e ritenuta d'accontoCalcoli aziendaliItaliano36 su 36
Smista i messaggi degli ospiti dell’hotel al reparto giusto, in italianoSmistamento delle richiesteItaliano36 su 36

Per tipo di impresa

Le attività che un certo tipo di impresa affiderebbe all’AI, affiancate dai risultati di ogni modello su ciascuna.

Miglior modello AI per studi di commercialisti
6 attività: categorizzare i movimenti di un estratto conto bancario italiano, categorizzare le transazioni bancarie, estrarre i dati dalle fatture, estrarre i dati dalle fatture dei fornitori italiani, calcolare le fatture dei professionisti italiani e calcolare la retribuzione degli straordinari.
Miglior modello AI per ristoranti e bar
4 attività: rispondere alle recensioni negative, smistare le email aziendali, categorizzare le transazioni bancarie e categorizzare i movimenti di un estratto conto bancario italiano.
Miglior modello AI per negozi
4 attività: rispondere alle richieste di rimborso, rispondere alle richieste di garanzia in italiano, scrivere descrizioni di prodotti in italiano e redigere verbali delle riunioni.
Miglior modello AI per artigiani e imprese di servizi
6 attività: calcolare il prezzo di un lavoro da un listino, scrivere email con preventivi, valutare i potenziali clienti, smistare i messaggi dei clienti, calcolare la retribuzione degli straordinari e rispondere a domande sul manuale del personale.

Come vengono valutate le risposte

Ogni modello riceve le stesse istruzioni e lo stesso materiale. Ogni esecuzione produce una risposta, valutata senza badare a quanto suoni convincente.

Prova superata o non superata
Una risposta supera la prova solo se passa tutti i controlli prestabiliti. Nelle attività che prevedono anche una rubrica di valutazione, deve soddisfare la maggior parte dei criteri, inclusi obbligatoriamente quelli più importanti. Non è previsto un punteggio parziale.
Controlli prestabiliti
Le risposte strutturate vengono confrontate campo per campo con i valori corretti, con un margine di tolleranza per importi e ore. Nelle risposte scritte si verifica cosa devono dire, cosa non devono dire e quanto possono essere lunghe. Lo stesso codice valuta tutti i modelli.
Il valutatore della rubrica
I criteri della rubrica sono valutati da gpt-5-6-sol con temperatura zero, ciascuno con una motivazione. Ogni risposta viene valutata due volte; una terza valutazione risolve gli eventuali disaccordi sui singoli criteri. Il verdetto del valutatore viene ignorato: è il codice ad applicare la regola di superamento ai criteri valutati. Prima dell’esecuzione, il valutatore è stato testato due volte su risposte dall’esito noto.
Un unico protocollo
Ogni esecuzione comprende un messaggio con le istruzioni e uno con il materiale: niente strumenti, ricerche sul web o modalità JSON. Si usano le impostazioni di campionamento predefinite di ciascun modello, con un massimo di 4,000 token di output, incluso il ragionamento. Una risposta interrotta a quel limite viene valutata così com’è. Ogni modello viene eseguito 1 volte per ciascuna attività.
Regole verificate
Prima di pubblicare un’edizione, viene esaminato ogni errore rilevato da una regola determinante. Se una regola boccia una risposta corretta perché manca un dettaglio mai richiesto nelle istruzioni, viene corretta e le risposte vengono valutate di nuovo. Se rileva un errore reale, resta invariata, anche quando fa fallire molti modelli.
Costo e tempo
Il costo di un’esecuzione è quello addebitato dal fornitore oppure, se il fornitore non comunica alcun costo, quello dei token calcolato ai prezzi di listino del produttore. Il tempo va dall’invio della richiesta all’ultima parola della risposta; le chiamate non riuscite sono escluse.
Intervalli
Ogni percentuale di successo è accompagnata da un intervallo di Wilson al 95%. Con poche decine di esecuzioni per modello, uno scarto di diversi punti tra due modelli può essere dovuto al caso, e le barre lo rendono visibile.
I dati
Attività, controlli e risultati sono pubblicati con licenza CC BY 4.0: cita AIGROW e inserisci un link a questa pagina. Ogni pagina delle attività contiene la stringa canary dell’edizione, per consentire di escluderle dai set di addestramento.

Metti al lavoro i modelli che superano le prove

Un agente AIGROW svolge questo tipo di lavoro nei tuoi strumenti, seguendo regole che approvi per iscritto. Se vuoi eseguire i modelli in autonomia, il Credito API costa un quarto del prezzo di listino.

Edizione di ottobre 2026, pilota