36 modelli AI alle prese con 20 attività reali delle piccole imprese
Fatture, preventivi, turni, risposte alle recensioni e smistamento delle email: ogni attività nasconde una trappola per chi risponde con poca attenzione. Ogni risposta supera o non supera la prova nel suo insieme, e per ogni prova superata viene calcolato il costo.
Un test pilota: 20 delle 40 attività dell’edizione, con 1 esecuzioni per modello.
- Modelli
- 36
- Attività
- 20 di 40
- Sessioni
- 720
- Valutatore della rubrica
- Calibrato
Eseguito a ottobre 2026. Dati pubblicati con licenza CC BY 4.0.
Il benchmark AIGROW per le piccole imprese sottopone 20 attività d’ufficio quotidiane a 36 modelli AI e valuta ogni risposta come prova superata o non superata in base a controlli scritti. Nell'edizione di ottobre 2026, 3 modelli si sono classificati a pari merito al primo posto con 95%, mentre gpt-oss-120b ha ottenuto il costo più basso per le prove superate: $0.422 ogni mille. Ogni attività, verifica e risultato è pubblicato.
Risultati
Cosa mostra l’edizione di ottobre 2026 e quanto sono attendibili i risultati.
Qwen3.8 Flash, Kimi K3 e Gemini 3.1 Pro (preview) hanno superato ciascuno il 95% delle proprie prove, il tasso più alto di questa edizione.
Gli intervalli al 95% di 6 modelli altri raggiungono quel tasso. Con 20 prove per modello, non è possibile distinguerli da il primo; le barre della classifica mostrano quanto potrebbe variare il risultato di ciascuno.
Mille prove superate costano da $0.422 a $33.11, una differenza di 78×.
gpt-oss-120b ha ottenuto le prove superate meno costose e Claude Fable 5.1 quelle più costose. I modelli che falliscono spesso ne pagano il prezzo, perché il calcolo include il costo di ogni prova effettuata.
Rispondi pubblicamente a una recensione negativa di un ristorante senza divulgare dettagli privati è stata l’attività più difficile: superato il 22% delle prove.
Un'attività in inglese della categoria risposte alle recensioni. La pagina elenca le insidie e i criteri di verifica che la maggior parte dei modelli non ha soddisfatto.
Le attività in italiano hanno superato il 83% delle prove, contro il 65% di quelle in inglese.
Le attività in italiano sono state create appositamente per le imprese italiane, tenendo conto delle norme fiscali e delle regole di etichettatura locali: non sono traduzioni delle attività in inglese. La differenza nei risultati riflette sia la lingua sia la difficoltà.
Il tempo di risposta mediano va da 1.2 s per Gemini 3.5 Flash-Lite a 43 s per Qwen3.8 Max.
Misurato dall’invio della richiesta fino all’ultima parola della risposta, escludendo le chiamate fallite. La colonna p90 mostra quanto può allungarsi l’attesa per un cliente.
La classifica
Tutti i modelli su tutte le attività, ordinati in base alla frequenza con cui le loro risposte superano la prova. Ordina per costo per vedere quanto costa una prova superata, oppure per velocità per scoprire chi risponde prima.
Prima il tasso di successo più alto.
| # | Modello | Percentuale di successo | Per 1.000 prove superate | Mediana | p90 | Inglese | Italiano |
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.8 FlashAlibaba (Qwen) | Intervallo al 95%: da 76 a 99% | $1.09 | 29 s | 44 s | 92% | 100% |
| 1 | Kimi K3Moonshot AI · pesi aperti | Intervallo al 95%: da 76 a 99% | $18.44 | 15 s | 78 s | 100% | 86% |
| 1 | Gemini 3.1 Pro (preview)Google | Intervallo al 95%: da 76 a 99% | $29.67 | 17 s | 21 s | 92% | 100% |
| 4 | GLM-5.3-FlashZ.ai · pesi aperti | Intervallo al 95%: da 70 a 97% | $0.831 | 15 s | 31 s | 92% | 86% |
| 4 | DeepSeek V4.1 FlashDeepSeek · pesi aperti | Intervallo al 95%: da 70 a 97% | $1.05 | 14 s | 127 s | 85% | 100% |
| 4 | DeepSeek V4 ProDeepSeek · pesi aperti | Intervallo al 95%: da 70 a 97% | $5.14 | 21 s | 49 s | 85% | 100% |
| 4 | GLM-5.3Z.ai · pesi aperti | Intervallo al 95%: da 70 a 97% | $7.02 | 9.2 s | 31 s | 92% | 86% |
| 4 | Gemini 3.8 FlashGoogle | Intervallo al 95%: da 70 a 97% | $7.17 | 11 s | 16 s | 85% | 100% |
| 4 | Grok 4.7xAI | Intervallo al 95%: da 70 a 97% | $9.41 | 17 s | 27 s | 92% | 86% |
| 10 | Qwen3.7 PlusAlibaba (Qwen) | Intervallo al 95%: da 64 a 95% | $3.58 | 29 s | 41 s | 77% | 100% |
| 10 | Claude Sonnet 5Anthropic | Intervallo al 95%: da 64 a 95% | $6.70* | 25 s | 51 s | 77% | 100% |
| 10 | GPT-5.6 SolOpenAI | Intervallo al 95%: da 64 a 95% | $11.33* | 27 s | 37 s | 77% | 100% |
| 10 | Qwen3.8 MaxAlibaba (Qwen) | Intervallo al 95%: da 64 a 95% | $16.32 | 43 s | 82 s | 77% | 100% |
| 10 | Claude Opus 5Anthropic | Intervallo al 95%: da 64 a 95% | $16.89* | 27 s | 83 s | 77% | 100% |
| 10 | GPT-5.5OpenAI | Intervallo al 95%: da 64 a 95% | $17.02* | 22 s | 34 s | 77% | 100% |
| 10 | GPT-6 AstraOpenAI | Intervallo al 95%: da 64 a 95% | $27.91* | 11 s | 38 s | 77% | 100% |
| 10 | Claude Fable 5.1Anthropic | Intervallo al 95%: da 64 a 95% | $33.11* | 26 s | 51 s | 77% | 100% |
| 18 | GPT-5.6 LunaOpenAI | Intervallo al 95%: da 58 a 92% | $0.677* | 28 s | 34 s | 69% | 100% |
| 18 | Muse Glimmer 30BMeta · pesi aperti | Intervallo al 95%: da 58 a 92% | $3.10 | 13 s | 27 s | 69% | 100% |
| 18 | Grok 4.3xAI | Intervallo al 95%: da 58 a 92% | $4.10 | 7.4 s | 9.7 s | 77% | 86% |
| 18 | GPT-5.6 TerraOpenAI | Intervallo al 95%: da 58 a 92% | $6.68* | 29 s | 36 s | 69% | 100% |
| 18 | Qwen3.8 27BAlibaba (Qwen) · pesi aperti | Intervallo al 95%: da 58 a 92% | $7.30 | 43 s | 89 s | 77% | 86% |
| 23 | gpt-oss-120bOpenAI · pesi aperti | Intervallo al 95%: da 53 a 89% | $0.422 | 33 s | 69 s | 77% | 71% |
| 23 | MiniMax M3MiniMax · pesi aperti | Intervallo al 95%: da 53 a 89% | $1.82 | 6.4 s | 45 s | 77% | 71% |
| 23 | Claude Sonnet 4.6Anthropic | Intervallo al 95%: da 53 a 89% | $11.24* | 28 s | 54 s | 62% | 100% |
| 23 | Kimi K2.6Moonshot AI · pesi aperti | Intervallo al 95%: da 53 a 89% | $11.68 | 28 s | 73 s | 69% | 86% |
| 27 | Gemma 4 31BGoogle · pesi aperti | Intervallo al 95%: da 39 a 78% | $0.558 | 11 s | 36 s | 46% | 86% |
| 28 | Llama 4 MaverickMeta · pesi aperti | Intervallo al 95%: da 26 a 66% | $0.665 | 14 s | 21 s | 38% | 57% |
| 28 | Gemini 3.1 Flash-LiteGoogle | Intervallo al 95%: da 26 a 66% | $1.41 | 1.7 s | 3.2 s | 38% | 57% |
| 30 | GPT-5.4 miniOpenAI | Intervallo al 95%: da 22 a 61% | $3.35 | 1.7 s | 2.3 s | 23% | 71% |
| 30 | Mistral Medium 3.5Mistral · pesi aperti | Intervallo al 95%: da 22 a 61% | $7.40 | 1.6 s | 2.3 s | 38% | 43% |
| 32 | Gemini 3.5 Flash-LiteGoogle | Intervallo al 95%: da 18 a 57% | $2.47 | 1.2 s | 1.5 s | 23% | 57% |
| 32 | Claude Haiku 4.5Anthropic | Intervallo al 95%: da 18 a 57% | $6.62 | 2.5 s | 3.4 s | 23% | 57% |
| 34 | GPT-5.4 nanoOpenAI | Intervallo al 95%: da 15 a 52% | $1.51 | 2.7 s | 3.8 s | 23% | 43% |
| 35 | Ministral 3 14BMistral · pesi aperti | Intervallo al 95%: da 8 a 42% | $1.07 | 3.9 s | 5.4 s | 8% | 43% |
| 35 | Mistral Small 4Mistral · pesi aperti | Intervallo al 95%: da 8 a 42% | $1.33 | 2.0 s | 20 s | 15% | 29% |
Il tasso di successo è la quota di prove superate. L’intervallo al 95% è mostrato sotto: il tasso effettivo del modello potrebbe trovarsi in qualsiasi punto della barra. Il costo per prova superata divide il costo di tutte le prove, comprese quelle fallite, per il numero di prove superate. L’asterisco indica un costo calcolato in base al listino del produttore, quando il fornitore non ne ha comunicato uno.
Per tipo di lavoro
La quota di prove superate per ciascun tipo di attività, considerando tutti i modelli, e i modelli che le hanno superate più spesso.
| Tipo di attività | Attività | Prove superate | Superata più spesso da |
|---|---|---|---|
| Smistamento delle richieste | 2 | 96% | 33 modelli al 100% |
| Estrazione dei dati dalle fatture | 2 | 90% | 29 modelli al 100% |
| Classificazione delle email | 1 | 83% | 30 modelli al 100% |
| Riepiloghi delle riunioni | 1 | 83% | 30 modelli al 100% |
| Calcoli aziendali | 2 | 76% | 19 modelli al 100% |
| Qualificazione dei lead | 1 | 72% | 26 modelli al 100% |
| Contabilità | 2 | 71% | 24 modelli al 100% |
| Pianificazione degli appuntamenti | 2 | 69% | 21 modelli al 100% |
| Domande sulle policy | 1 | 69% | 25 modelli al 100% |
| Assistenza clienti | 2 | 67% | 17 modelli al 100% |
| Descrizioni dei prodotti | 1 | 58% | 21 modelli al 100% |
| Preventivi | 2 | 51% | 9 modelli al 100% |
| Risposte alle recensioni | 1 | 22% | 8 modelli al 100% |
Le attività
Dalle più difficili. Ogni pagina mostra l’attività così come l’hanno vista i modelli, le trappole che contiene, tutti i controlli spiegati a parole e gli errori commessi da ciascun modello.
Per tipo di impresa
Le attività che un certo tipo di impresa affiderebbe all’AI, affiancate dai risultati di ogni modello su ciascuna.
- Miglior modello AI per studi di commercialisti
- 6 attività: categorizzare i movimenti di un estratto conto bancario italiano, categorizzare le transazioni bancarie, estrarre i dati dalle fatture, estrarre i dati dalle fatture dei fornitori italiani, calcolare le fatture dei professionisti italiani e calcolare la retribuzione degli straordinari.
- Miglior modello AI per ristoranti e bar
- 4 attività: rispondere alle recensioni negative, smistare le email aziendali, categorizzare le transazioni bancarie e categorizzare i movimenti di un estratto conto bancario italiano.
- Miglior modello AI per negozi
- 4 attività: rispondere alle richieste di rimborso, rispondere alle richieste di garanzia in italiano, scrivere descrizioni di prodotti in italiano e redigere verbali delle riunioni.
- Miglior modello AI per artigiani e imprese di servizi
- 6 attività: calcolare il prezzo di un lavoro da un listino, scrivere email con preventivi, valutare i potenziali clienti, smistare i messaggi dei clienti, calcolare la retribuzione degli straordinari e rispondere a domande sul manuale del personale.
Come vengono valutate le risposte
Ogni modello riceve le stesse istruzioni e lo stesso materiale. Ogni esecuzione produce una risposta, valutata senza badare a quanto suoni convincente.
- Prova superata o non superata
- Una risposta supera la prova solo se passa tutti i controlli prestabiliti. Nelle attività che prevedono anche una rubrica di valutazione, deve soddisfare la maggior parte dei criteri, inclusi obbligatoriamente quelli più importanti. Non è previsto un punteggio parziale.
- Controlli prestabiliti
- Le risposte strutturate vengono confrontate campo per campo con i valori corretti, con un margine di tolleranza per importi e ore. Nelle risposte scritte si verifica cosa devono dire, cosa non devono dire e quanto possono essere lunghe. Lo stesso codice valuta tutti i modelli.
- Il valutatore della rubrica
- I criteri della rubrica sono valutati da gpt-5-6-sol con temperatura zero, ciascuno con una motivazione. Ogni risposta viene valutata due volte; una terza valutazione risolve gli eventuali disaccordi sui singoli criteri. Il verdetto del valutatore viene ignorato: è il codice ad applicare la regola di superamento ai criteri valutati. Prima dell’esecuzione, il valutatore è stato testato due volte su risposte dall’esito noto.
- Un unico protocollo
- Ogni esecuzione comprende un messaggio con le istruzioni e uno con il materiale: niente strumenti, ricerche sul web o modalità JSON. Si usano le impostazioni di campionamento predefinite di ciascun modello, con un massimo di 4,000 token di output, incluso il ragionamento. Una risposta interrotta a quel limite viene valutata così com’è. Ogni modello viene eseguito 1 volte per ciascuna attività.
- Regole verificate
- Prima di pubblicare un’edizione, viene esaminato ogni errore rilevato da una regola determinante. Se una regola boccia una risposta corretta perché manca un dettaglio mai richiesto nelle istruzioni, viene corretta e le risposte vengono valutate di nuovo. Se rileva un errore reale, resta invariata, anche quando fa fallire molti modelli.
- Costo e tempo
- Il costo di un’esecuzione è quello addebitato dal fornitore oppure, se il fornitore non comunica alcun costo, quello dei token calcolato ai prezzi di listino del produttore. Il tempo va dall’invio della richiesta all’ultima parola della risposta; le chiamate non riuscite sono escluse.
- Intervalli
- Ogni percentuale di successo è accompagnata da un intervallo di Wilson al 95%. Con poche decine di esecuzioni per modello, uno scarto di diversi punti tra due modelli può essere dovuto al caso, e le barre lo rendono visibile.
- I dati
- Attività, controlli e risultati sono pubblicati con licenza CC BY 4.0: cita AIGROW e inserisci un link a questa pagina. Ogni pagina delle attività contiene la stringa canary dell’edizione, per consentire di escluderle dai set di addestramento.
Metti al lavoro i modelli che superano le prove
Un agente AIGROW svolge questo tipo di lavoro nei tuoi strumenti, seguendo regole che approvi per iscritto. Se vuoi eseguire i modelli in autonomia, il Credito API costa un quarto del prezzo di listino.
Edizione di ottobre 2026, pilota