Miglior modello AI per negozi
Le attività del benchmark AIGROW per le piccole imprese che un negozio affiderebbe all’AI e i risultati di ciascuno dei 36 modelli su ogni attività, valutati come superati o non superati secondo criteri scritti.
Edizione di ottobre 2026, fase pilota, 1 prova per modello su ogni attività.
- Qwen3.8 Flash
- 4 su 4
- Gemini 3.1 Pro (preview)
- 4 su 4
- DeepSeek V4.1 Flash
- 4 su 4
- DeepSeek V4 Pro
- 4 su 4
- Gemini 3.8 Flash
- 4 su 4
- Claude Sonnet 5
- 4 su 4
In caso di parità, prevale il modello con i risultati migliori sull’insieme delle 20 attività.
Il benchmark AIGROW per le piccole imprese comprende 4 attività che un negozio affiderebbe all’AI. Nell'edizione di ottobre 2026, 12 modelli ha superato tutte le 4. Tra questi, DeepSeek V4.1 Flash ha ottenuto il costo più basso per le prove superate nell'intero benchmark: $1.05 ogni mille. La pagina di ogni attività mostra le insidie e gli errori di ciascun modello.
Tutti i modelli su queste attività
Prima chi ha superato più prove; in caso di parità, prevale il modello con i risultati migliori sull’insieme delle 20 attività. Il costo di 1.000 prove superate considera l’intero benchmark, incluse le prove fallite.
| Modello | Rispondere alle richieste di rimborso | Rispondere alle richieste di garanzia in italiano | Scrivere descrizioni di prodotti in italiano | Redigere verbali delle riunioni | Superate | 1.000 prove superate |
|---|---|---|---|---|---|---|
| Qwen3.8 Flash | Superato | Superato | Superato | Superato | 4 su 4 | $1.09 |
| Gemini 3.1 Pro (preview) | Superato | Superato | Superato | Superato | 4 su 4 | $29.67 |
| DeepSeek V4.1 Flash | Superato | Superato | Superato | Superato | 4 su 4 | $1.05 |
| DeepSeek V4 Pro | Superato | Superato | Superato | Superato | 4 su 4 | $5.14 |
| Gemini 3.8 Flash | Superato | Superato | Superato | Superato | 4 su 4 | $7.17 |
| Claude Sonnet 5 | Superato | Superato | Superato | Superato | 4 su 4 | $6.70 |
| Qwen3.8 Max | Superato | Superato | Superato | Superato | 4 su 4 | $16.32 |
| Claude Opus 5 | Superato | Superato | Superato | Superato | 4 su 4 | $16.89 |
| GPT-5.5 | Superato | Superato | Superato | Superato | 4 su 4 | $17.02 |
| GPT-6 Astra | Superato | Superato | Superato | Superato | 4 su 4 | $27.91 |
| GPT-5.6 Terra | Superato | Superato | Superato | Superato | 4 su 4 | $6.68 |
| Kimi K2.6 | Superato | Superato | Superato | Superato | 4 su 4 | $11.68 |
| Kimi K3 | Superato | Superato | Non superato | Superato | 3 su 4 | $18.44 |
| GLM-5.3-Flash | Superato | Superato | Non superato | Superato | 3 su 4 | $0.831 |
| GLM-5.3 | Superato | Superato | Non superato | Superato | 3 su 4 | $7.02 |
| Grok 4.7 | Superato | Superato | Non superato | Superato | 3 su 4 | $9.41 |
| Qwen3.7 Plus | Non superato | Superato | Superato | Superato | 3 su 4 | $3.58 |
| GPT-5.6 Sol | Non superato | Superato | Superato | Superato | 3 su 4 | $11.33 |
| Claude Fable 5.1 | Non superato | Superato | Superato | Superato | 3 su 4 | $33.11 |
| GPT-5.6 Luna | Non superato | Superato | Superato | Superato | 3 su 4 | $0.677 |
| MiniMax M3 | Superato | Superato | Non superato | Superato | 3 su 4 | $1.82 |
| Claude Sonnet 4.6 | Non superato | Superato | Superato | Superato | 3 su 4 | $11.24 |
| Gemma 4 31B | Non superato | Superato | Superato | Superato | 3 su 4 | $0.558 |
| Muse Glimmer 30B | Non superato | Superato | Superato | Non superato | 2 su 4 | $3.10 |
| Grok 4.3 | Non superato | Superato | Non superato | Superato | 2 su 4 | $4.10 |
| Qwen3.8 27B | Non superato | Superato | Non superato | Superato | 2 su 4 | $7.30 |
| gpt-oss-120b | Non superato | Superato | Non superato | Superato | 2 su 4 | $0.422 |
| Llama 4 Maverick | Non superato | Non superato | Superato | Superato | 2 su 4 | $0.665 |
| GPT-5.4 mini | Non superato | Superato | Non superato | Superato | 2 su 4 | $3.35 |
| Mistral Medium 3.5 | Non superato | Superato | Non superato | Superato | 2 su 4 | $7.40 |
| Gemini 3.1 Flash-Lite | Non superato | Non superato | Superato | Non superato | 1 su 4 | $1.41 |
| Claude Haiku 4.5 | Non superato | Superato | Non superato | Non superato | 1 su 4 | $6.62 |
| GPT-5.4 nano | Non superato | Non superato | Non superato | Superato | 1 su 4 | $1.51 |
| Ministral 3 14B | Non superato | Superato | Non superato | Non superato | 1 su 4 | $1.07 |
| Gemini 3.5 Flash-Lite | Non superato | Non superato | Non superato | Non superato | 0 su 4 | $2.47 |
| Mistral Small 4 | Non superato | Non superato | Non superato | Non superato | 0 su 4 | $1.33 |
Le attività
Ogni pagina mostra l’attività così come è stata presentata ai modelli, le sue insidie, tutti i criteri di valutazione spiegati e gli errori di ciascun modello.
- Rispondi a una cliente che chiede un rimborso oltre il termine previsto
- Inglese. 17 prove superate su 36.
- Rispondi in italiano a una cliente che crede erroneamente che la sua garanzia sia scaduta
- Italiano. 31 prove superate su 36.
- Scrivi una descrizione in italiano per la vendita di un olio d’oliva conforme alle norme sull’etichettatura
- Italiano. 21 prove superate su 36.
- Trasforma la riunione del team di una panetteria in decisioni, responsabili e scadenze
- Inglese. 30 prove superate su 36.
Affida questo lavoro a un agente
Un agente AIGROW svolge lavori come questo nei tuoi strumenti, seguendo regole che approvi per iscritto. Quando le regole non coprono un caso, lo segnala a una persona anziché tirare a indovinare.
Edizione di ottobre 2026