36 AI-modeller får lösa 20 verkliga uppgifter från småföretag
Fakturor, offerter, scheman, svar på recensioner och sortering av inkorgen, alla med en fallgrop som ett slarvigt svar går i. Varje svar blir antingen godkänt eller underkänt i sin helhet, och varje godkänt svar får ett pris.
Ett pilottest: 20 av utgåvans 40 uppgifter, 1 körning per modell.
- Modeller
- 36
- Uppgifter
- 20 av 40
- Omgångar
- 720
- Bedömning utifrån kriterier
- Kalibrerad
Genomförd i oktober 2026. Data licensierad enligt CC BY 4.0.
I AIGROWs benchmark för småföretag får 36 AI-modeller lösa 20 vardagliga kontorsuppgifter. Varje svar bedöms som godkänt eller underkänt utifrån skriftliga kontroller. I oktober 2026-upplagan delade Qwen3.8 Flash, Kimi K3 och Gemini 3.1 Pro (preview) förstaplatsen med 95%, och gpt-oss-120b hade lägst kostnad per godkänt resultat: $0.422 per tusen. Alla uppgifter, kontroller och resultat publiceras.
Resultat
Vad utgåvan från oktober 2026 visar och hur säkra slutsatserna är.
Qwen3.8 Flash, Kimi K3 och Gemini 3.1 Pro (preview) fick vardera 95% av sina körningar godkända, den högsta andelen i utgåvan.
95%-intervallen för 6 fler modeller når upp till den andelen. Med 20 körningar per modell går det inte att statistiskt skilja dem från topplaceringen. Intervallen i topplistan visar hur mycket resultaten kan variera.
Tusen godkända resultat kostar mellan $0.422 och $33.11, en skillnad på 78×.
gpt-oss-120b gav de billigaste godkända resultaten och Claude Fable 5.1 de dyraste. En modell som ofta misslyckas får bära kostnaden för det här, eftersom varje körning räknas in.
Svara offentligt på en negativ restaurangrecension utan att röja privata uppgifter var den svåraste uppgiften: 22% av körningarna godkändes.
En uppgift på språket engelska i kategorin svar på omdömen. På uppgiftssidan finns fallgroparna och de kontrollpunkter som de flesta modeller inte klarade.
Av körningarna på italienska godkändes 83%, jämfört med 65% på engelska.
De italienska uppgifterna är egna uppgifter, skrivna för italienska företag med italienska skatte- och märkningsregler. De är inte översättningar av de engelska. Skillnaden speglar både språk och svårighetsgrad.
Medianen för svarstid sträckte sig från 1.2 s för Gemini 3.5 Flash-Lite till 43 s för Qwen3.8 Max.
Tiden mäts från att begäran skickas tills det sista ordet i svaret kommer. Misslyckade anrop räknas inte med. Kolumnen p90 visar hur länge en kund kan behöva vänta på de långsammaste svaren.
Topplistan
Alla modeller på alla uppgifter, sorterade efter hur ofta deras svar blev godkända. Sortera efter kostnad för att se priset per godkänt svar, eller efter hastighet för att se vem som svarar först.
Högst andel godkända körningar först.
| # | Modell | Andel godkända | Per 1,000 godkända resultat | Median | p90 | Engelska | Italienska |
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.8 FlashAlibaba (Qwen) | 95%-intervall: 76 till 99% | $1.09 | 29 s | 44 s | 92% | 100% |
| 1 | Kimi K3Moonshot AI · öppna modellvikter | 95%-intervall: 76 till 99% | $18.44 | 15 s | 78 s | 100% | 86% |
| 1 | Gemini 3.1 Pro (preview)Google | 95%-intervall: 76 till 99% | $29.67 | 17 s | 21 s | 92% | 100% |
| 4 | GLM-5.3-FlashZ.ai · öppna modellvikter | 95%-intervall: 70 till 97% | $0.831 | 15 s | 31 s | 92% | 86% |
| 4 | DeepSeek V4.1 FlashDeepSeek · öppna modellvikter | 95%-intervall: 70 till 97% | $1.05 | 14 s | 127 s | 85% | 100% |
| 4 | DeepSeek V4 ProDeepSeek · öppna modellvikter | 95%-intervall: 70 till 97% | $5.14 | 21 s | 49 s | 85% | 100% |
| 4 | GLM-5.3Z.ai · öppna modellvikter | 95%-intervall: 70 till 97% | $7.02 | 9.2 s | 31 s | 92% | 86% |
| 4 | Gemini 3.8 FlashGoogle | 95%-intervall: 70 till 97% | $7.17 | 11 s | 16 s | 85% | 100% |
| 4 | Grok 4.7xAI | 95%-intervall: 70 till 97% | $9.41 | 17 s | 27 s | 92% | 86% |
| 10 | Qwen3.7 PlusAlibaba (Qwen) | 95%-intervall: 64 till 95% | $3.58 | 29 s | 41 s | 77% | 100% |
| 10 | Claude Sonnet 5Anthropic | 95%-intervall: 64 till 95% | $6.70* | 25 s | 51 s | 77% | 100% |
| 10 | GPT-5.6 SolOpenAI | 95%-intervall: 64 till 95% | $11.33* | 27 s | 37 s | 77% | 100% |
| 10 | Qwen3.8 MaxAlibaba (Qwen) | 95%-intervall: 64 till 95% | $16.32 | 43 s | 82 s | 77% | 100% |
| 10 | Claude Opus 5Anthropic | 95%-intervall: 64 till 95% | $16.89* | 27 s | 83 s | 77% | 100% |
| 10 | GPT-5.5OpenAI | 95%-intervall: 64 till 95% | $17.02* | 22 s | 34 s | 77% | 100% |
| 10 | GPT-6 AstraOpenAI | 95%-intervall: 64 till 95% | $27.91* | 11 s | 38 s | 77% | 100% |
| 10 | Claude Fable 5.1Anthropic | 95%-intervall: 64 till 95% | $33.11* | 26 s | 51 s | 77% | 100% |
| 18 | GPT-5.6 LunaOpenAI | 95%-intervall: 58 till 92% | $0.677* | 28 s | 34 s | 69% | 100% |
| 18 | Muse Glimmer 30BMeta · öppna modellvikter | 95%-intervall: 58 till 92% | $3.10 | 13 s | 27 s | 69% | 100% |
| 18 | Grok 4.3xAI | 95%-intervall: 58 till 92% | $4.10 | 7.4 s | 9.7 s | 77% | 86% |
| 18 | GPT-5.6 TerraOpenAI | 95%-intervall: 58 till 92% | $6.68* | 29 s | 36 s | 69% | 100% |
| 18 | Qwen3.8 27BAlibaba (Qwen) · öppna modellvikter | 95%-intervall: 58 till 92% | $7.30 | 43 s | 89 s | 77% | 86% |
| 23 | gpt-oss-120bOpenAI · öppna modellvikter | 95%-intervall: 53 till 89% | $0.422 | 33 s | 69 s | 77% | 71% |
| 23 | MiniMax M3MiniMax · öppna modellvikter | 95%-intervall: 53 till 89% | $1.82 | 6.4 s | 45 s | 77% | 71% |
| 23 | Claude Sonnet 4.6Anthropic | 95%-intervall: 53 till 89% | $11.24* | 28 s | 54 s | 62% | 100% |
| 23 | Kimi K2.6Moonshot AI · öppna modellvikter | 95%-intervall: 53 till 89% | $11.68 | 28 s | 73 s | 69% | 86% |
| 27 | Gemma 4 31BGoogle · öppna modellvikter | 95%-intervall: 39 till 78% | $0.558 | 11 s | 36 s | 46% | 86% |
| 28 | Llama 4 MaverickMeta · öppna modellvikter | 95%-intervall: 26 till 66% | $0.665 | 14 s | 21 s | 38% | 57% |
| 28 | Gemini 3.1 Flash-LiteGoogle | 95%-intervall: 26 till 66% | $1.41 | 1.7 s | 3.2 s | 38% | 57% |
| 30 | GPT-5.4 miniOpenAI | 95%-intervall: 22 till 61% | $3.35 | 1.7 s | 2.3 s | 23% | 71% |
| 30 | Mistral Medium 3.5Mistral · öppna modellvikter | 95%-intervall: 22 till 61% | $7.40 | 1.6 s | 2.3 s | 38% | 43% |
| 32 | Gemini 3.5 Flash-LiteGoogle | 95%-intervall: 18 till 57% | $2.47 | 1.2 s | 1.5 s | 23% | 57% |
| 32 | Claude Haiku 4.5Anthropic | 95%-intervall: 18 till 57% | $6.62 | 2.5 s | 3.4 s | 23% | 57% |
| 34 | GPT-5.4 nanoOpenAI | 95%-intervall: 15 till 52% | $1.51 | 2.7 s | 3.8 s | 23% | 43% |
| 35 | Ministral 3 14BMistral · öppna modellvikter | 95%-intervall: 8 till 42% | $1.07 | 3.9 s | 5.4 s | 8% | 43% |
| 35 | Mistral Small 4Mistral · öppna modellvikter | 95%-intervall: 8 till 42% | $1.33 | 2.0 s | 20 s | 15% | 29% |
Andelen godkända körningar visas med ett 95%-intervall under siffran. Modellens verkliga andel kan ligga var som helst inom intervallet. Kostnaden per godkänt resultat beräknas genom att kostnaden för alla körningar, även de underkända, delas med antalet godkända körningar. En asterisk markerar att kostnaden har beräknats utifrån tillverkarens listpris eftersom leverantören inte redovisade någon kostnad.
Efter typ av arbete
Andelen godkända körningar för varje uppgiftstyp, räknat över alla modeller, och vilka modeller som oftast blev godkända.
| Uppgiftstyp | Uppgifter | Godkända körningar | Oftast godkänd |
|---|---|---|---|
| Hantering av förfrågningar | 2 | 96% | 33 modeller med 100% |
| Utläsning av fakturor | 2 | 90% | 29 modeller med 100% |
| Prioritering av mejl | 1 | 83% | 30 modeller med 100% |
| Mötessammanfattningar | 1 | 83% | 30 modeller med 100% |
| Företagsberäkningar | 2 | 76% | 19 modeller med 100% |
| Kvalificering av leads | 1 | 72% | 26 modeller med 100% |
| Bokföring | 2 | 71% | 24 modeller med 100% |
| Tidsbokning | 2 | 69% | 21 modeller med 100% |
| Frågor om policyer | 1 | 69% | 25 modeller med 100% |
| Kundsupport | 2 | 67% | 17 modeller med 100% |
| Produktbeskrivningar | 1 | 58% | 21 modeller med 100% |
| Offerter | 2 | 51% | 9 modeller med 100% |
| Svar på omdömen | 1 | 22% | 8 modeller med 100% |
Uppgifterna
De svåraste först. På varje sida visas uppgiften så som modellerna fick den, dess fallgropar, alla kontroller beskrivna i ord och vad varje modell gjorde fel.
Efter företagstyp
Uppgifterna som en viss typ av företag skulle ge till AI, sida vid sida, med varje modells resultat på varje uppgift.
- Bästa AI-modellen för redovisningsbyråer
- 6 uppgifter: kategorisera ett italienskt kontoutdrag, kategorisera banktransaktioner, extrahera fakturauppgifter, extrahera uppgifter ur italienska leverantörsfakturor, beräkna italienska konsultfakturor och beräkna övertidsersättning.
- Bästa AI-modellen för restauranger och barer
- 4 uppgifter: svara på negativa recensioner, prioritera ärenden i ett företags inkorg, kategorisera banktransaktioner och kategorisera ett italienskt kontoutdrag.
- Bästa AI-modellen för butiker
- 4 uppgifter: besvara önskemål om återbetalning, besvara garantiärenden på italienska, skriva italienska produktbeskrivningar och skriva mötesanteckningar.
- Bästa AI-modellen för hantverkare och tjänsteföretag
- 6 uppgifter: prissätta ett uppdrag utifrån en prislista, skriva mejl med offerter, poängsätta säljleads, sortera kundmeddelanden, beräkna övertidsersättning och besvara frågor om personalhandboken.
Så bedöms svaren
Samma instruktioner och underlag till varje modell, ett svar per körning och ett resultat som inte beror på hur svaret låter.
- Godkänt eller underkänt
- Ett svar blir godkänt bara om det klarar alla fasta kontroller. För uppgifter som också har bedömningskriterier måste svaret dessutom uppfylla de flesta kriterierna, där de viktigaste är obligatoriska. Inga delpoäng ges.
- Fasta kontroller
- Strukturerade svar granskas fält för fält mot rätt värden, med en tolerans för belopp och timmar. Skrivna svar kontrolleras utifrån vad de måste innehålla, vad de inte får innehålla och hur långa de får vara. Samma kod bedömer varje modell.
- Bedömning utifrån kriterier
- gpt-5-6-sol bedömer varje kriterium vid temperaturen noll och ger en motivering. Varje svar bedöms två gånger, och en tredje bedömning avgör de kriterier där de två första skiljer sig åt. Modellens egen slutsats ignoreras: koden tillämpar godkännanderegeln på de bedömda kriterierna. Före körningen testades bedömaren två gånger på svar med kända resultat.
- Samma upplägg för alla
- Varje körning består av ett instruktionsmeddelande och ett meddelande med underlaget: inga verktyg, ingen webbsökning, inget JSON-läge, varje modells standardinställning för sampling och högst 4,000 token i svaret, inklusive resonemang. Ett svar som kapas vid den gränsen bedöms som det är. 1 körning per modell och uppgift.
- Granskade regler
- Innan en utgåva publiceras granskas varje underkänt svar som beror på en avgörande regel. Om en regel underkänner ett korrekt svar för att det saknar en detalj som instruktionerna aldrig efterfrågade, rättas regeln och svaren bedöms på nytt. En regel som fångar ett verkligt fel behålls, oavsett hur många modeller den underkänner.
- Kostnad och tid
- Kostnaden per körning är vad leverantören debiterade eller, om leverantören inte redovisar någon kostnad, antalet token till tillverkarens listpris. Tiden mäts från förfrågan till svarets sista ord. Misslyckade anrop räknas inte med.
- Intervall
- Varje andel godkända svar visas med ett Wilson-intervall på 95 %. Med bara några dussin körningar per modell kan en skillnad på flera procentenheter mellan två modeller bero på slumpen, vilket intervallen visar.
- Data
- Uppgifter, kontroller och resultat publiceras enligt CC BY 4.0: ange AIGROW som källa och länka till den här sidan. Varje uppgiftssida innehåller utgåvans kanariesträng så att uppgifterna kan hållas borta från träningsdata.
Låt modellerna som klarar uppgifterna börja arbeta
En AIGROW-agent utför den här typen av arbete i dina egna verktyg, enligt regler som du godkänner skriftligen. Om du vill köra modellerna själv kostar API-kredit en fjärdedel av listpriset.
Utgåvan från oktober 2026, pilotstudie