36 AI-modeller testet på 20 virkelige opgaver fra små virksomheder
Fakturaer, tilbud, vagtplaner, svar på anmeldelser og sortering af indbakken. Hver opgave har en faldgrube, som et uopmærksomt svar falder i. Hvert svar består eller dumper som helhed, og prisen for hvert bestået svar beregnes.
En pilottest: 20 af udgavens 40 opgaver, 1 gennemløb pr. model.
- Modeller
- 36
- Opgaver
- 20 af 40
- Kørsler
- 720
- Bedømmer efter vurderingsskema
- Kalibreret
Kørt i oktober 2026. Data under CC BY 4.0.
AIGROWs benchmark for små virksomheder giver 36 AI-modeller 20 daglige kontoropgaver og bedømmer hvert svar som bestået eller dumpet efter skriftlige kontrolpunkter. I oktober 2026-udgaven lå Qwen3.8 Flash, Kimi K3 og Gemini 3.1 Pro (preview) på delt førsteplads med 95%, og gpt-oss-120b havde de billigste beståede forsøg til $0.422 pr. tusind. Alle opgaver, kontroller og resultater er offentliggjort.
Resultater
Hvad oktober 2026-udgaven viser, og hvor sikre resultaterne er.
Qwen3.8 Flash, Kimi K3 og Gemini 3.1 Pro (preview) bestod hver 95% af deres gennemførsler, den højeste succesrate i denne udgave.
Konfidensintervallerne på 95 % for 6 flere modeller når op til den succesrate. Med 20 gennemførsler pr. model kan de ikke skelnes fra topmodellen. Bjælkerne på ranglisten viser, hvor meget hvert resultat kan svinge.
Tusind beståede opgaver koster fra $0.422 til $33.11, en forskel på 78×.
gpt-oss-120b havde de billigste beståede opgaver, og Claude Fable 5.1 de dyreste. Når en model ofte fejler, tæller det med i prisen, fordi alle dens gennemførsler indgår i beregningen.
Svar offentligt på en negativ restaurantanmeldelse uden at afsløre private oplysninger var den sværeste opgave: 22% af gennemførslerne bestod.
En opgave på engelsk i kategorien svar på anmeldelser. På opgavens side kan du se faldgruberne og de kontrolpunkter, som de fleste modeller ikke bestod.
Opgaver på italiensk bestod i 83% af gennemførslerne mod 65% for opgaver på engelsk.
De italienske opgaver er selvstændige opgaver, skrevet til italienske virksomheder med italienske skatte- og mærkningsregler, ikke oversættelser af de engelske. Forskellen skyldes både sprog og sværhedsgrad.
Medianen for svartid gik fra 1.2 s hos Gemini 3.5 Flash-Lite til 43 s hos Qwen3.8 Max.
Målt fra forespørgslen blev sendt, til sidste ord i svaret, uden mislykkede kald. Kolonnen p90 viser, hvor længe en kunde kan komme til at vente på de langsomste svar.
Ranglisten
Alle modeller på alle opgaver, sorteret efter hvor ofte deres svar bestod. Sortér efter pris for at se, hvad et bestået svar koster, eller efter hastighed for at se, hvem der svarer først.
Højeste succesrate først.
| # | Model | Andel beståede | Pr. 1.000 beståede opgaver | Median | p90 | Engelsk | Italiensk |
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.8 FlashAlibaba (Qwen) | 95 % konfidensinterval: 76 til 99 % | $1.09 | 29 s | 44 s | 92% | 100% |
| 1 | Kimi K3Moonshot AI · åbne modelvægte | 95 % konfidensinterval: 76 til 99 % | $18.44 | 15 s | 78 s | 100% | 86% |
| 1 | Gemini 3.1 Pro (preview)Google | 95 % konfidensinterval: 76 til 99 % | $29.67 | 17 s | 21 s | 92% | 100% |
| 4 | GLM-5.3-FlashZ.ai · åbne modelvægte | 95 % konfidensinterval: 70 til 97 % | $0.831 | 15 s | 31 s | 92% | 86% |
| 4 | DeepSeek V4.1 FlashDeepSeek · åbne modelvægte | 95 % konfidensinterval: 70 til 97 % | $1.05 | 14 s | 127 s | 85% | 100% |
| 4 | DeepSeek V4 ProDeepSeek · åbne modelvægte | 95 % konfidensinterval: 70 til 97 % | $5.14 | 21 s | 49 s | 85% | 100% |
| 4 | GLM-5.3Z.ai · åbne modelvægte | 95 % konfidensinterval: 70 til 97 % | $7.02 | 9.2 s | 31 s | 92% | 86% |
| 4 | Gemini 3.8 FlashGoogle | 95 % konfidensinterval: 70 til 97 % | $7.17 | 11 s | 16 s | 85% | 100% |
| 4 | Grok 4.7xAI | 95 % konfidensinterval: 70 til 97 % | $9.41 | 17 s | 27 s | 92% | 86% |
| 10 | Qwen3.7 PlusAlibaba (Qwen) | 95 % konfidensinterval: 64 til 95 % | $3.58 | 29 s | 41 s | 77% | 100% |
| 10 | Claude Sonnet 5Anthropic | 95 % konfidensinterval: 64 til 95 % | $6.70* | 25 s | 51 s | 77% | 100% |
| 10 | GPT-5.6 SolOpenAI | 95 % konfidensinterval: 64 til 95 % | $11.33* | 27 s | 37 s | 77% | 100% |
| 10 | Qwen3.8 MaxAlibaba (Qwen) | 95 % konfidensinterval: 64 til 95 % | $16.32 | 43 s | 82 s | 77% | 100% |
| 10 | Claude Opus 5Anthropic | 95 % konfidensinterval: 64 til 95 % | $16.89* | 27 s | 83 s | 77% | 100% |
| 10 | GPT-5.5OpenAI | 95 % konfidensinterval: 64 til 95 % | $17.02* | 22 s | 34 s | 77% | 100% |
| 10 | GPT-6 AstraOpenAI | 95 % konfidensinterval: 64 til 95 % | $27.91* | 11 s | 38 s | 77% | 100% |
| 10 | Claude Fable 5.1Anthropic | 95 % konfidensinterval: 64 til 95 % | $33.11* | 26 s | 51 s | 77% | 100% |
| 18 | GPT-5.6 LunaOpenAI | 95 % konfidensinterval: 58 til 92 % | $0.677* | 28 s | 34 s | 69% | 100% |
| 18 | Muse Glimmer 30BMeta · åbne modelvægte | 95 % konfidensinterval: 58 til 92 % | $3.10 | 13 s | 27 s | 69% | 100% |
| 18 | Grok 4.3xAI | 95 % konfidensinterval: 58 til 92 % | $4.10 | 7.4 s | 9.7 s | 77% | 86% |
| 18 | GPT-5.6 TerraOpenAI | 95 % konfidensinterval: 58 til 92 % | $6.68* | 29 s | 36 s | 69% | 100% |
| 18 | Qwen3.8 27BAlibaba (Qwen) · åbne modelvægte | 95 % konfidensinterval: 58 til 92 % | $7.30 | 43 s | 89 s | 77% | 86% |
| 23 | gpt-oss-120bOpenAI · åbne modelvægte | 95 % konfidensinterval: 53 til 89 % | $0.422 | 33 s | 69 s | 77% | 71% |
| 23 | MiniMax M3MiniMax · åbne modelvægte | 95 % konfidensinterval: 53 til 89 % | $1.82 | 6.4 s | 45 s | 77% | 71% |
| 23 | Claude Sonnet 4.6Anthropic | 95 % konfidensinterval: 53 til 89 % | $11.24* | 28 s | 54 s | 62% | 100% |
| 23 | Kimi K2.6Moonshot AI · åbne modelvægte | 95 % konfidensinterval: 53 til 89 % | $11.68 | 28 s | 73 s | 69% | 86% |
| 27 | Gemma 4 31BGoogle · åbne modelvægte | 95 % konfidensinterval: 39 til 78 % | $0.558 | 11 s | 36 s | 46% | 86% |
| 28 | Llama 4 MaverickMeta · åbne modelvægte | 95 % konfidensinterval: 26 til 66 % | $0.665 | 14 s | 21 s | 38% | 57% |
| 28 | Gemini 3.1 Flash-LiteGoogle | 95 % konfidensinterval: 26 til 66 % | $1.41 | 1.7 s | 3.2 s | 38% | 57% |
| 30 | GPT-5.4 miniOpenAI | 95 % konfidensinterval: 22 til 61 % | $3.35 | 1.7 s | 2.3 s | 23% | 71% |
| 30 | Mistral Medium 3.5Mistral · åbne modelvægte | 95 % konfidensinterval: 22 til 61 % | $7.40 | 1.6 s | 2.3 s | 38% | 43% |
| 32 | Gemini 3.5 Flash-LiteGoogle | 95 % konfidensinterval: 18 til 57 % | $2.47 | 1.2 s | 1.5 s | 23% | 57% |
| 32 | Claude Haiku 4.5Anthropic | 95 % konfidensinterval: 18 til 57 % | $6.62 | 2.5 s | 3.4 s | 23% | 57% |
| 34 | GPT-5.4 nanoOpenAI | 95 % konfidensinterval: 15 til 52 % | $1.51 | 2.7 s | 3.8 s | 23% | 43% |
| 35 | Ministral 3 14BMistral · åbne modelvægte | 95 % konfidensinterval: 8 til 42 % | $1.07 | 3.9 s | 5.4 s | 8% | 43% |
| 35 | Mistral Small 4Mistral · åbne modelvægte | 95 % konfidensinterval: 8 til 42 % | $1.33 | 2.0 s | 20 s | 15% | 29% |
Succesraten er andelen af gennemførsler, der bestod. Intervallet på 95 % vises under tallet: En models faktiske succesrate kan ligge hvor som helst på bjælken. Prisen pr. bestået opgave beregnes ved at dele prisen for alle gennemførsler, også de mislykkede, med antallet af beståede. En stjerne betyder, at prisen er beregnet ud fra udbyderens listepris, fordi udbyderen ikke oplyste en pris.
Efter opgavetype
Andelen af beståede gennemløb for hver opgavetype på tværs af alle modeller, og de modeller, der bestod den oftest.
| Opgavetype | Opgaver | Beståede gennemløb | Bestod oftest |
|---|---|---|---|
| Fordeling af henvendelser | 2 | 96% | 33 modeller med 100% |
| Udtræk af fakturadata | 2 | 90% | 29 modeller med 100% |
| Sortering af e-mails | 1 | 83% | 30 modeller med 100% |
| Mødereferater | 1 | 83% | 30 modeller med 100% |
| Beregninger for virksomheder | 2 | 76% | 19 modeller med 100% |
| Kvalificering af leads | 1 | 72% | 26 modeller med 100% |
| Bogføring | 2 | 71% | 24 modeller med 100% |
| Tidsbestilling | 2 | 69% | 21 modeller med 100% |
| Spørgsmål om politikker | 1 | 69% | 25 modeller med 100% |
| Kundesupport | 2 | 67% | 17 modeller med 100% |
| Produktbeskrivelser | 1 | 58% | 21 modeller med 100% |
| Tilbud | 2 | 51% | 9 modeller med 100% |
| Svar på anmeldelser | 1 | 22% | 8 modeller med 100% |
Opgaverne
De sværeste først. På hver side kan du se opgaven, som modellerne fik den, dens faldgruber, alle kontrolpunkter forklaret med ord, og hvad hver model gjorde forkert.
Efter virksomhedstype
De opgaver, som en bestemt virksomhedstype ville give til AI, side om side med hver models resultat på hver opgave.
- Bedste AI-model til revisionsfirmaer
- 6 opgaver: kategorisering af et italiensk kontoudtog, kategorisering af banktransaktioner, udtræk af fakturadata, udtræk af data fra italienske leverandørfakturaer, beregning af italienske fakturaer fra selvstændige og beregning af overtidsbetaling.
- Bedste AI-model til restauranter og barer
- 4 opgaver: svar på negative anmeldelser, visitering af en virksomheds indbakke, kategorisering af banktransaktioner og kategorisering af et italiensk kontoudtog.
- Bedste AI-model til butikker
- 4 opgaver: besvarelse af anmodninger om refusion, besvarelse af reklamationer på italiensk, skrivning af italienske produktbeskrivelser og skrivning af mødereferater.
- Bedste AI-model til håndværks- og servicevirksomheder
- 6 opgaver: prisberegning af en opgave ud fra en prisliste, skrivning af tilbudsmails, scoring af salgsleads, visitering af kundebeskeder, beregning af overtidsbetaling og besvarelse af spørgsmål om personalehåndbogen.
Sådan bedømmes svarene
Alle modeller får samme instruktioner og materiale. Hvert gennemløb giver ét svar, som bedømmes uden hensyn til, hvor overbevisende det lyder.
- Bestået eller dumpet
- Et svar består kun, hvis det opfylder alle faste kontrolpunkter. På opgaver, der også har et vurderingsskema, skal det desuden opfylde de fleste kriterier, herunder alle de vigtigste. Der gives ikke delvis godkendelse.
- Faste kontrolpunkter
- Strukturerede svar gennemgås felt for felt og sammenholdes med de korrekte værdier, med en tolerance for beløb og timer. Skriftlige svar kontrolleres for, hvad de skal sige, hvad de ikke må sige, og hvor lange de må være. Den samme kode bedømmer alle modeller.
- Bedømmelse efter vurderingsskema
- Kriterierne i vurderingsskemaet bedømmes af gpt-5-6-sol med temperaturen sat til nul, hvert med en begrundelse. Hvert svar bedømmes to gange, og en tredje bedømmelse afgør de kriterier, hvor de to første er uenige. Modellens egen konklusion ignoreres: Koden anvender beståelsesreglen på de bedømte kriterier. Inden gennemløbet blev modellen testet to gange på svar med et kendt resultat.
- Én protokol
- Hvert gennemløb består af én instruktionsbesked og én besked med materialet: ingen værktøjer, ingen websøgning, ingen JSON-tilstand, hver models standardindstillinger for sampling og op til 4,000 outputtokens inklusive ræsonnement. Et svar, der afbrydes ved grænsen, bedømmes, som det foreligger. 1 gennemløb pr. model på hver opgave.
- Gennemgåede regler
- Før en udgave offentliggøres, gennemgås hvert svar, der dumper på en afgørende regel. Hvis en regel dumper et korrekt svar, fordi det udelader en detalje, som instruktionerne aldrig bad om, rettes reglen, og svarene bedømmes igen. En regel, der fanger en reel fejl, beholdes, uanset hvor mange modeller der dumper på den.
- Pris og tid
- Prisen for et gennemløb er det beløb, udbyderen opkrævede, eller, hvis udbyderen ikke oplyser en pris, antallet af tokens til producentens listepris. Tiden måles fra forespørgslen til det sidste ord i svaret. Mislykkede kald tælles ikke med.
- Intervaller
- Hver andel beståede svar vises med et Wilson-interval på 95 %. Med nogle få dusin gennemløb pr. model kan en forskel på flere procentpoint mellem to modeller skyldes tilfældigheder, og det viser intervallerne.
- Dataene
- Opgaver, kontrolpunkter og resultater er offentliggjort under CC BY 4.0: Angiv AIGROW som kilde, og link til denne side. Hver opgaveside indeholder udgavens kanariestreng, så opgaverne kan holdes ude af træningsdatasæt.
Sæt de modeller, der består, i arbejde
En AIGROW-agent udfører den slags arbejde i dine egne værktøjer efter regler, du godkender skriftligt. Hvis du vil køre modellerne selv, koster API-kredit en fjerdedel af listeprisen.
oktober 2026-udgaven, pilotforsøg