36 KI-modeller testet på 20 reelle oppgaver fra små bedrifter
Fakturaer, tilbud, vaktlister, svar på anmeldelser og sortering av innboksen. Hver oppgave har en felle som et uforsiktig svar går i. Hvert svar består eller stryker som helhet, og vi beregner kostnaden for hvert beståtte svar.
En pilot: 20 av utgavens 40 oppgaver, 1 kjøring per modell.
- Modeller
- 36
- Oppgaver
- 20 av 40
- Gjennomføringer
- 720
- Vurdering etter kriterier
- Kalibrert
Kjørt i oktober 2026. Data under CC BY 4.0.
AIGROWs referansetest for små bedrifter gir 36 KI-modeller 20 vanlige kontoroppgaver og vurderer hvert svar som bestått eller ikke bestått etter skriftlige kontrollpunkter. I oktober 2026-utgaven delte Qwen3.8 Flash, Kimi K3 og Gemini 3.1 Pro (preview) førsteplassen med 95%, mens gpt-oss-120b hadde lavest pris per tusen beståtte kjøringer: $0.422. Hver oppgave, kontroll og hvert resultat er publisert.
Funn
Hva oktober 2026-utgaven viser, og hvor sikre funnene er.
Qwen3.8 Flash, Kimi K3 og Gemini 3.1 Pro (preview) besto hver 95% av kjøringene sine, den høyeste andelen i denne utgaven.
95 % konfidensintervallene til 6 flere modeller når opp til denne andelen. Med 20 kjøringer per modell kan de ikke skilles fra de på topp. Stolpene i resultatlisten viser hvor mye hvert resultat kan variere.
Tusen beståtte kjøringer koster fra $0.422 til $33.11, en forskjell på 78×.
gpt-oss-120b hadde de rimeligste beståtte kjøringene, og Claude Fable 5.1 de dyreste. En modell som ofte ikke består, får kostnaden for de mislykkede kjøringene med her, siden alle kjøringene inngår i beregningen.
Svar offentlig på en negativ restaurantanmeldelse uten å røpe private opplysninger var den vanskeligste oppgaven: 22% av kjøringene besto.
En oppgave på språket engelsk i kategorien svar på anmeldelser. På oppgavesiden finner du fallgruvene og kontrollpunktene de fleste modellene ikke bestod.
Oppgavene på italiensk ble bestått i 83% av kjøringene, mot 65% for oppgavene på engelsk.
De italienske oppgavene er egne oppgaver, skrevet for italienske bedrifter med italienske skatte- og merkeregler, ikke oversettelser av de engelske. Forskjellen skyldes både språk og vanskelighetsgrad.
Median svartid varierte fra 1.2 s for Gemini 3.5 Flash-Lite til 43 s for Qwen3.8 Max.
Målt fra forespørselen ble sendt til siste ord i svaret, uten mislykkede kall. p90-kolonnen viser de lengre ventetidene en kunde kan oppleve.
Resultatlisten
Alle modeller på alle oppgaver, sortert etter hvor ofte svarene besto. Sorter etter kostnad for å se hva et bestått svar koster, eller etter hastighet for å se hvem som svarer først.
Høyest beståttandel først.
| # | Modell | Andel beståtte | Per 1,000 beståtte | Median | p90 | Engelsk | Italiensk |
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.8 FlashAlibaba (Qwen) | 95 % konfidensintervall: 76 til 99 % | $1.09 | 29 s | 44 s | 92% | 100% |
| 1 | Kimi K3Moonshot AI · åpne vekter | 95 % konfidensintervall: 76 til 99 % | $18.44 | 15 s | 78 s | 100% | 86% |
| 1 | Gemini 3.1 Pro (preview)Google | 95 % konfidensintervall: 76 til 99 % | $29.67 | 17 s | 21 s | 92% | 100% |
| 4 | GLM-5.3-FlashZ.ai · åpne vekter | 95 % konfidensintervall: 70 til 97 % | $0.831 | 15 s | 31 s | 92% | 86% |
| 4 | DeepSeek V4.1 FlashDeepSeek · åpne vekter | 95 % konfidensintervall: 70 til 97 % | $1.05 | 14 s | 127 s | 85% | 100% |
| 4 | DeepSeek V4 ProDeepSeek · åpne vekter | 95 % konfidensintervall: 70 til 97 % | $5.14 | 21 s | 49 s | 85% | 100% |
| 4 | GLM-5.3Z.ai · åpne vekter | 95 % konfidensintervall: 70 til 97 % | $7.02 | 9.2 s | 31 s | 92% | 86% |
| 4 | Gemini 3.8 FlashGoogle | 95 % konfidensintervall: 70 til 97 % | $7.17 | 11 s | 16 s | 85% | 100% |
| 4 | Grok 4.7xAI | 95 % konfidensintervall: 70 til 97 % | $9.41 | 17 s | 27 s | 92% | 86% |
| 10 | Qwen3.7 PlusAlibaba (Qwen) | 95 % konfidensintervall: 64 til 95 % | $3.58 | 29 s | 41 s | 77% | 100% |
| 10 | Claude Sonnet 5Anthropic | 95 % konfidensintervall: 64 til 95 % | $6.70* | 25 s | 51 s | 77% | 100% |
| 10 | GPT-5.6 SolOpenAI | 95 % konfidensintervall: 64 til 95 % | $11.33* | 27 s | 37 s | 77% | 100% |
| 10 | Qwen3.8 MaxAlibaba (Qwen) | 95 % konfidensintervall: 64 til 95 % | $16.32 | 43 s | 82 s | 77% | 100% |
| 10 | Claude Opus 5Anthropic | 95 % konfidensintervall: 64 til 95 % | $16.89* | 27 s | 83 s | 77% | 100% |
| 10 | GPT-5.5OpenAI | 95 % konfidensintervall: 64 til 95 % | $17.02* | 22 s | 34 s | 77% | 100% |
| 10 | GPT-6 AstraOpenAI | 95 % konfidensintervall: 64 til 95 % | $27.91* | 11 s | 38 s | 77% | 100% |
| 10 | Claude Fable 5.1Anthropic | 95 % konfidensintervall: 64 til 95 % | $33.11* | 26 s | 51 s | 77% | 100% |
| 18 | GPT-5.6 LunaOpenAI | 95 % konfidensintervall: 58 til 92 % | $0.677* | 28 s | 34 s | 69% | 100% |
| 18 | Muse Glimmer 30BMeta · åpne vekter | 95 % konfidensintervall: 58 til 92 % | $3.10 | 13 s | 27 s | 69% | 100% |
| 18 | Grok 4.3xAI | 95 % konfidensintervall: 58 til 92 % | $4.10 | 7.4 s | 9.7 s | 77% | 86% |
| 18 | GPT-5.6 TerraOpenAI | 95 % konfidensintervall: 58 til 92 % | $6.68* | 29 s | 36 s | 69% | 100% |
| 18 | Qwen3.8 27BAlibaba (Qwen) · åpne vekter | 95 % konfidensintervall: 58 til 92 % | $7.30 | 43 s | 89 s | 77% | 86% |
| 23 | gpt-oss-120bOpenAI · åpne vekter | 95 % konfidensintervall: 53 til 89 % | $0.422 | 33 s | 69 s | 77% | 71% |
| 23 | MiniMax M3MiniMax · åpne vekter | 95 % konfidensintervall: 53 til 89 % | $1.82 | 6.4 s | 45 s | 77% | 71% |
| 23 | Claude Sonnet 4.6Anthropic | 95 % konfidensintervall: 53 til 89 % | $11.24* | 28 s | 54 s | 62% | 100% |
| 23 | Kimi K2.6Moonshot AI · åpne vekter | 95 % konfidensintervall: 53 til 89 % | $11.68 | 28 s | 73 s | 69% | 86% |
| 27 | Gemma 4 31BGoogle · åpne vekter | 95 % konfidensintervall: 39 til 78 % | $0.558 | 11 s | 36 s | 46% | 86% |
| 28 | Llama 4 MaverickMeta · åpne vekter | 95 % konfidensintervall: 26 til 66 % | $0.665 | 14 s | 21 s | 38% | 57% |
| 28 | Gemini 3.1 Flash-LiteGoogle | 95 % konfidensintervall: 26 til 66 % | $1.41 | 1.7 s | 3.2 s | 38% | 57% |
| 30 | GPT-5.4 miniOpenAI | 95 % konfidensintervall: 22 til 61 % | $3.35 | 1.7 s | 2.3 s | 23% | 71% |
| 30 | Mistral Medium 3.5Mistral · åpne vekter | 95 % konfidensintervall: 22 til 61 % | $7.40 | 1.6 s | 2.3 s | 38% | 43% |
| 32 | Gemini 3.5 Flash-LiteGoogle | 95 % konfidensintervall: 18 til 57 % | $2.47 | 1.2 s | 1.5 s | 23% | 57% |
| 32 | Claude Haiku 4.5Anthropic | 95 % konfidensintervall: 18 til 57 % | $6.62 | 2.5 s | 3.4 s | 23% | 57% |
| 34 | GPT-5.4 nanoOpenAI | 95 % konfidensintervall: 15 til 52 % | $1.51 | 2.7 s | 3.8 s | 23% | 43% |
| 35 | Ministral 3 14BMistral · åpne vekter | 95 % konfidensintervall: 8 til 42 % | $1.07 | 3.9 s | 5.4 s | 8% | 43% |
| 35 | Mistral Small 4Mistral · åpne vekter | 95 % konfidensintervall: 8 til 42 % | $1.33 | 2.0 s | 20 s | 15% | 29% |
Beståttandelen er andelen kjøringer som besto, med et 95 % konfidensintervall vist under: Modellens faktiske beståttandel kan ligge hvor som helst på stolpen. Kostnad per beståtte kjøring er kostnaden for alle kjøringer, også de som ikke besto, delt på antallet som besto. En stjerne markerer en kostnad beregnet ut fra produsentens listepris når leverandøren ikke oppga noen kostnad.
Etter type arbeid
Andelen kjøringer som besto for hver oppgavetype, på tvers av alle modeller, og hvilke modeller som besto oftest.
| Oppgavetype | Oppgaver | Beståtte kjøringer | Bestod oftest |
|---|---|---|---|
| Fordeling av forespørsler | 2 | 96% | 33 modeller med 100% |
| Uthenting av fakturadata | 2 | 90% | 29 modeller med 100% |
| Sortering av e-post | 1 | 83% | 30 modeller med 100% |
| Møtereferater | 1 | 83% | 30 modeller med 100% |
| Bedriftsberegninger | 2 | 76% | 19 modeller med 100% |
| Kvalifisering av leads | 1 | 72% | 26 modeller med 100% |
| Regnskapsføring | 2 | 71% | 24 modeller med 100% |
| Timebestilling | 2 | 69% | 21 modeller med 100% |
| Spørsmål om retningslinjer | 1 | 69% | 25 modeller med 100% |
| Kundestøtte | 2 | 67% | 17 modeller med 100% |
| Produktbeskrivelser | 1 | 58% | 21 modeller med 100% |
| Tilbud | 2 | 51% | 9 modeller med 100% |
| Svar på anmeldelser | 1 | 22% | 8 modeller med 100% |
Oppgavene
De vanskeligste først. Hver side viser oppgaven slik modellene fikk den, fellene den inneholder, alle kontrollene forklart med ord og hva hver modell gjorde feil.
Etter type virksomhet
Oppgavene én type virksomhet ville gitt til KI, vist side om side med resultatet fra hver modell på hver oppgave.
- Beste KI-modell for regnskapsbyråer
- 6 oppgaver: kategorisering av en italiensk kontoutskrift, kategorisering av banktransaksjoner, uthenting av fakturadata, uthenting av data fra italienske leverandørfakturaer, beregning av italienske fakturaer for selvstendig næringsdrivende og beregning av overtidsbetaling.
- Beste KI-modell for restauranter og barer
- 4 oppgaver: svar på negative anmeldelser, sortering av e-post i en bedrifts innboks, kategorisering av banktransaksjoner og kategorisering av en italiensk kontoutskrift.
- Beste KI-modell for butikker
- 4 oppgaver: svar på refusjonsforespørsler, svar på garantikrav på italiensk, skriving av italienske produktbeskrivelser og skriving av møtereferater.
- Beste KI-modell for håndverksbedrifter og tjenesteytere
- 6 oppgaver: prissetting av et oppdrag ut fra en prisliste, skriving av tilbud på e-post, scoring av salgsleads, sortering av kundemeldinger, beregning av overtidsbetaling og svar på spørsmål om personalhåndboken.
Slik vurderes svarene
Alle modellene får de samme instruksjonene og det samme materialet. Hver kjøring gir ett svar, og vurderingen avhenger ikke av hvor godt svaret høres ut.
- Bestått eller ikke bestått
- Et svar består bare hvis det består alle faste kontroller. På oppgaver som også har vurderingskriterier, må svaret oppfylle de fleste av dem, og de viktigste kriteriene er obligatoriske. Det gis ikke delvis uttelling.
- Faste kontroller
- Strukturerte svar kontrolleres felt for felt mot riktige verdier, med en feilmargin for beløp og timer. Skriftlige svar kontrolleres for hva de må si, hva de ikke må si, og hvor lange de kan være. Den samme koden vurderer alle modellene.
- Vurdering etter kriterier
- gpt-5-6-sol vurderer hvert kriterium ved temperatur null og begrunner vurderingen. Hvert svar vurderes to ganger, og en tredje vurdering avgjør kriterier der de to første er uenige. Modellens egen konklusjon ignoreres: Koden bruker beståttregelen på kriteriene modellen har vurdert. Før kjøringen ble den testet to ganger på svar med kjent resultat.
- Én protokoll
- Hver kjøring består av én melding med instruksjoner og én med materialet: ingen verktøy, ingen nettsøk, ingen JSON-modus, hver modells standardinnstillinger for sampling og opptil 4,000 tokens i svaret, inkludert resonnering. Et svar som kuttes ved denne grensen, vurderes slik det foreligger. 1 kjøring per modell på hver oppgave.
- Gjennomgåtte regler
- Før en utgave publiseres, gjennomgår vi alle svar som stryker på en avgjørende regel. Hvis en regel stryker et riktig svar fordi det mangler en detalj instruksjonene aldri ba om, retter vi regelen og vurderer svarene på nytt. En regel som fanger opp en reell feil, beholdes uansett hvor mange modeller som stryker på den.
- Kostnad og tid
- Kostnaden for en kjøring er det leverandøren fakturerte, eller, hvis leverandøren ikke oppgir noen kostnad, antall tokens beregnet etter produsentens listepris. Tiden måles fra forespørselen sendes til siste ord i svaret. Mislykkede kall er utelatt.
- Intervaller
- Hver andel beståtte har et Wilson-intervall på 95 %. Med noen titalls kjøringer per modell kan en forskjell på flere prosentpoeng mellom to modeller skyldes tilfeldigheter. Stolpene viser denne usikkerheten.
- Dataene
- Oppgaver, kontroller og resultater er publisert under CC BY 4.0: oppgi AIGROW som kilde og lenk til denne siden. Hver oppgaveside inneholder utgavens kanaristreng, slik at oppgavene kan holdes utenfor treningsdatasett.
La modellene som består, gjøre jobben
En AIGROW-agent gjør denne typen arbeid i dine egne verktøy, etter regler du har godkjent skriftlig. Vil du kjøre modellene selv, koster API-kreditt en fjerdedel av listeprisen.
oktober 2026-utgaven, pilot