Hurtige svar

AIGrow tilbyder overvågning af AI-synlighed, en virksomhedsassistent, blogudgivelse og afgrænsede automatiseringstjenester. Start med den gratis scanning for at se resultatet, før du betaler.

Kør den gratis scanning

Scanningen er gratis, og overvågningsplanerne starter ved $29 om måneden. Driftsauditten koster $290, synlighedsauditten koster $490, og specialbyggede løsninger får en skriftlig pris, før arbejdet begynder.

Se planerne

Kør den gratis scanning. Den læser dit website, spørger flere AI-assistenter, hvad dine kunder spørger om, og peger på én ting. Du behøver ikke at oprette dig, og den fortæller dig, hvis du ikke har brug for os.

Start nu

Ja. Brug kontaktformularen til spørgsmål om produktet, fakturering, support eller projekter. Beskriv målet og det involverede system, så det første svar kan blive konkret.

Kontakt AIGrow
Benchmark · oktober 2026-udgaven · pilotforsøg

36 AI-modeller testet på 20 virkelige opgaver fra små virksomheder

Fakturaer, tilbud, vagtplaner, svar på anmeldelser og sortering af indbakken. Hver opgave har en faldgrube, som et uopmærksomt svar falder i. Hvert svar består eller dumper som helhed, og prisen for hvert bestået svar beregnes.

En pilottest: 20 af udgavens 40 opgaver, 1 gennemløb pr. model.

Højeste andel beståede svar
95%Delt af 3 modeller, hver med 19 beståede ud af 20 gennemløb
Modeller
36
Opgaver
20 af 40
Kørsler
720
Bedømmer efter vurderingsskema
Kalibreret

Kørt i oktober 2026. Data under CC BY 4.0.

AIGROWs benchmark for små virksomheder giver 36 AI-modeller 20 daglige kontoropgaver og bedømmer hvert svar som bestået eller dumpet efter skriftlige kontrolpunkter. I oktober 2026-udgaven lå Qwen3.8 Flash, Kimi K3 og Gemini 3.1 Pro (preview) på delt førsteplads med 95%, og gpt-oss-120b havde de billigste beståede forsøg til $0.422 pr. tusind. Alle opgaver, kontroller og resultater er offentliggjort.

Resultater

Hvad oktober 2026-udgaven viser, og hvor sikre resultaterne er.

  1. Qwen3.8 Flash, Kimi K3 og Gemini 3.1 Pro (preview) bestod hver 95% af deres gennemførsler, den højeste succesrate i denne udgave.

    Konfidensintervallerne på 95 % for 6 flere modeller når op til den succesrate. Med 20 gennemførsler pr. model kan de ikke skelnes fra topmodellen. Bjælkerne på ranglisten viser, hvor meget hvert resultat kan svinge.

  2. Tusind beståede opgaver koster fra $0.422 til $33.11, en forskel på 78×.

    gpt-oss-120b havde de billigste beståede opgaver, og Claude Fable 5.1 de dyreste. Når en model ofte fejler, tæller det med i prisen, fordi alle dens gennemførsler indgår i beregningen.

  3. Svar offentligt på en negativ restaurantanmeldelse uden at afsløre private oplysninger var den sværeste opgave: 22% af gennemførslerne bestod.

    En opgave på engelsk i kategorien svar på anmeldelser. På opgavens side kan du se faldgruberne og de kontrolpunkter, som de fleste modeller ikke bestod.

  4. Opgaver på italiensk bestod i 83% af gennemførslerne mod 65% for opgaver på engelsk.

    De italienske opgaver er selvstændige opgaver, skrevet til italienske virksomheder med italienske skatte- og mærkningsregler, ikke oversættelser af de engelske. Forskellen skyldes både sprog og sværhedsgrad.

  5. Medianen for svartid gik fra 1.2 s hos Gemini 3.5 Flash-Lite til 43 s hos Qwen3.8 Max.

    Målt fra forespørgslen blev sendt, til sidste ord i svaret, uden mislykkede kald. Kolonnen p90 viser, hvor længe en kunde kan komme til at vente på de langsomste svar.

Ranglisten

Alle modeller på alle opgaver, sorteret efter hvor ofte deres svar bestod. Sortér efter pris for at se, hvad et bestået svar koster, eller efter hastighed for at se, hvem der svarer først.

Højeste succesrate først.

Succesrate, pris pr. tusind beståede opgaver og svartid for 36 AI-modeller
#ModelAndel beståedePr. 1.000 beståede opgaverMedianp90EngelskItaliensk
1Qwen3.8 FlashAlibaba (Qwen)95%95 % konfidensinterval: 76 til 99 %$1.0929 s44 s92%100%
1Kimi K3Moonshot AI · åbne modelvægte95%95 % konfidensinterval: 76 til 99 %$18.4415 s78 s100%86%
1Gemini 3.1 Pro (preview)Google95%95 % konfidensinterval: 76 til 99 %$29.6717 s21 s92%100%
4GLM-5.3-FlashZ.ai · åbne modelvægte90%95 % konfidensinterval: 70 til 97 %$0.83115 s31 s92%86%
4DeepSeek V4.1 FlashDeepSeek · åbne modelvægte90%95 % konfidensinterval: 70 til 97 %$1.0514 s127 s85%100%
4DeepSeek V4 ProDeepSeek · åbne modelvægte90%95 % konfidensinterval: 70 til 97 %$5.1421 s49 s85%100%
4GLM-5.3Z.ai · åbne modelvægte90%95 % konfidensinterval: 70 til 97 %$7.029.2 s31 s92%86%
4Gemini 3.8 FlashGoogle90%95 % konfidensinterval: 70 til 97 %$7.1711 s16 s85%100%
4Grok 4.7xAI90%95 % konfidensinterval: 70 til 97 %$9.4117 s27 s92%86%
10Qwen3.7 PlusAlibaba (Qwen)85%95 % konfidensinterval: 64 til 95 %$3.5829 s41 s77%100%
10Claude Sonnet 5Anthropic85%95 % konfidensinterval: 64 til 95 %$6.70*25 s51 s77%100%
10GPT-5.6 SolOpenAI85%95 % konfidensinterval: 64 til 95 %$11.33*27 s37 s77%100%
10Qwen3.8 MaxAlibaba (Qwen)85%95 % konfidensinterval: 64 til 95 %$16.3243 s82 s77%100%
10Claude Opus 5Anthropic85%95 % konfidensinterval: 64 til 95 %$16.89*27 s83 s77%100%
10GPT-5.5OpenAI85%95 % konfidensinterval: 64 til 95 %$17.02*22 s34 s77%100%
10GPT-6 AstraOpenAI85%95 % konfidensinterval: 64 til 95 %$27.91*11 s38 s77%100%
10Claude Fable 5.1Anthropic85%95 % konfidensinterval: 64 til 95 %$33.11*26 s51 s77%100%
18GPT-5.6 LunaOpenAI80%95 % konfidensinterval: 58 til 92 %$0.677*28 s34 s69%100%
18Muse Glimmer 30BMeta · åbne modelvægte80%95 % konfidensinterval: 58 til 92 %$3.1013 s27 s69%100%
18Grok 4.3xAI80%95 % konfidensinterval: 58 til 92 %$4.107.4 s9.7 s77%86%
18GPT-5.6 TerraOpenAI80%95 % konfidensinterval: 58 til 92 %$6.68*29 s36 s69%100%
18Qwen3.8 27BAlibaba (Qwen) · åbne modelvægte80%95 % konfidensinterval: 58 til 92 %$7.3043 s89 s77%86%
23gpt-oss-120bOpenAI · åbne modelvægte75%95 % konfidensinterval: 53 til 89 %$0.42233 s69 s77%71%
23MiniMax M3MiniMax · åbne modelvægte75%95 % konfidensinterval: 53 til 89 %$1.826.4 s45 s77%71%
23Claude Sonnet 4.6Anthropic75%95 % konfidensinterval: 53 til 89 %$11.24*28 s54 s62%100%
23Kimi K2.6Moonshot AI · åbne modelvægte75%95 % konfidensinterval: 53 til 89 %$11.6828 s73 s69%86%
27Gemma 4 31BGoogle · åbne modelvægte60%95 % konfidensinterval: 39 til 78 %$0.55811 s36 s46%86%
28Llama 4 MaverickMeta · åbne modelvægte45%95 % konfidensinterval: 26 til 66 %$0.66514 s21 s38%57%
28Gemini 3.1 Flash-LiteGoogle45%95 % konfidensinterval: 26 til 66 %$1.411.7 s3.2 s38%57%
30GPT-5.4 miniOpenAI40%95 % konfidensinterval: 22 til 61 %$3.351.7 s2.3 s23%71%
30Mistral Medium 3.5Mistral · åbne modelvægte40%95 % konfidensinterval: 22 til 61 %$7.401.6 s2.3 s38%43%
32Gemini 3.5 Flash-LiteGoogle35%95 % konfidensinterval: 18 til 57 %$2.471.2 s1.5 s23%57%
32Claude Haiku 4.5Anthropic35%95 % konfidensinterval: 18 til 57 %$6.622.5 s3.4 s23%57%
34GPT-5.4 nanoOpenAI30%95 % konfidensinterval: 15 til 52 %$1.512.7 s3.8 s23%43%
35Ministral 3 14BMistral · åbne modelvægte20%95 % konfidensinterval: 8 til 42 %$1.073.9 s5.4 s8%43%
35Mistral Small 4Mistral · åbne modelvægte20%95 % konfidensinterval: 8 til 42 %$1.332.0 s20 s15%29%

Succesraten er andelen af gennemførsler, der bestod. Intervallet på 95 % vises under tallet: En models faktiske succesrate kan ligge hvor som helst på bjælken. Prisen pr. bestået opgave beregnes ved at dele prisen for alle gennemførsler, også de mislykkede, med antallet af beståede. En stjerne betyder, at prisen er beregnet ud fra udbyderens listepris, fordi udbyderen ikke oplyste en pris.

Efter opgavetype

Andelen af beståede gennemløb for hver opgavetype på tværs af alle modeller, og de modeller, der bestod den oftest.

Andel beståede svar efter opgavetype
OpgavetypeOpgaverBeståede gennemløbBestod oftest
Fordeling af henvendelser296%33 modeller med 100%
Udtræk af fakturadata290%29 modeller med 100%
Sortering af e-mails183%30 modeller med 100%
Mødereferater183%30 modeller med 100%
Beregninger for virksomheder276%19 modeller med 100%
Kvalificering af leads172%26 modeller med 100%
Bogføring271%24 modeller med 100%
Tidsbestilling269%21 modeller med 100%
Spørgsmål om politikker169%25 modeller med 100%
Kundesupport267%17 modeller med 100%
Produktbeskrivelser158%21 modeller med 100%
Tilbud251%9 modeller med 100%
Svar på anmeldelser122%8 modeller med 100%

Opgaverne

De sværeste først. På hver side kan du se opgaven, som modellerne fik den, dens faldgruber, alle kontrolpunkter forklaret med ord, og hvad hver model gjorde forkert.

Opgaverne, de sværeste først
OpgaveTypeSprogBeståede gennemløb
Svar offentligt på en negativ restaurantanmeldelse uden at afsløre private oplysningerSvar på anmeldelserEngelsk8 af 36
Skriv en e-mail med et tilbud på haveanlæg, der håndterer en anmodning om moms og et fredet træTilbudEngelsk16 af 36
Svar en kunde, der beder om refusion efter fristen for refusionKundesupportEngelsk17 af 36
Beregn en rengøringsmedarbejders ugentlige bruttoløn med pauser, overarbejde og søndagstillægBeregninger for virksomhederEngelsk19 af 36
Skriv en italiensk produktbeskrivelse af en olivenolie, der overholder mærkningsreglerneProduktbeskrivelserItaliensk21 af 36
Beregn prisen på en maleropgave ud fra opmålingsrapporten og prislistenTilbudEngelsk21 af 36
Planlæg et opkald mellem London og New York i ugen, hvor tidsforskellen er anderledesTidsbestillingEngelsk23 af 36
Kategorisér en cafés månedlige kontoudtog, og opgør dens driftsomkostningerBogføringEngelsk24 af 36
Besvar en deltidsansats spørgsmål om fravær ud fra personalehåndbogenSpørgsmål om politikkerEngelsk25 af 36
Giv fem indgående leads til rengøringsopgaver point efter salgsteamets reglerKvalificering af leadsEngelsk26 af 36
Kategorisér posteringerne på en italiensk bars kontoudtog, og opgør de samlede ind- og udbetalingerBogføringItaliensk27 af 36
Find en tid til tandrensning omkring en helligdag, på italienskTidsbestillingItaliensk27 af 36
Omsæt et teammøde i et bageri til beslutninger, ansvarlige og deadlinesMødereferaterEngelsk30 af 36
Prioritér mandagens indbakke hos et cateringfirma, herunder en phishingmail og en anmodning om ændring af bankoplysningerSortering af e-mailsEngelsk30 af 36
Udtræk oplysninger fra en italiensk leverandørfaktura med en udgiftslinje, der ikke indgår i momsgrundlagetUdtræk af fakturadataItaliensk31 af 36
Svar på italiensk en kunde, der fejlagtigt tror, at hendes garanti er udløbetKundesupportItaliensk31 af 36
Send ti beskeder fra lejere videre til det rette team med den rette prioritetFordeling af henvendelserEngelsk33 af 36
Udtræk oplysninger fra en leverandørfaktura på to sider til kreditorbogholderietUdtræk af fakturadataEngelsk34 af 36
Beregn to italienske fakturaer fra en selvstændig med pensionsbidrag, IVA og kildeskatBeregninger for virksomhederItaliensk36 af 36
Fordel hotelgæsters beskeder til den rette afdeling på italienskFordeling af henvendelserItaliensk36 af 36

Efter virksomhedstype

De opgaver, som en bestemt virksomhedstype ville give til AI, side om side med hver models resultat på hver opgave.

Bedste AI-model til revisionsfirmaer
6 opgaver: kategorisering af et italiensk kontoudtog, kategorisering af banktransaktioner, udtræk af fakturadata, udtræk af data fra italienske leverandørfakturaer, beregning af italienske fakturaer fra selvstændige og beregning af overtidsbetaling.
Bedste AI-model til restauranter og barer
4 opgaver: svar på negative anmeldelser, visitering af en virksomheds indbakke, kategorisering af banktransaktioner og kategorisering af et italiensk kontoudtog.
Bedste AI-model til butikker
4 opgaver: besvarelse af anmodninger om refusion, besvarelse af reklamationer på italiensk, skrivning af italienske produktbeskrivelser og skrivning af mødereferater.
Bedste AI-model til håndværks- og servicevirksomheder
6 opgaver: prisberegning af en opgave ud fra en prisliste, skrivning af tilbudsmails, scoring af salgsleads, visitering af kundebeskeder, beregning af overtidsbetaling og besvarelse af spørgsmål om personalehåndbogen.

Sådan bedømmes svarene

Alle modeller får samme instruktioner og materiale. Hvert gennemløb giver ét svar, som bedømmes uden hensyn til, hvor overbevisende det lyder.

Bestået eller dumpet
Et svar består kun, hvis det opfylder alle faste kontrolpunkter. På opgaver, der også har et vurderingsskema, skal det desuden opfylde de fleste kriterier, herunder alle de vigtigste. Der gives ikke delvis godkendelse.
Faste kontrolpunkter
Strukturerede svar gennemgås felt for felt og sammenholdes med de korrekte værdier, med en tolerance for beløb og timer. Skriftlige svar kontrolleres for, hvad de skal sige, hvad de ikke må sige, og hvor lange de må være. Den samme kode bedømmer alle modeller.
Bedømmelse efter vurderingsskema
Kriterierne i vurderingsskemaet bedømmes af gpt-5-6-sol med temperaturen sat til nul, hvert med en begrundelse. Hvert svar bedømmes to gange, og en tredje bedømmelse afgør de kriterier, hvor de to første er uenige. Modellens egen konklusion ignoreres: Koden anvender beståelsesreglen på de bedømte kriterier. Inden gennemløbet blev modellen testet to gange på svar med et kendt resultat.
Én protokol
Hvert gennemløb består af én instruktionsbesked og én besked med materialet: ingen værktøjer, ingen websøgning, ingen JSON-tilstand, hver models standardindstillinger for sampling og op til 4,000 outputtokens inklusive ræsonnement. Et svar, der afbrydes ved grænsen, bedømmes, som det foreligger. 1 gennemløb pr. model på hver opgave.
Gennemgåede regler
Før en udgave offentliggøres, gennemgås hvert svar, der dumper på en afgørende regel. Hvis en regel dumper et korrekt svar, fordi det udelader en detalje, som instruktionerne aldrig bad om, rettes reglen, og svarene bedømmes igen. En regel, der fanger en reel fejl, beholdes, uanset hvor mange modeller der dumper på den.
Pris og tid
Prisen for et gennemløb er det beløb, udbyderen opkrævede, eller, hvis udbyderen ikke oplyser en pris, antallet af tokens til producentens listepris. Tiden måles fra forespørgslen til det sidste ord i svaret. Mislykkede kald tælles ikke med.
Intervaller
Hver andel beståede svar vises med et Wilson-interval på 95 %. Med nogle få dusin gennemløb pr. model kan en forskel på flere procentpoint mellem to modeller skyldes tilfældigheder, og det viser intervallerne.
Dataene
Opgaver, kontrolpunkter og resultater er offentliggjort under CC BY 4.0: Angiv AIGROW som kilde, og link til denne side. Hver opgaveside indeholder udgavens kanariestreng, så opgaverne kan holdes ude af træningsdatasæt.

Sæt de modeller, der består, i arbejde

En AIGROW-agent udfører den slags arbejde i dine egne værktøjer efter regler, du godkender skriftligt. Hvis du vil køre modellerne selv, koster API-kredit en fjerdedel af listeprisen.

oktober 2026-udgaven, pilotforsøg