Raske svar

AIGrow tilbyr overvåking av synlighet i KI, en assistent for bedriften, publisering av blogginnlegg og avgrensede automatiseringstjenester. Start med den kostnadsfrie skanningen for å se resultatet før du betaler.

Kjør den kostnadsfrie skanningen

Skanningen er kostnadsfri, og overvåkingsplanene starter på $29 i måneden. Driftsanalysen koster $290, synlighetsanalysen koster $490, og for spesialtilpassede løsninger får du en skriftlig pris før arbeidet starter.

Se planene

Kjør den kostnadsfrie skanningen. Den leser nettstedet ditt, spør flere KI-assistenter hva kundene dine spør om, og peker på én ting. Du trenger ikke å registrere deg, og den forteller deg hvis du ikke trenger oss.

Start nå

Ja. Bruk kontaktskjemaet hvis du har spørsmål om produktet, fakturering, brukerstøtte eller et prosjekt. Beskriv målet og hvilket system det gjelder, slik at du får et konkret svar med en gang.

Kontakt AIGrow
Benchmark · oktober 2026-utgaven · pilot

36 KI-modeller testet på 20 reelle oppgaver fra små bedrifter

Fakturaer, tilbud, vaktlister, svar på anmeldelser og sortering av innboksen. Hver oppgave har en felle som et uforsiktig svar går i. Hvert svar består eller stryker som helhet, og vi beregner kostnaden for hvert beståtte svar.

En pilot: 20 av utgavens 40 oppgaver, 1 kjøring per modell.

Høyest andel beståtte
95%Delt av 3 modeller, med 19 av 20 beståtte kjøringer hver
Modeller
36
Oppgaver
20 av 40
Gjennomføringer
720
Vurdering etter kriterier
Kalibrert

Kjørt i oktober 2026. Data under CC BY 4.0.

AIGROWs referansetest for små bedrifter gir 36 KI-modeller 20 vanlige kontoroppgaver og vurderer hvert svar som bestått eller ikke bestått etter skriftlige kontrollpunkter. I oktober 2026-utgaven delte Qwen3.8 Flash, Kimi K3 og Gemini 3.1 Pro (preview) førsteplassen med 95%, mens gpt-oss-120b hadde lavest pris per tusen beståtte kjøringer: $0.422. Hver oppgave, kontroll og hvert resultat er publisert.

Funn

Hva oktober 2026-utgaven viser, og hvor sikre funnene er.

  1. Qwen3.8 Flash, Kimi K3 og Gemini 3.1 Pro (preview) besto hver 95% av kjøringene sine, den høyeste andelen i denne utgaven.

    95 % konfidensintervallene til 6 flere modeller når opp til denne andelen. Med 20 kjøringer per modell kan de ikke skilles fra de på topp. Stolpene i resultatlisten viser hvor mye hvert resultat kan variere.

  2. Tusen beståtte kjøringer koster fra $0.422 til $33.11, en forskjell på 78×.

    gpt-oss-120b hadde de rimeligste beståtte kjøringene, og Claude Fable 5.1 de dyreste. En modell som ofte ikke består, får kostnaden for de mislykkede kjøringene med her, siden alle kjøringene inngår i beregningen.

  3. Svar offentlig på en negativ restaurantanmeldelse uten å røpe private opplysninger var den vanskeligste oppgaven: 22% av kjøringene besto.

    En oppgave på språket engelsk i kategorien svar på anmeldelser. På oppgavesiden finner du fallgruvene og kontrollpunktene de fleste modellene ikke bestod.

  4. Oppgavene på italiensk ble bestått i 83% av kjøringene, mot 65% for oppgavene på engelsk.

    De italienske oppgavene er egne oppgaver, skrevet for italienske bedrifter med italienske skatte- og merkeregler, ikke oversettelser av de engelske. Forskjellen skyldes både språk og vanskelighetsgrad.

  5. Median svartid varierte fra 1.2 s for Gemini 3.5 Flash-Lite til 43 s for Qwen3.8 Max.

    Målt fra forespørselen ble sendt til siste ord i svaret, uten mislykkede kall. p90-kolonnen viser de lengre ventetidene en kunde kan oppleve.

Resultatlisten

Alle modeller på alle oppgaver, sortert etter hvor ofte svarene besto. Sorter etter kostnad for å se hva et bestått svar koster, eller etter hastighet for å se hvem som svarer først.

Høyest beståttandel først.

Beståttandel, kostnad per tusen beståtte kjøringer og svartid for 36 KI-modeller
#ModellAndel beståttePer 1,000 beståtteMedianp90EngelskItaliensk
1Qwen3.8 FlashAlibaba (Qwen)95%95 % konfidensintervall: 76 til 99 %$1.0929 s44 s92%100%
1Kimi K3Moonshot AI · åpne vekter95%95 % konfidensintervall: 76 til 99 %$18.4415 s78 s100%86%
1Gemini 3.1 Pro (preview)Google95%95 % konfidensintervall: 76 til 99 %$29.6717 s21 s92%100%
4GLM-5.3-FlashZ.ai · åpne vekter90%95 % konfidensintervall: 70 til 97 %$0.83115 s31 s92%86%
4DeepSeek V4.1 FlashDeepSeek · åpne vekter90%95 % konfidensintervall: 70 til 97 %$1.0514 s127 s85%100%
4DeepSeek V4 ProDeepSeek · åpne vekter90%95 % konfidensintervall: 70 til 97 %$5.1421 s49 s85%100%
4GLM-5.3Z.ai · åpne vekter90%95 % konfidensintervall: 70 til 97 %$7.029.2 s31 s92%86%
4Gemini 3.8 FlashGoogle90%95 % konfidensintervall: 70 til 97 %$7.1711 s16 s85%100%
4Grok 4.7xAI90%95 % konfidensintervall: 70 til 97 %$9.4117 s27 s92%86%
10Qwen3.7 PlusAlibaba (Qwen)85%95 % konfidensintervall: 64 til 95 %$3.5829 s41 s77%100%
10Claude Sonnet 5Anthropic85%95 % konfidensintervall: 64 til 95 %$6.70*25 s51 s77%100%
10GPT-5.6 SolOpenAI85%95 % konfidensintervall: 64 til 95 %$11.33*27 s37 s77%100%
10Qwen3.8 MaxAlibaba (Qwen)85%95 % konfidensintervall: 64 til 95 %$16.3243 s82 s77%100%
10Claude Opus 5Anthropic85%95 % konfidensintervall: 64 til 95 %$16.89*27 s83 s77%100%
10GPT-5.5OpenAI85%95 % konfidensintervall: 64 til 95 %$17.02*22 s34 s77%100%
10GPT-6 AstraOpenAI85%95 % konfidensintervall: 64 til 95 %$27.91*11 s38 s77%100%
10Claude Fable 5.1Anthropic85%95 % konfidensintervall: 64 til 95 %$33.11*26 s51 s77%100%
18GPT-5.6 LunaOpenAI80%95 % konfidensintervall: 58 til 92 %$0.677*28 s34 s69%100%
18Muse Glimmer 30BMeta · åpne vekter80%95 % konfidensintervall: 58 til 92 %$3.1013 s27 s69%100%
18Grok 4.3xAI80%95 % konfidensintervall: 58 til 92 %$4.107.4 s9.7 s77%86%
18GPT-5.6 TerraOpenAI80%95 % konfidensintervall: 58 til 92 %$6.68*29 s36 s69%100%
18Qwen3.8 27BAlibaba (Qwen) · åpne vekter80%95 % konfidensintervall: 58 til 92 %$7.3043 s89 s77%86%
23gpt-oss-120bOpenAI · åpne vekter75%95 % konfidensintervall: 53 til 89 %$0.42233 s69 s77%71%
23MiniMax M3MiniMax · åpne vekter75%95 % konfidensintervall: 53 til 89 %$1.826.4 s45 s77%71%
23Claude Sonnet 4.6Anthropic75%95 % konfidensintervall: 53 til 89 %$11.24*28 s54 s62%100%
23Kimi K2.6Moonshot AI · åpne vekter75%95 % konfidensintervall: 53 til 89 %$11.6828 s73 s69%86%
27Gemma 4 31BGoogle · åpne vekter60%95 % konfidensintervall: 39 til 78 %$0.55811 s36 s46%86%
28Llama 4 MaverickMeta · åpne vekter45%95 % konfidensintervall: 26 til 66 %$0.66514 s21 s38%57%
28Gemini 3.1 Flash-LiteGoogle45%95 % konfidensintervall: 26 til 66 %$1.411.7 s3.2 s38%57%
30GPT-5.4 miniOpenAI40%95 % konfidensintervall: 22 til 61 %$3.351.7 s2.3 s23%71%
30Mistral Medium 3.5Mistral · åpne vekter40%95 % konfidensintervall: 22 til 61 %$7.401.6 s2.3 s38%43%
32Gemini 3.5 Flash-LiteGoogle35%95 % konfidensintervall: 18 til 57 %$2.471.2 s1.5 s23%57%
32Claude Haiku 4.5Anthropic35%95 % konfidensintervall: 18 til 57 %$6.622.5 s3.4 s23%57%
34GPT-5.4 nanoOpenAI30%95 % konfidensintervall: 15 til 52 %$1.512.7 s3.8 s23%43%
35Ministral 3 14BMistral · åpne vekter20%95 % konfidensintervall: 8 til 42 %$1.073.9 s5.4 s8%43%
35Mistral Small 4Mistral · åpne vekter20%95 % konfidensintervall: 8 til 42 %$1.332.0 s20 s15%29%

Beståttandelen er andelen kjøringer som besto, med et 95 % konfidensintervall vist under: Modellens faktiske beståttandel kan ligge hvor som helst på stolpen. Kostnad per beståtte kjøring er kostnaden for alle kjøringer, også de som ikke besto, delt på antallet som besto. En stjerne markerer en kostnad beregnet ut fra produsentens listepris når leverandøren ikke oppga noen kostnad.

Etter type arbeid

Andelen kjøringer som besto for hver oppgavetype, på tvers av alle modeller, og hvilke modeller som besto oftest.

Andel beståtte etter oppgavetype
OppgavetypeOppgaverBeståtte kjøringerBestod oftest
Fordeling av forespørsler296%33 modeller med 100%
Uthenting av fakturadata290%29 modeller med 100%
Sortering av e-post183%30 modeller med 100%
Møtereferater183%30 modeller med 100%
Bedriftsberegninger276%19 modeller med 100%
Kvalifisering av leads172%26 modeller med 100%
Regnskapsføring271%24 modeller med 100%
Timebestilling269%21 modeller med 100%
Spørsmål om retningslinjer169%25 modeller med 100%
Kundestøtte267%17 modeller med 100%
Produktbeskrivelser158%21 modeller med 100%
Tilbud251%9 modeller med 100%
Svar på anmeldelser122%8 modeller med 100%

Oppgavene

De vanskeligste først. Hver side viser oppgaven slik modellene fikk den, fellene den inneholder, alle kontrollene forklart med ord og hva hver modell gjorde feil.

Oppgavene, med de vanskeligste først
OppgaveTypeSpråkBeståtte kjøringer
Svar offentlig på en negativ restaurantanmeldelse uten å røpe private opplysningerSvar på anmeldelserEngelsk8 av 36
Skriv en e-post med pristilbud på hagearbeid som håndterer en forespørsel om merverdiavgift og et vernet treTilbudEngelsk16 av 36
Svar en kunde som ber om refusjon etter at fristen for refusjon har gått utKundestøtteEngelsk17 av 36
Beregn ukentlig bruttolønn for en renholder, med pauser, overtid og søndagstilleggBedriftsberegningerEngelsk19 av 36
Skriv en italiensk produktbeskrivelse for en olivenolje som følger merkeregleneProduktbeskrivelserItaliensk21 av 36
Pris et maleroppdrag ut fra oppmålingene på befaringen og prislistenTilbudEngelsk21 av 36
Planlegg en samtale mellom London og New York i uken med uvanlig tidsforskjellTimebestillingEngelsk23 av 36
Kategoriser transaksjonene på en kafés månedlige kontoutskrift og summer driftskostnadeneRegnskapsføringEngelsk24 av 36
Svar på spørsmål om permisjon fra en deltidsansatt ved hjelp av personalhåndbokenSpørsmål om retningslinjerEngelsk25 av 36
Gi fem innkommende leads for renhold poeng etter salgsteamets reglerKvalifisering av leadsEngelsk26 av 36
Kategoriser transaksjonene på kontoutskriften til en italiensk bar og summer demRegnskapsføringItaliensk27 av 36
Finn en time til tannrens rundt en offentlig fridag, på italienskTimebestillingItaliensk27 av 36
Gjør et teammøte i et bakeri om til beslutninger, ansvarlige og fristerMøtereferaterEngelsk30 av 36
Sorter mandagens innboks hos en cateringbedrift, inkludert en phishing-e-post og en forespørsel om å endre bankopplysningerSortering av e-postEngelsk30 av 36
Hent ut opplysninger fra en italiensk leverandørfaktura med en utgiftslinje utenfor avgiftsgrunnlagetUthenting av fakturadataItaliensk31 av 36
Svar på italiensk til en kunde som feilaktig tror at garantien hennes har utløptKundestøtteItaliensk31 av 36
Fordel ti meldinger fra leietakere til riktig team med riktig prioritetFordeling av forespørslerEngelsk33 av 36
Hent ut opplysninger fra en leverandørfaktura på to sider til bruk i leverandørreskontroUthenting av fakturadataEngelsk34 av 36
Beregn to italienske fakturaer for profesjonelle tjenester med pensjonsbidrag, IVA og kildeskattBedriftsberegningerItaliensk36 av 36
Send meldinger fra hotellgjester til riktig avdeling, på italienskFordeling av forespørslerItaliensk36 av 36

Etter type virksomhet

Oppgavene én type virksomhet ville gitt til KI, vist side om side med resultatet fra hver modell på hver oppgave.

Beste KI-modell for regnskapsbyråer
6 oppgaver: kategorisering av en italiensk kontoutskrift, kategorisering av banktransaksjoner, uthenting av fakturadata, uthenting av data fra italienske leverandørfakturaer, beregning av italienske fakturaer for selvstendig næringsdrivende og beregning av overtidsbetaling.
Beste KI-modell for restauranter og barer
4 oppgaver: svar på negative anmeldelser, sortering av e-post i en bedrifts innboks, kategorisering av banktransaksjoner og kategorisering av en italiensk kontoutskrift.
Beste KI-modell for butikker
4 oppgaver: svar på refusjonsforespørsler, svar på garantikrav på italiensk, skriving av italienske produktbeskrivelser og skriving av møtereferater.
Beste KI-modell for håndverksbedrifter og tjenesteytere
6 oppgaver: prissetting av et oppdrag ut fra en prisliste, skriving av tilbud på e-post, scoring av salgsleads, sortering av kundemeldinger, beregning av overtidsbetaling og svar på spørsmål om personalhåndboken.

Slik vurderes svarene

Alle modellene får de samme instruksjonene og det samme materialet. Hver kjøring gir ett svar, og vurderingen avhenger ikke av hvor godt svaret høres ut.

Bestått eller ikke bestått
Et svar består bare hvis det består alle faste kontroller. På oppgaver som også har vurderingskriterier, må svaret oppfylle de fleste av dem, og de viktigste kriteriene er obligatoriske. Det gis ikke delvis uttelling.
Faste kontroller
Strukturerte svar kontrolleres felt for felt mot riktige verdier, med en feilmargin for beløp og timer. Skriftlige svar kontrolleres for hva de må si, hva de ikke må si, og hvor lange de kan være. Den samme koden vurderer alle modellene.
Vurdering etter kriterier
gpt-5-6-sol vurderer hvert kriterium ved temperatur null og begrunner vurderingen. Hvert svar vurderes to ganger, og en tredje vurdering avgjør kriterier der de to første er uenige. Modellens egen konklusjon ignoreres: Koden bruker beståttregelen på kriteriene modellen har vurdert. Før kjøringen ble den testet to ganger på svar med kjent resultat.
Én protokoll
Hver kjøring består av én melding med instruksjoner og én med materialet: ingen verktøy, ingen nettsøk, ingen JSON-modus, hver modells standardinnstillinger for sampling og opptil 4,000 tokens i svaret, inkludert resonnering. Et svar som kuttes ved denne grensen, vurderes slik det foreligger. 1 kjøring per modell på hver oppgave.
Gjennomgåtte regler
Før en utgave publiseres, gjennomgår vi alle svar som stryker på en avgjørende regel. Hvis en regel stryker et riktig svar fordi det mangler en detalj instruksjonene aldri ba om, retter vi regelen og vurderer svarene på nytt. En regel som fanger opp en reell feil, beholdes uansett hvor mange modeller som stryker på den.
Kostnad og tid
Kostnaden for en kjøring er det leverandøren fakturerte, eller, hvis leverandøren ikke oppgir noen kostnad, antall tokens beregnet etter produsentens listepris. Tiden måles fra forespørselen sendes til siste ord i svaret. Mislykkede kall er utelatt.
Intervaller
Hver andel beståtte har et Wilson-intervall på 95 %. Med noen titalls kjøringer per modell kan en forskjell på flere prosentpoeng mellom to modeller skyldes tilfeldigheter. Stolpene viser denne usikkerheten.
Dataene
Oppgaver, kontroller og resultater er publisert under CC BY 4.0: oppgi AIGROW som kilde og lenk til denne siden. Hver oppgaveside inneholder utgavens kanaristreng, slik at oppgavene kan holdes utenfor treningsdatasett.

La modellene som består, gjøre jobben

En AIGROW-agent gjør denne typen arbeid i dine egne verktøy, etter regler du har godkjent skriftlig. Vil du kjøre modellene selv, koster API-kreditt en fjerdedel av listeprisen.

oktober 2026-utgaven, pilot