Snabba svar

AIGrow erbjuder bevakning av AI-synlighet, en företagsassistent, bloggpublicering och avgränsade automationstjänster. Börja med den kostnadsfria skanningen för att granska resultatet innan du betalar.

Kör den kostnadsfria skanningen

Skanningen är kostnadsfri och bevakningsplanerna börjar på $29 per månad. Verksamhetsgranskningen kostar $290, synlighetsgranskningen $490, och för skräddarsydda lösningar får du ett skriftligt pris innan arbetet börjar.

Se planerna

Kör den kostnadsfria skanningen. Den läser din webbplats, frågar flera AI-assistenter vad dina kunder frågar om och pekar ut en sak. Ingen registrering krävs, och den talar om ifall du inte behöver oss.

Börja nu

Ja. Använd kontaktformuläret för frågor om produkten, fakturering, support eller projekt. Beskriv målet och vilket system det gäller, så kan det första svaret bli konkret.

Kontakta AIGrow
Benchmark · utgåvan för oktober 2026 · pilotstudie

36 AI-modeller får lösa 20 verkliga uppgifter från småföretag

Fakturor, offerter, scheman, svar på recensioner och sortering av inkorgen, alla med en fallgrop som ett slarvigt svar går i. Varje svar blir antingen godkänt eller underkänt i sin helhet, och varje godkänt svar får ett pris.

Ett pilottest: 20 av utgåvans 40 uppgifter, 1 körning per modell.

Högst andel godkända svar
95%Delas av 3 modeller, med 19 av 20 godkända körningar vardera
Modeller
36
Uppgifter
20 av 40
Omgångar
720
Bedömning utifrån kriterier
Kalibrerad

Genomförd i oktober 2026. Data licensierad enligt CC BY 4.0.

I AIGROWs benchmark för småföretag får 36 AI-modeller lösa 20 vardagliga kontorsuppgifter. Varje svar bedöms som godkänt eller underkänt utifrån skriftliga kontroller. I oktober 2026-upplagan delade Qwen3.8 Flash, Kimi K3 och Gemini 3.1 Pro (preview) förstaplatsen med 95%, och gpt-oss-120b hade lägst kostnad per godkänt resultat: $0.422 per tusen. Alla uppgifter, kontroller och resultat publiceras.

Resultat

Vad utgåvan från oktober 2026 visar och hur säkra slutsatserna är.

  1. Qwen3.8 Flash, Kimi K3 och Gemini 3.1 Pro (preview) fick vardera 95% av sina körningar godkända, den högsta andelen i utgåvan.

    95%-intervallen för 6 fler modeller når upp till den andelen. Med 20 körningar per modell går det inte att statistiskt skilja dem från topplaceringen. Intervallen i topplistan visar hur mycket resultaten kan variera.

  2. Tusen godkända resultat kostar mellan $0.422 och $33.11, en skillnad på 78×.

    gpt-oss-120b gav de billigaste godkända resultaten och Claude Fable 5.1 de dyraste. En modell som ofta misslyckas får bära kostnaden för det här, eftersom varje körning räknas in.

  3. Svara offentligt på en negativ restaurangrecension utan att röja privata uppgifter var den svåraste uppgiften: 22% av körningarna godkändes.

    En uppgift på språket engelska i kategorin svar på omdömen. På uppgiftssidan finns fallgroparna och de kontrollpunkter som de flesta modeller inte klarade.

  4. Av körningarna på italienska godkändes 83%, jämfört med 65% på engelska.

    De italienska uppgifterna är egna uppgifter, skrivna för italienska företag med italienska skatte- och märkningsregler. De är inte översättningar av de engelska. Skillnaden speglar både språk och svårighetsgrad.

  5. Medianen för svarstid sträckte sig från 1.2 s för Gemini 3.5 Flash-Lite till 43 s för Qwen3.8 Max.

    Tiden mäts från att begäran skickas tills det sista ordet i svaret kommer. Misslyckade anrop räknas inte med. Kolumnen p90 visar hur länge en kund kan behöva vänta på de långsammaste svaren.

Topplistan

Alla modeller på alla uppgifter, sorterade efter hur ofta deras svar blev godkända. Sortera efter kostnad för att se priset per godkänt svar, eller efter hastighet för att se vem som svarar först.

Högst andel godkända körningar först.

Andel godkända körningar, kostnad per tusen godkända resultat och svarstid för 36 AI-modeller
#ModellAndel godkändaPer 1,000 godkända resultatMedianp90EngelskaItalienska
1Qwen3.8 FlashAlibaba (Qwen)95%95%-intervall: 76 till 99%$1.0929 s44 s92%100%
1Kimi K3Moonshot AI · öppna modellvikter95%95%-intervall: 76 till 99%$18.4415 s78 s100%86%
1Gemini 3.1 Pro (preview)Google95%95%-intervall: 76 till 99%$29.6717 s21 s92%100%
4GLM-5.3-FlashZ.ai · öppna modellvikter90%95%-intervall: 70 till 97%$0.83115 s31 s92%86%
4DeepSeek V4.1 FlashDeepSeek · öppna modellvikter90%95%-intervall: 70 till 97%$1.0514 s127 s85%100%
4DeepSeek V4 ProDeepSeek · öppna modellvikter90%95%-intervall: 70 till 97%$5.1421 s49 s85%100%
4GLM-5.3Z.ai · öppna modellvikter90%95%-intervall: 70 till 97%$7.029.2 s31 s92%86%
4Gemini 3.8 FlashGoogle90%95%-intervall: 70 till 97%$7.1711 s16 s85%100%
4Grok 4.7xAI90%95%-intervall: 70 till 97%$9.4117 s27 s92%86%
10Qwen3.7 PlusAlibaba (Qwen)85%95%-intervall: 64 till 95%$3.5829 s41 s77%100%
10Claude Sonnet 5Anthropic85%95%-intervall: 64 till 95%$6.70*25 s51 s77%100%
10GPT-5.6 SolOpenAI85%95%-intervall: 64 till 95%$11.33*27 s37 s77%100%
10Qwen3.8 MaxAlibaba (Qwen)85%95%-intervall: 64 till 95%$16.3243 s82 s77%100%
10Claude Opus 5Anthropic85%95%-intervall: 64 till 95%$16.89*27 s83 s77%100%
10GPT-5.5OpenAI85%95%-intervall: 64 till 95%$17.02*22 s34 s77%100%
10GPT-6 AstraOpenAI85%95%-intervall: 64 till 95%$27.91*11 s38 s77%100%
10Claude Fable 5.1Anthropic85%95%-intervall: 64 till 95%$33.11*26 s51 s77%100%
18GPT-5.6 LunaOpenAI80%95%-intervall: 58 till 92%$0.677*28 s34 s69%100%
18Muse Glimmer 30BMeta · öppna modellvikter80%95%-intervall: 58 till 92%$3.1013 s27 s69%100%
18Grok 4.3xAI80%95%-intervall: 58 till 92%$4.107.4 s9.7 s77%86%
18GPT-5.6 TerraOpenAI80%95%-intervall: 58 till 92%$6.68*29 s36 s69%100%
18Qwen3.8 27BAlibaba (Qwen) · öppna modellvikter80%95%-intervall: 58 till 92%$7.3043 s89 s77%86%
23gpt-oss-120bOpenAI · öppna modellvikter75%95%-intervall: 53 till 89%$0.42233 s69 s77%71%
23MiniMax M3MiniMax · öppna modellvikter75%95%-intervall: 53 till 89%$1.826.4 s45 s77%71%
23Claude Sonnet 4.6Anthropic75%95%-intervall: 53 till 89%$11.24*28 s54 s62%100%
23Kimi K2.6Moonshot AI · öppna modellvikter75%95%-intervall: 53 till 89%$11.6828 s73 s69%86%
27Gemma 4 31BGoogle · öppna modellvikter60%95%-intervall: 39 till 78%$0.55811 s36 s46%86%
28Llama 4 MaverickMeta · öppna modellvikter45%95%-intervall: 26 till 66%$0.66514 s21 s38%57%
28Gemini 3.1 Flash-LiteGoogle45%95%-intervall: 26 till 66%$1.411.7 s3.2 s38%57%
30GPT-5.4 miniOpenAI40%95%-intervall: 22 till 61%$3.351.7 s2.3 s23%71%
30Mistral Medium 3.5Mistral · öppna modellvikter40%95%-intervall: 22 till 61%$7.401.6 s2.3 s38%43%
32Gemini 3.5 Flash-LiteGoogle35%95%-intervall: 18 till 57%$2.471.2 s1.5 s23%57%
32Claude Haiku 4.5Anthropic35%95%-intervall: 18 till 57%$6.622.5 s3.4 s23%57%
34GPT-5.4 nanoOpenAI30%95%-intervall: 15 till 52%$1.512.7 s3.8 s23%43%
35Ministral 3 14BMistral · öppna modellvikter20%95%-intervall: 8 till 42%$1.073.9 s5.4 s8%43%
35Mistral Small 4Mistral · öppna modellvikter20%95%-intervall: 8 till 42%$1.332.0 s20 s15%29%

Andelen godkända körningar visas med ett 95%-intervall under siffran. Modellens verkliga andel kan ligga var som helst inom intervallet. Kostnaden per godkänt resultat beräknas genom att kostnaden för alla körningar, även de underkända, delas med antalet godkända körningar. En asterisk markerar att kostnaden har beräknats utifrån tillverkarens listpris eftersom leverantören inte redovisade någon kostnad.

Efter typ av arbete

Andelen godkända körningar för varje uppgiftstyp, räknat över alla modeller, och vilka modeller som oftast blev godkända.

Andel godkända svar per uppgiftstyp
UppgiftstypUppgifterGodkända körningarOftast godkänd
Hantering av förfrågningar296%33 modeller med 100%
Utläsning av fakturor290%29 modeller med 100%
Prioritering av mejl183%30 modeller med 100%
Mötessammanfattningar183%30 modeller med 100%
Företagsberäkningar276%19 modeller med 100%
Kvalificering av leads172%26 modeller med 100%
Bokföring271%24 modeller med 100%
Tidsbokning269%21 modeller med 100%
Frågor om policyer169%25 modeller med 100%
Kundsupport267%17 modeller med 100%
Produktbeskrivningar158%21 modeller med 100%
Offerter251%9 modeller med 100%
Svar på omdömen122%8 modeller med 100%

Uppgifterna

De svåraste först. På varje sida visas uppgiften så som modellerna fick den, dess fallgropar, alla kontroller beskrivna i ord och vad varje modell gjorde fel.

Uppgifterna, med de svåraste först
UppgiftTypSpråkGodkända körningar
Svara offentligt på en negativ restaurangrecension utan att röja privata uppgifterSvar på omdömenEngelska8 av 36
Skriv ett mejl med offert för trädgårdsanläggning som hanterar en begäran om moms och ett skyddat trädOfferterEngelska16 av 36
Svara en kund som begär återbetalning efter att tidsfristen för återbetalning löpt utKundsupportEngelska17 av 36
Räkna ut en städares bruttolön för en vecka med raster, övertid och söndagsersättningFöretagsberäkningarEngelska19 av 36
Skriv en italiensk produktbeskrivning av en olivolja som följer märkningsreglernaProduktbeskrivningarItalienska21 av 36
Beräkna priset för ett måleriarbete utifrån måtten från platsbesöket och prislistanOfferterEngelska21 av 36
Boka ett samtal mellan London och New York under veckan då tidsskillnaden avvikerTidsbokningEngelska23 av 36
Kategorisera ett kafés månatliga kontoutdrag och summera rörelsekostnadernaBokföringEngelska24 av 36
Besvara en deltidsanställds frågor om ledighet utifrån personalhandbokenFrågor om policyerEngelska25 av 36
Poängsätt fem inkommande leads för städtjänster enligt säljteamets reglerKvalificering av leadsEngelska26 av 36
Kategorisera kontoutdraget för en italiensk bar och summera transaktionernaBokföringItalienska27 av 36
Hitta en tid för tandhygienist nära en helgdag, på italienskaTidsbokningItalienska27 av 36
Sammanställ beslut, ansvariga och datum från ett möte med bageriteametMötessammanfattningarEngelska30 av 36
Prioritera måndagens inkorg hos ett cateringföretag, inklusive ett nätfiskemejl och en begäran om byte av bankkontoPrioritering av mejlEngelska30 av 36
Extrahera uppgifter från en italiensk leverantörsfaktura med en utläggsrad som inte ingår i beskattningsunderlagetUtläsning av fakturorItalienska31 av 36
Svara på italienska en kund som felaktigt tror att hennes garanti har gått utKundsupportItalienska31 av 36
Skicka tio meddelanden från hyresgäster till rätt team med rätt prioritetHantering av förfrågningarEngelska33 av 36
Extrahera uppgifter från en tvåsidig leverantörsfaktura för leverantörsreskontranUtläsning av fakturorEngelska34 av 36
Beräkna två italienska fakturor för yrkestjänster med pensionsavgift, IVA och källskattFöretagsberäkningarItalienska36 av 36
Skicka hotellgästers meddelanden till rätt avdelning, på italienskaHantering av förfrågningarItalienska36 av 36

Efter företagstyp

Uppgifterna som en viss typ av företag skulle ge till AI, sida vid sida, med varje modells resultat på varje uppgift.

Bästa AI-modellen för redovisningsbyråer
6 uppgifter: kategorisera ett italienskt kontoutdrag, kategorisera banktransaktioner, extrahera fakturauppgifter, extrahera uppgifter ur italienska leverantörsfakturor, beräkna italienska konsultfakturor och beräkna övertidsersättning.
Bästa AI-modellen för restauranger och barer
4 uppgifter: svara på negativa recensioner, prioritera ärenden i ett företags inkorg, kategorisera banktransaktioner och kategorisera ett italienskt kontoutdrag.
Bästa AI-modellen för butiker
4 uppgifter: besvara önskemål om återbetalning, besvara garantiärenden på italienska, skriva italienska produktbeskrivningar och skriva mötesanteckningar.
Bästa AI-modellen för hantverkare och tjänsteföretag
6 uppgifter: prissätta ett uppdrag utifrån en prislista, skriva mejl med offerter, poängsätta säljleads, sortera kundmeddelanden, beräkna övertidsersättning och besvara frågor om personalhandboken.

Så bedöms svaren

Samma instruktioner och underlag till varje modell, ett svar per körning och ett resultat som inte beror på hur svaret låter.

Godkänt eller underkänt
Ett svar blir godkänt bara om det klarar alla fasta kontroller. För uppgifter som också har bedömningskriterier måste svaret dessutom uppfylla de flesta kriterierna, där de viktigaste är obligatoriska. Inga delpoäng ges.
Fasta kontroller
Strukturerade svar granskas fält för fält mot rätt värden, med en tolerans för belopp och timmar. Skrivna svar kontrolleras utifrån vad de måste innehålla, vad de inte får innehålla och hur långa de får vara. Samma kod bedömer varje modell.
Bedömning utifrån kriterier
gpt-5-6-sol bedömer varje kriterium vid temperaturen noll och ger en motivering. Varje svar bedöms två gånger, och en tredje bedömning avgör de kriterier där de två första skiljer sig åt. Modellens egen slutsats ignoreras: koden tillämpar godkännanderegeln på de bedömda kriterierna. Före körningen testades bedömaren två gånger på svar med kända resultat.
Samma upplägg för alla
Varje körning består av ett instruktionsmeddelande och ett meddelande med underlaget: inga verktyg, ingen webbsökning, inget JSON-läge, varje modells standardinställning för sampling och högst 4,000 token i svaret, inklusive resonemang. Ett svar som kapas vid den gränsen bedöms som det är. 1 körning per modell och uppgift.
Granskade regler
Innan en utgåva publiceras granskas varje underkänt svar som beror på en avgörande regel. Om en regel underkänner ett korrekt svar för att det saknar en detalj som instruktionerna aldrig efterfrågade, rättas regeln och svaren bedöms på nytt. En regel som fångar ett verkligt fel behålls, oavsett hur många modeller den underkänner.
Kostnad och tid
Kostnaden per körning är vad leverantören debiterade eller, om leverantören inte redovisar någon kostnad, antalet token till tillverkarens listpris. Tiden mäts från förfrågan till svarets sista ord. Misslyckade anrop räknas inte med.
Intervall
Varje andel godkända svar visas med ett Wilson-intervall på 95 %. Med bara några dussin körningar per modell kan en skillnad på flera procentenheter mellan två modeller bero på slumpen, vilket intervallen visar.
Data
Uppgifter, kontroller och resultat publiceras enligt CC BY 4.0: ange AIGROW som källa och länka till den här sidan. Varje uppgiftssida innehåller utgåvans kanariesträng så att uppgifterna kan hållas borta från träningsdata.

Låt modellerna som klarar uppgifterna börja arbeta

En AIGROW-agent utför den här typen av arbete i dina egna verktyg, enligt regler som du godkänner skriftligen. Om du vill köra modellerna själv kostar API-kredit en fjärdedel av listpriset.

Utgåvan från oktober 2026, pilotstudie