36 AI-modellen getest op 20 echte taken voor kleine bedrijven
Facturen, offertes, roosters, reacties op reviews en het sorteren van de inbox. Elke taak bevat een valkuil voor wie niet goed oplet. Elk antwoord slaagt of faalt in zijn geheel, en voor elk geslaagd antwoord zijn de kosten berekend.
Een pilot: 20 van de 40 taken uit deze editie, 1 keer uitgevoerd per model.
- Modellen
- 36
- Taken
- 20 van 40
- Rondes
- 720
- Rubricbeoordelaar
- Gekalibreerd
Uitgevoerd in oktober 2026. Gegevens onder CC BY 4.0.
De AIGROW-benchmark voor kleine bedrijven geeft 36 AI-modellen 20 alledaagse kantoortaken en beoordeelt elk antwoord aan de hand van schriftelijk vastgelegde controles als geslaagd of gezakt. In de editie van oktober 2026 deelden 3 modellen de eerste plaats met 95%, en waren de geslaagde tests bij gpt-oss-120b het goedkoopst: $0.422 per duizend. Elke taak, controle en uitkomst wordt gepubliceerd.
Bevindingen
Wat de editie van oktober 2026 laat zien, en hoe zeker we daarvan zijn.
Qwen3.8 Flash, Kimi K3 en Gemini 3.1 Pro (preview) slaagden elk voor 95% van hun uitvoeringen, het hoogste percentage in deze editie.
De 95%-intervallen van 6 meer modellen reiken tot dat percentage. Met 20 uitvoeringen per model is niet vast te stellen of ze verschillen van de koploper. De balken in de ranglijst laten zien hoe groot de onzekerheid is.
Duizend geslaagde uitvoeringen kosten tussen $0.422 en $33.11, een verschil van 78×.
gpt-oss-120b leverde de goedkoopste geslaagde uitvoeringen en Claude Fable 5.1 de duurste. Een model dat vaak faalt, betaalt hier voor die mislukkingen: de kosten van elke uitvoering tellen mee.
Reageer publiekelijk op een negatieve restaurantrecensie zonder privégegevens prijs te geven was de moeilijkste taak: 22% van de uitvoeringen slaagde.
Een taak (categorie: reageren op beoordelingen, taal: Engels). Op de taakpagina staan de valkuilen en de controles waarop de meeste modellen niet slaagden.
Van de uitvoeringen voor Italiaanse taken slaagde 83%, tegenover 65% voor Engelse taken.
De Italiaanse taken zijn afzonderlijke taken, geschreven voor Italiaanse bedrijven en volgens Italiaanse belasting- en etiketteringsregels. Het zijn geen vertalingen van de Engelse taken. Het verschil weerspiegelt zowel taal als moeilijkheidsgraad.
De mediane responstijd liep van 1.2 s bij Gemini 3.5 Flash-Lite tot 43 s bij Qwen3.8 Max.
Gemeten vanaf het verzoek tot het laatste woord van het antwoord, zonder mislukte aanroepen. De p90-kolom toont de lange wachttijd waarmee een klant te maken kan krijgen.
De ranglijst
Elk model bij elke taak, gesorteerd op hoe vaak het antwoord slaagde. Sorteer op kosten om te zien wat een geslaagd antwoord kost, of op snelheid om te zien welk model als eerste antwoordt.
Hoogste slagingspercentage eerst.
| # | Model | Slagingspercentage | Per 1.000 geslaagde uitvoeringen | Mediaan | p90 | Engels | Italiaans |
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.8 FlashAlibaba (Qwen) | 95%-interval van 76 tot 99% | $1.09 | 29 s | 44 s | 92% | 100% |
| 1 | Kimi K3Moonshot AI · open modelgewichten | 95%-interval van 76 tot 99% | $18.44 | 15 s | 78 s | 100% | 86% |
| 1 | Gemini 3.1 Pro (preview)Google | 95%-interval van 76 tot 99% | $29.67 | 17 s | 21 s | 92% | 100% |
| 4 | GLM-5.3-FlashZ.ai · open modelgewichten | 95%-interval van 70 tot 97% | $0.831 | 15 s | 31 s | 92% | 86% |
| 4 | DeepSeek V4.1 FlashDeepSeek · open modelgewichten | 95%-interval van 70 tot 97% | $1.05 | 14 s | 127 s | 85% | 100% |
| 4 | DeepSeek V4 ProDeepSeek · open modelgewichten | 95%-interval van 70 tot 97% | $5.14 | 21 s | 49 s | 85% | 100% |
| 4 | GLM-5.3Z.ai · open modelgewichten | 95%-interval van 70 tot 97% | $7.02 | 9.2 s | 31 s | 92% | 86% |
| 4 | Gemini 3.8 FlashGoogle | 95%-interval van 70 tot 97% | $7.17 | 11 s | 16 s | 85% | 100% |
| 4 | Grok 4.7xAI | 95%-interval van 70 tot 97% | $9.41 | 17 s | 27 s | 92% | 86% |
| 10 | Qwen3.7 PlusAlibaba (Qwen) | 95%-interval van 64 tot 95% | $3.58 | 29 s | 41 s | 77% | 100% |
| 10 | Claude Sonnet 5Anthropic | 95%-interval van 64 tot 95% | $6.70* | 25 s | 51 s | 77% | 100% |
| 10 | GPT-5.6 SolOpenAI | 95%-interval van 64 tot 95% | $11.33* | 27 s | 37 s | 77% | 100% |
| 10 | Qwen3.8 MaxAlibaba (Qwen) | 95%-interval van 64 tot 95% | $16.32 | 43 s | 82 s | 77% | 100% |
| 10 | Claude Opus 5Anthropic | 95%-interval van 64 tot 95% | $16.89* | 27 s | 83 s | 77% | 100% |
| 10 | GPT-5.5OpenAI | 95%-interval van 64 tot 95% | $17.02* | 22 s | 34 s | 77% | 100% |
| 10 | GPT-6 AstraOpenAI | 95%-interval van 64 tot 95% | $27.91* | 11 s | 38 s | 77% | 100% |
| 10 | Claude Fable 5.1Anthropic | 95%-interval van 64 tot 95% | $33.11* | 26 s | 51 s | 77% | 100% |
| 18 | GPT-5.6 LunaOpenAI | 95%-interval van 58 tot 92% | $0.677* | 28 s | 34 s | 69% | 100% |
| 18 | Muse Glimmer 30BMeta · open modelgewichten | 95%-interval van 58 tot 92% | $3.10 | 13 s | 27 s | 69% | 100% |
| 18 | Grok 4.3xAI | 95%-interval van 58 tot 92% | $4.10 | 7.4 s | 9.7 s | 77% | 86% |
| 18 | GPT-5.6 TerraOpenAI | 95%-interval van 58 tot 92% | $6.68* | 29 s | 36 s | 69% | 100% |
| 18 | Qwen3.8 27BAlibaba (Qwen) · open modelgewichten | 95%-interval van 58 tot 92% | $7.30 | 43 s | 89 s | 77% | 86% |
| 23 | gpt-oss-120bOpenAI · open modelgewichten | 95%-interval van 53 tot 89% | $0.422 | 33 s | 69 s | 77% | 71% |
| 23 | MiniMax M3MiniMax · open modelgewichten | 95%-interval van 53 tot 89% | $1.82 | 6.4 s | 45 s | 77% | 71% |
| 23 | Claude Sonnet 4.6Anthropic | 95%-interval van 53 tot 89% | $11.24* | 28 s | 54 s | 62% | 100% |
| 23 | Kimi K2.6Moonshot AI · open modelgewichten | 95%-interval van 53 tot 89% | $11.68 | 28 s | 73 s | 69% | 86% |
| 27 | Gemma 4 31BGoogle · open modelgewichten | 95%-interval van 39 tot 78% | $0.558 | 11 s | 36 s | 46% | 86% |
| 28 | Llama 4 MaverickMeta · open modelgewichten | 95%-interval van 26 tot 66% | $0.665 | 14 s | 21 s | 38% | 57% |
| 28 | Gemini 3.1 Flash-LiteGoogle | 95%-interval van 26 tot 66% | $1.41 | 1.7 s | 3.2 s | 38% | 57% |
| 30 | GPT-5.4 miniOpenAI | 95%-interval van 22 tot 61% | $3.35 | 1.7 s | 2.3 s | 23% | 71% |
| 30 | Mistral Medium 3.5Mistral · open modelgewichten | 95%-interval van 22 tot 61% | $7.40 | 1.6 s | 2.3 s | 38% | 43% |
| 32 | Gemini 3.5 Flash-LiteGoogle | 95%-interval van 18 tot 57% | $2.47 | 1.2 s | 1.5 s | 23% | 57% |
| 32 | Claude Haiku 4.5Anthropic | 95%-interval van 18 tot 57% | $6.62 | 2.5 s | 3.4 s | 23% | 57% |
| 34 | GPT-5.4 nanoOpenAI | 95%-interval van 15 tot 52% | $1.51 | 2.7 s | 3.8 s | 23% | 43% |
| 35 | Ministral 3 14BMistral · open modelgewichten | 95%-interval van 8 tot 42% | $1.07 | 3.9 s | 5.4 s | 8% | 43% |
| 35 | Mistral Small 4Mistral · open modelgewichten | 95%-interval van 8 tot 42% | $1.33 | 2.0 s | 20 s | 15% | 29% |
Het slagingspercentage is het aandeel uitvoeringen dat slaagde. Daaronder staat het 95%-interval: het werkelijke percentage van een model kan overal op die balk liggen. De kosten per geslaagde uitvoering zijn de kosten van alle uitvoeringen, inclusief de mislukte, gedeeld door het aantal geslaagde uitvoeringen. Een sterretje geeft aan dat de kosten zijn berekend op basis van de catalogusprijs van de aanbieder, omdat die geen kosten doorgaf.
Per soort werk
Het aandeel geslaagde pogingen per soort taak, over alle modellen heen, en de modellen die daarbij het vaakst slaagden.
| Soort taak | Taken | Geslaagde pogingen | Slaagde het vaakst |
|---|---|---|---|
| Verzoeken doorsturen | 2 | 96% | 33 modellen met 100% |
| Factuurgegevens uitlezen | 2 | 90% | 29 modellen met 100% |
| E-mails beoordelen en indelen | 1 | 83% | 30 modellen met 100% |
| Vergaderingen samenvatten | 1 | 83% | 30 modellen met 100% |
| Zakelijke berekeningen | 2 | 76% | 19 modellen met 100% |
| Leads kwalificeren | 1 | 72% | 26 modellen met 100% |
| Boekhouding | 2 | 71% | 24 modellen met 100% |
| Afspraken inplannen | 2 | 69% | 21 modellen met 100% |
| Vragen over beleid | 1 | 69% | 25 modellen met 100% |
| Klantenservice | 2 | 67% | 17 modellen met 100% |
| Productbeschrijvingen | 1 | 58% | 21 modellen met 100% |
| Offertes | 2 | 51% | 9 modellen met 100% |
| Reageren op beoordelingen | 1 | 22% | 8 modellen met 100% |
De taken
De moeilijkste eerst. Elke pagina toont de taak zoals de modellen die zagen, de valkuilen, alle controles in gewone taal en wat elk model fout deed.
Per soort bedrijf
De taken die één soort bedrijf aan AI zou geven, naast elkaar, met het resultaat van elk model per taak.
- Beste AI-model voor accountantskantoren
- 6 taken: een Italiaans bankafschrift categoriseren, banktransacties categoriseren, factuurgegevens extraheren, gegevens uit Italiaanse leveranciersfacturen halen, Italiaanse facturen van zelfstandige professionals berekenen en overwerkvergoeding berekenen.
- Beste AI-model voor restaurants en cafés
- 4 taken: op negatieve reviews reageren, een zakelijke inbox triëren, banktransacties categoriseren en een Italiaans bankafschrift categoriseren.
- Beste AI-model voor winkels
- 4 taken: terugbetalingsverzoeken beantwoorden, Italiaanse garantieclaims beantwoorden, Italiaanse productbeschrijvingen schrijven en vergadernotulen schrijven.
- Beste AI-model voor vakbedrijven en dienstverleners
- 6 taken: een opdracht prijzen op basis van een prijslijst, offertemails schrijven, salesleads beoordelen, klantberichten doorsturen, overwerkvergoeding berekenen en vragen over het personeelshandboek beantwoorden.
Hoe we beoordelen
Elk model krijgt dezelfde instructies en hetzelfde materiaal, geeft één antwoord per poging en krijgt een oordeel dat niet afhangt van hoe overtuigend het antwoord klinkt.
- Geslaagd of gezakt
- Een antwoord slaagt alleen als het aan alle vaste controles voldoet. Bij taken met een rubric moet het ook aan de meeste criteria daarvan voldoen. De belangrijkste criteria zijn verplicht. Deelpunten zijn er niet.
- Vaste controles
- Gestructureerde antwoorden worden veld voor veld vergeleken met de juiste waarden, met een tolerantie voor bedragen en uren. Schriftelijke antwoorden worden gecontroleerd op wat erin moet staan, wat er niet in mag staan en hoe lang ze mogen zijn. Dezelfde code beoordeelt elk model.
- De rubricbeoordelaar
- gpt-5-6-sol beoordeelt elk rubriccriterium bij een temperatuur van nul en geeft er een reden bij. Elk antwoord wordt twee keer beoordeeld. Bij verschil van mening over een criterium geeft een derde beoordeling de doorslag. Het eindoordeel van de beoordelaar wordt genegeerd: de code past de slaagregel toe op de beoordeelde criteria. Vooraf is de beoordelaar twee keer getest op antwoorden waarvan het oordeel bekend is.
- Eén protocol
- Elke poging bestaat uit één instructiebericht en één bericht met het materiaal: geen tools, geen zoekopdracht op internet, geen JSON-modus, de standaardinstellingen voor sampling van elk model en maximaal 4,000 outputtokens, inclusief redenering. Een antwoord dat bij die limiet wordt afgebroken, wordt beoordeeld zoals het er dan staat. Elk model voert elke taak 1 keer uit.
- Gecontroleerde regels
- Voordat een editie wordt gepubliceerd, lezen we elke afwijzing op basis van een beslissende regel na. Als een regel een correct antwoord afkeurt omdat een detail ontbreekt waar de instructies niet om vroegen, passen we de regel aan en beoordelen we die antwoorden opnieuw. Een regel die een echte fout opspoort, blijft staan, ongeacht hoeveel modellen daardoor zakken.
- Kosten en tijd
- Een poging kost wat de aanbieder ervoor in rekening heeft gebracht. Als de aanbieder geen kosten meldt, berekenen we de kosten op basis van het aantal tokens en de catalogusprijs van de maker. De tijd loopt van het verzoek tot het laatste woord van het antwoord. Mislukte aanroepen tellen niet mee.
- Intervallen
- Bij elk slagingspercentage staat een Wilson-interval van 95%. Met enkele tientallen pogingen per model kan een verschil van meerdere procentpunten tussen twee modellen toeval zijn. Dat laten de balken zien.
- De gegevens
- Taken, controles en resultaten zijn gepubliceerd onder CC BY 4.0: vermeld AIGROW als bron en link naar deze pagina. Elke taakpagina bevat de kanariestring van deze editie, zodat de taken uit trainingsdatasets gehouden kunnen worden.
Zet de modellen die slagen aan het werk
Een AIGROW-agent doet dit soort werk binnen je eigen tools, volgens regels die je schriftelijk goedkeurt. Wil je de modellen zelf gebruiken, dan kost API-tegoed een kwart van de catalogusprijs.
Editie van oktober 2026, pilot