Snelle antwoorden

AIGrow biedt monitoring van AI-zichtbaarheid, een bedrijfsassistent, blogpublicatie en afgebakende automatiseringsdiensten. Begin met de gratis scan om het resultaat te bekijken voordat je betaalt.

Voer de gratis scan uit

De scan is gratis en monitoringplannen beginnen bij $29 per maand. De operationele audit kost $290, de zichtbaarheidsaudit kost $490 en voor maatwerk ontvang je vóór de start een schriftelijke prijsopgave.

Bekijk de plannen

Voer de gratis scan uit. Die leest je site, vraagt verschillende AI-assistenten wat je klanten vragen en wijst je op één ding. Aanmelden is niet nodig en de scan vertelt je als je ons niet nodig hebt.

Begin nu

Ja. Gebruik het contactformulier voor vragen over het product, facturatie, ondersteuning of een project. Beschrijf het doel en het betrokken systeem, zodat de eerste reactie specifiek kan zijn.

Neem contact op met AIGrow
Benchmark · editie oktober 2026 · pilot

36 AI-modellen getest op 20 echte taken voor kleine bedrijven

Facturen, offertes, roosters, reacties op reviews en het sorteren van de inbox. Elke taak bevat een valkuil voor wie niet goed oplet. Elk antwoord slaagt of faalt in zijn geheel, en voor elk geslaagd antwoord zijn de kosten berekend.

Een pilot: 20 van de 40 taken uit deze editie, 1 keer uitgevoerd per model.

Hoogste slagingspercentage
95%Gedeeld door 3 modellen, elk 19 van 20 pogingen geslaagd
Modellen
36
Taken
20 van 40
Rondes
720
Rubricbeoordelaar
Gekalibreerd

Uitgevoerd in oktober 2026. Gegevens onder CC BY 4.0.

De AIGROW-benchmark voor kleine bedrijven geeft 36 AI-modellen 20 alledaagse kantoortaken en beoordeelt elk antwoord aan de hand van schriftelijk vastgelegde controles als geslaagd of gezakt. In de editie van oktober 2026 deelden 3 modellen de eerste plaats met 95%, en waren de geslaagde tests bij gpt-oss-120b het goedkoopst: $0.422 per duizend. Elke taak, controle en uitkomst wordt gepubliceerd.

Bevindingen

Wat de editie van oktober 2026 laat zien, en hoe zeker we daarvan zijn.

  1. Qwen3.8 Flash, Kimi K3 en Gemini 3.1 Pro (preview) slaagden elk voor 95% van hun uitvoeringen, het hoogste percentage in deze editie.

    De 95%-intervallen van 6 meer modellen reiken tot dat percentage. Met 20 uitvoeringen per model is niet vast te stellen of ze verschillen van de koploper. De balken in de ranglijst laten zien hoe groot de onzekerheid is.

  2. Duizend geslaagde uitvoeringen kosten tussen $0.422 en $33.11, een verschil van 78×.

    gpt-oss-120b leverde de goedkoopste geslaagde uitvoeringen en Claude Fable 5.1 de duurste. Een model dat vaak faalt, betaalt hier voor die mislukkingen: de kosten van elke uitvoering tellen mee.

  3. Reageer publiekelijk op een negatieve restaurantrecensie zonder privégegevens prijs te geven was de moeilijkste taak: 22% van de uitvoeringen slaagde.

    Een taak (categorie: reageren op beoordelingen, taal: Engels). Op de taakpagina staan de valkuilen en de controles waarop de meeste modellen niet slaagden.

  4. Van de uitvoeringen voor Italiaanse taken slaagde 83%, tegenover 65% voor Engelse taken.

    De Italiaanse taken zijn afzonderlijke taken, geschreven voor Italiaanse bedrijven en volgens Italiaanse belasting- en etiketteringsregels. Het zijn geen vertalingen van de Engelse taken. Het verschil weerspiegelt zowel taal als moeilijkheidsgraad.

  5. De mediane responstijd liep van 1.2 s bij Gemini 3.5 Flash-Lite tot 43 s bij Qwen3.8 Max.

    Gemeten vanaf het verzoek tot het laatste woord van het antwoord, zonder mislukte aanroepen. De p90-kolom toont de lange wachttijd waarmee een klant te maken kan krijgen.

De ranglijst

Elk model bij elke taak, gesorteerd op hoe vaak het antwoord slaagde. Sorteer op kosten om te zien wat een geslaagd antwoord kost, of op snelheid om te zien welk model als eerste antwoordt.

Hoogste slagingspercentage eerst.

Slagingspercentage, kosten per duizend geslaagde uitvoeringen en responstijd van 36 AI-modellen
#ModelSlagingspercentagePer 1.000 geslaagde uitvoeringenMediaanp90EngelsItaliaans
1Qwen3.8 FlashAlibaba (Qwen)95%95%-interval van 76 tot 99%$1.0929 s44 s92%100%
1Kimi K3Moonshot AI · open modelgewichten95%95%-interval van 76 tot 99%$18.4415 s78 s100%86%
1Gemini 3.1 Pro (preview)Google95%95%-interval van 76 tot 99%$29.6717 s21 s92%100%
4GLM-5.3-FlashZ.ai · open modelgewichten90%95%-interval van 70 tot 97%$0.83115 s31 s92%86%
4DeepSeek V4.1 FlashDeepSeek · open modelgewichten90%95%-interval van 70 tot 97%$1.0514 s127 s85%100%
4DeepSeek V4 ProDeepSeek · open modelgewichten90%95%-interval van 70 tot 97%$5.1421 s49 s85%100%
4GLM-5.3Z.ai · open modelgewichten90%95%-interval van 70 tot 97%$7.029.2 s31 s92%86%
4Gemini 3.8 FlashGoogle90%95%-interval van 70 tot 97%$7.1711 s16 s85%100%
4Grok 4.7xAI90%95%-interval van 70 tot 97%$9.4117 s27 s92%86%
10Qwen3.7 PlusAlibaba (Qwen)85%95%-interval van 64 tot 95%$3.5829 s41 s77%100%
10Claude Sonnet 5Anthropic85%95%-interval van 64 tot 95%$6.70*25 s51 s77%100%
10GPT-5.6 SolOpenAI85%95%-interval van 64 tot 95%$11.33*27 s37 s77%100%
10Qwen3.8 MaxAlibaba (Qwen)85%95%-interval van 64 tot 95%$16.3243 s82 s77%100%
10Claude Opus 5Anthropic85%95%-interval van 64 tot 95%$16.89*27 s83 s77%100%
10GPT-5.5OpenAI85%95%-interval van 64 tot 95%$17.02*22 s34 s77%100%
10GPT-6 AstraOpenAI85%95%-interval van 64 tot 95%$27.91*11 s38 s77%100%
10Claude Fable 5.1Anthropic85%95%-interval van 64 tot 95%$33.11*26 s51 s77%100%
18GPT-5.6 LunaOpenAI80%95%-interval van 58 tot 92%$0.677*28 s34 s69%100%
18Muse Glimmer 30BMeta · open modelgewichten80%95%-interval van 58 tot 92%$3.1013 s27 s69%100%
18Grok 4.3xAI80%95%-interval van 58 tot 92%$4.107.4 s9.7 s77%86%
18GPT-5.6 TerraOpenAI80%95%-interval van 58 tot 92%$6.68*29 s36 s69%100%
18Qwen3.8 27BAlibaba (Qwen) · open modelgewichten80%95%-interval van 58 tot 92%$7.3043 s89 s77%86%
23gpt-oss-120bOpenAI · open modelgewichten75%95%-interval van 53 tot 89%$0.42233 s69 s77%71%
23MiniMax M3MiniMax · open modelgewichten75%95%-interval van 53 tot 89%$1.826.4 s45 s77%71%
23Claude Sonnet 4.6Anthropic75%95%-interval van 53 tot 89%$11.24*28 s54 s62%100%
23Kimi K2.6Moonshot AI · open modelgewichten75%95%-interval van 53 tot 89%$11.6828 s73 s69%86%
27Gemma 4 31BGoogle · open modelgewichten60%95%-interval van 39 tot 78%$0.55811 s36 s46%86%
28Llama 4 MaverickMeta · open modelgewichten45%95%-interval van 26 tot 66%$0.66514 s21 s38%57%
28Gemini 3.1 Flash-LiteGoogle45%95%-interval van 26 tot 66%$1.411.7 s3.2 s38%57%
30GPT-5.4 miniOpenAI40%95%-interval van 22 tot 61%$3.351.7 s2.3 s23%71%
30Mistral Medium 3.5Mistral · open modelgewichten40%95%-interval van 22 tot 61%$7.401.6 s2.3 s38%43%
32Gemini 3.5 Flash-LiteGoogle35%95%-interval van 18 tot 57%$2.471.2 s1.5 s23%57%
32Claude Haiku 4.5Anthropic35%95%-interval van 18 tot 57%$6.622.5 s3.4 s23%57%
34GPT-5.4 nanoOpenAI30%95%-interval van 15 tot 52%$1.512.7 s3.8 s23%43%
35Ministral 3 14BMistral · open modelgewichten20%95%-interval van 8 tot 42%$1.073.9 s5.4 s8%43%
35Mistral Small 4Mistral · open modelgewichten20%95%-interval van 8 tot 42%$1.332.0 s20 s15%29%

Het slagingspercentage is het aandeel uitvoeringen dat slaagde. Daaronder staat het 95%-interval: het werkelijke percentage van een model kan overal op die balk liggen. De kosten per geslaagde uitvoering zijn de kosten van alle uitvoeringen, inclusief de mislukte, gedeeld door het aantal geslaagde uitvoeringen. Een sterretje geeft aan dat de kosten zijn berekend op basis van de catalogusprijs van de aanbieder, omdat die geen kosten doorgaf.

Per soort werk

Het aandeel geslaagde pogingen per soort taak, over alle modellen heen, en de modellen die daarbij het vaakst slaagden.

Slagingspercentage per soort taak
Soort taakTakenGeslaagde pogingenSlaagde het vaakst
Verzoeken doorsturen296%33 modellen met 100%
Factuurgegevens uitlezen290%29 modellen met 100%
E-mails beoordelen en indelen183%30 modellen met 100%
Vergaderingen samenvatten183%30 modellen met 100%
Zakelijke berekeningen276%19 modellen met 100%
Leads kwalificeren172%26 modellen met 100%
Boekhouding271%24 modellen met 100%
Afspraken inplannen269%21 modellen met 100%
Vragen over beleid169%25 modellen met 100%
Klantenservice267%17 modellen met 100%
Productbeschrijvingen158%21 modellen met 100%
Offertes251%9 modellen met 100%
Reageren op beoordelingen122%8 modellen met 100%

De taken

De moeilijkste eerst. Elke pagina toont de taak zoals de modellen die zagen, de valkuilen, alle controles in gewone taal en wat elk model fout deed.

De taken, de moeilijkste eerst
TaakSoortTaalGeslaagde pogingen
Reageer publiekelijk op een negatieve restaurantrecensie zonder privégegevens prijs te gevenReageren op beoordelingenEngels8 van 36
Mail een offerte voor tuinaanleg waarin je ingaat op een btw-verzoek en een beschermde boomOffertesEngels16 van 36
Beantwoord een klant die om terugbetaling vraagt buiten de terugbetalingstermijnKlantenserviceEngels17 van 36
Bereken het wekelijkse brutoloon van een schoonmaker, inclusief pauzes, overuren en zondagstoeslagZakelijke berekeningenEngels19 van 36
Schrijf een Italiaanse productbeschrijving voor olijfolie die aan de etiketteringsregels voldoetProductbeschrijvingenItaliaans21 van 36
Bereken een offerte voor schilder- en decoratiewerk op basis van de opgemeten maten en de prijslijstOffertesEngels21 van 36
Plan een gesprek tussen Londen en New York in de week waarin het tijdsverschil afwijktAfspraken inplannenEngels23 van 36
Rubriceer het maandelijkse bankafschrift van een café en bereken de totale bedrijfskostenBoekhoudingEngels24 van 36
Beantwoord de verlofvragen van een deeltijdmedewerker aan de hand van het personeelshandboekVragen over beleidEngels25 van 36
Beoordeel vijf binnengekomen leads voor schoonmaakdiensten volgens de regels van het salesteamLeads kwalificerenEngels26 van 36
Rubriceer de transacties op het bankafschrift van een Italiaanse bar en tel de bedragen opBoekhoudingItaliaans27 van 36
Zoek in het Italiaans een afspraak voor een gebitsreiniging rond een nationale feestdagAfspraken inplannenItaliaans27 van 36
Zet een teamoverleg van een bakkerij om in besluiten, verantwoordelijken en deadlinesVergaderingen samenvattenEngels30 van 36
Sorteer de maandagse inbox van een cateraar, inclusief een phishingmail en een verzoek om bankgegevens te wijzigenE-mails beoordelen en indelenEngels30 van 36
Haal de gegevens uit een Italiaanse leveranciersfactuur met een kostenpost buiten de btw-grondslagFactuurgegevens uitlezenItaliaans31 van 36
Antwoord in het Italiaans op een klant die ten onrechte denkt dat haar garantie is verlopenKlantenserviceItaliaans31 van 36
Stuur tien berichten van huurders met de juiste prioriteit door naar het juiste teamVerzoeken doorsturenEngels33 van 36
Haal voor de crediteurenadministratie de gegevens uit een leveranciersfactuur van twee pagina'sFactuurgegevens uitlezenEngels34 van 36
Bereken twee Italiaanse facturen voor professionele diensten, inclusief pensioenbijdrage, IVA en bronbelastingZakelijke berekeningenItaliaans36 van 36
Stuur berichten van hotelgasten in het Italiaans naar de juiste afdelingVerzoeken doorsturenItaliaans36 van 36

Per soort bedrijf

De taken die één soort bedrijf aan AI zou geven, naast elkaar, met het resultaat van elk model per taak.

Beste AI-model voor accountantskantoren
6 taken: een Italiaans bankafschrift categoriseren, banktransacties categoriseren, factuurgegevens extraheren, gegevens uit Italiaanse leveranciersfacturen halen, Italiaanse facturen van zelfstandige professionals berekenen en overwerkvergoeding berekenen.
Beste AI-model voor restaurants en cafés
4 taken: op negatieve reviews reageren, een zakelijke inbox triëren, banktransacties categoriseren en een Italiaans bankafschrift categoriseren.
Beste AI-model voor winkels
4 taken: terugbetalingsverzoeken beantwoorden, Italiaanse garantieclaims beantwoorden, Italiaanse productbeschrijvingen schrijven en vergadernotulen schrijven.
Beste AI-model voor vakbedrijven en dienstverleners
6 taken: een opdracht prijzen op basis van een prijslijst, offertemails schrijven, salesleads beoordelen, klantberichten doorsturen, overwerkvergoeding berekenen en vragen over het personeelshandboek beantwoorden.

Hoe we beoordelen

Elk model krijgt dezelfde instructies en hetzelfde materiaal, geeft één antwoord per poging en krijgt een oordeel dat niet afhangt van hoe overtuigend het antwoord klinkt.

Geslaagd of gezakt
Een antwoord slaagt alleen als het aan alle vaste controles voldoet. Bij taken met een rubric moet het ook aan de meeste criteria daarvan voldoen. De belangrijkste criteria zijn verplicht. Deelpunten zijn er niet.
Vaste controles
Gestructureerde antwoorden worden veld voor veld vergeleken met de juiste waarden, met een tolerantie voor bedragen en uren. Schriftelijke antwoorden worden gecontroleerd op wat erin moet staan, wat er niet in mag staan en hoe lang ze mogen zijn. Dezelfde code beoordeelt elk model.
De rubricbeoordelaar
gpt-5-6-sol beoordeelt elk rubriccriterium bij een temperatuur van nul en geeft er een reden bij. Elk antwoord wordt twee keer beoordeeld. Bij verschil van mening over een criterium geeft een derde beoordeling de doorslag. Het eindoordeel van de beoordelaar wordt genegeerd: de code past de slaagregel toe op de beoordeelde criteria. Vooraf is de beoordelaar twee keer getest op antwoorden waarvan het oordeel bekend is.
Eén protocol
Elke poging bestaat uit één instructiebericht en één bericht met het materiaal: geen tools, geen zoekopdracht op internet, geen JSON-modus, de standaardinstellingen voor sampling van elk model en maximaal 4,000 outputtokens, inclusief redenering. Een antwoord dat bij die limiet wordt afgebroken, wordt beoordeeld zoals het er dan staat. Elk model voert elke taak 1 keer uit.
Gecontroleerde regels
Voordat een editie wordt gepubliceerd, lezen we elke afwijzing op basis van een beslissende regel na. Als een regel een correct antwoord afkeurt omdat een detail ontbreekt waar de instructies niet om vroegen, passen we de regel aan en beoordelen we die antwoorden opnieuw. Een regel die een echte fout opspoort, blijft staan, ongeacht hoeveel modellen daardoor zakken.
Kosten en tijd
Een poging kost wat de aanbieder ervoor in rekening heeft gebracht. Als de aanbieder geen kosten meldt, berekenen we de kosten op basis van het aantal tokens en de catalogusprijs van de maker. De tijd loopt van het verzoek tot het laatste woord van het antwoord. Mislukte aanroepen tellen niet mee.
Intervallen
Bij elk slagingspercentage staat een Wilson-interval van 95%. Met enkele tientallen pogingen per model kan een verschil van meerdere procentpunten tussen twee modellen toeval zijn. Dat laten de balken zien.
De gegevens
Taken, controles en resultaten zijn gepubliceerd onder CC BY 4.0: vermeld AIGROW als bron en link naar deze pagina. Elke taakpagina bevat de kanariestring van deze editie, zodat de taken uit trainingsdatasets gehouden kunnen worden.

Zet de modellen die slagen aan het werk

Een AIGROW-agent doet dit soort werk binnen je eigen tools, volgens regels die je schriftelijk goedkeurt. Wil je de modellen zelf gebruiken, dan kost API-tegoed een kwart van de catalogusprijs.

Editie van oktober 2026, pilot