36 KI-Modelle im Test mit 20 echten Aufgaben kleiner Unternehmen
Rechnungen, Angebote, Dienstpläne, Antworten auf Bewertungen und die Sichtung des Posteingangs: Jede Aufgabe enthält eine Falle, in die eine unachtsame Antwort tappt. Jede Antwort besteht oder scheitert als Ganzes, und für jedes Bestehen werden die Kosten berechnet.
Pilotstudie: 20 der 40 Aufgaben dieser Ausgabe, 1 Durchläufe pro Modell.
- Modelle
- 36
- Aufgaben
- 20 von 40
- Durchläufe
- 720
- Bewertung anhand von Kriterien
- Kalibriert
Durchgeführt im Oktober 2026. Daten unter CC BY 4.0.
Der AIGROW Benchmark für kleine Unternehmen stellt 36 KI-Modelle vor 20 alltägliche Büroaufgaben und bewertet jede Antwort anhand schriftlich festgelegter Prüfkriterien als bestanden oder nicht bestanden. In der Ausgabe vom Oktober 2026 lagen 3 Modelle mit 95% gemeinsam vorn. Die günstigsten erfolgreichen Durchläufe lieferte gpt-oss-120b für $0.422 pro tausend. Jede Aufgabe, jede Prüfung und jedes Ergebnis wird veröffentlicht.
Ergebnisse
Was die Ausgabe vom Oktober 2026 zeigt und wie belastbar die Ergebnisse sind.
Qwen3.8 Flash, Kimi K3 und Gemini 3.1 Pro (preview) bestanden jeweils 95% ihrer Durchläufe, die höchste Quote dieser Ausgabe.
Die 95-%-Intervalle von 6 weitere Modellen reichen bis zu dieser Quote. Bei 20 Durchläufen pro Modell lassen sie sich nicht von dem Spitzenmodell unterscheiden. Die Balken in der Rangliste zeigen, wie groß die Unsicherheit jeweils ist.
1.000 bestandene Durchläufe kosten zwischen $0.422 und $33.11, ein Unterschied um den Faktor 78×.
gpt-oss-120b erzielte die günstigsten bestandenen Durchläufe, Claude Fable 5.1 die teuersten. Wer häufig scheitert, trägt hier auch die Kosten dieser Fehlversuche, denn jeder Durchlauf fließt in die Berechnung ein.
Antworten Sie öffentlich auf eine negative Restaurantbewertung, ohne private Angaben preiszugeben war die schwierigste Aufgabe: 22% der Durchläufe bestanden.
Eine Aufgabe aus der Kategorie Auf Bewertungen antworten in der Sprache Englisch. Auf der zugehörigen Seite stehen die Fallstricke und die Prüfkriterien, an denen die meisten Modelle gescheitert sind.
Bei den italienischen Aufgaben bestanden 83% der Durchläufe, bei den englischen 65%.
Die italienischen Aufgaben sind eigenständige Aufgaben für italienische Unternehmen mit italienischen Steuer- und Kennzeichnungsvorschriften, keine Übersetzungen der englischen Aufgaben. Der Unterschied spiegelt sowohl die Sprache als auch den Schwierigkeitsgrad wider.
Die mediane Antwortzeit reichte von 1.2 s bei Gemini 3.5 Flash-Lite bis 43 s bei Qwen3.8 Max.
Gemessen wurde vom Absenden der Anfrage bis zum letzten Wort der Antwort. Fehlgeschlagene Aufrufe wurden nicht berücksichtigt. Die Spalte p90 zeigt, wie lange Kunden bei langsameren Antworten warten müssten.
Die Rangliste
Jedes Modell bei jeder Aufgabe, sortiert danach, wie oft seine Antwort bestanden hat. Sortieren Sie nach Kosten, um den Preis pro bestandener Antwort zu sehen, oder nach Geschwindigkeit, um zu sehen, wer zuerst antwortet.
Höchste Erfolgsquote zuerst.
| # | Modell | Erfolgsquote | Pro 1.000 bestandene Durchläufe | Median | p90 | Englisch | Italienisch |
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.8 FlashAlibaba (Qwen) | 95-%-Intervall: 76 bis 99 % | $1.09 | 29 s | 44 s | 92% | 100% |
| 1 | Kimi K3Moonshot AI · offene Modellgewichte | 95-%-Intervall: 76 bis 99 % | $18.44 | 15 s | 78 s | 100% | 86% |
| 1 | Gemini 3.1 Pro (preview)Google | 95-%-Intervall: 76 bis 99 % | $29.67 | 17 s | 21 s | 92% | 100% |
| 4 | GLM-5.3-FlashZ.ai · offene Modellgewichte | 95-%-Intervall: 70 bis 97 % | $0.831 | 15 s | 31 s | 92% | 86% |
| 4 | DeepSeek V4.1 FlashDeepSeek · offene Modellgewichte | 95-%-Intervall: 70 bis 97 % | $1.05 | 14 s | 127 s | 85% | 100% |
| 4 | DeepSeek V4 ProDeepSeek · offene Modellgewichte | 95-%-Intervall: 70 bis 97 % | $5.14 | 21 s | 49 s | 85% | 100% |
| 4 | GLM-5.3Z.ai · offene Modellgewichte | 95-%-Intervall: 70 bis 97 % | $7.02 | 9.2 s | 31 s | 92% | 86% |
| 4 | Gemini 3.8 FlashGoogle | 95-%-Intervall: 70 bis 97 % | $7.17 | 11 s | 16 s | 85% | 100% |
| 4 | Grok 4.7xAI | 95-%-Intervall: 70 bis 97 % | $9.41 | 17 s | 27 s | 92% | 86% |
| 10 | Qwen3.7 PlusAlibaba (Qwen) | 95-%-Intervall: 64 bis 95 % | $3.58 | 29 s | 41 s | 77% | 100% |
| 10 | Claude Sonnet 5Anthropic | 95-%-Intervall: 64 bis 95 % | $6.70* | 25 s | 51 s | 77% | 100% |
| 10 | GPT-5.6 SolOpenAI | 95-%-Intervall: 64 bis 95 % | $11.33* | 27 s | 37 s | 77% | 100% |
| 10 | Qwen3.8 MaxAlibaba (Qwen) | 95-%-Intervall: 64 bis 95 % | $16.32 | 43 s | 82 s | 77% | 100% |
| 10 | Claude Opus 5Anthropic | 95-%-Intervall: 64 bis 95 % | $16.89* | 27 s | 83 s | 77% | 100% |
| 10 | GPT-5.5OpenAI | 95-%-Intervall: 64 bis 95 % | $17.02* | 22 s | 34 s | 77% | 100% |
| 10 | GPT-6 AstraOpenAI | 95-%-Intervall: 64 bis 95 % | $27.91* | 11 s | 38 s | 77% | 100% |
| 10 | Claude Fable 5.1Anthropic | 95-%-Intervall: 64 bis 95 % | $33.11* | 26 s | 51 s | 77% | 100% |
| 18 | GPT-5.6 LunaOpenAI | 95-%-Intervall: 58 bis 92 % | $0.677* | 28 s | 34 s | 69% | 100% |
| 18 | Muse Glimmer 30BMeta · offene Modellgewichte | 95-%-Intervall: 58 bis 92 % | $3.10 | 13 s | 27 s | 69% | 100% |
| 18 | Grok 4.3xAI | 95-%-Intervall: 58 bis 92 % | $4.10 | 7.4 s | 9.7 s | 77% | 86% |
| 18 | GPT-5.6 TerraOpenAI | 95-%-Intervall: 58 bis 92 % | $6.68* | 29 s | 36 s | 69% | 100% |
| 18 | Qwen3.8 27BAlibaba (Qwen) · offene Modellgewichte | 95-%-Intervall: 58 bis 92 % | $7.30 | 43 s | 89 s | 77% | 86% |
| 23 | gpt-oss-120bOpenAI · offene Modellgewichte | 95-%-Intervall: 53 bis 89 % | $0.422 | 33 s | 69 s | 77% | 71% |
| 23 | MiniMax M3MiniMax · offene Modellgewichte | 95-%-Intervall: 53 bis 89 % | $1.82 | 6.4 s | 45 s | 77% | 71% |
| 23 | Claude Sonnet 4.6Anthropic | 95-%-Intervall: 53 bis 89 % | $11.24* | 28 s | 54 s | 62% | 100% |
| 23 | Kimi K2.6Moonshot AI · offene Modellgewichte | 95-%-Intervall: 53 bis 89 % | $11.68 | 28 s | 73 s | 69% | 86% |
| 27 | Gemma 4 31BGoogle · offene Modellgewichte | 95-%-Intervall: 39 bis 78 % | $0.558 | 11 s | 36 s | 46% | 86% |
| 28 | Llama 4 MaverickMeta · offene Modellgewichte | 95-%-Intervall: 26 bis 66 % | $0.665 | 14 s | 21 s | 38% | 57% |
| 28 | Gemini 3.1 Flash-LiteGoogle | 95-%-Intervall: 26 bis 66 % | $1.41 | 1.7 s | 3.2 s | 38% | 57% |
| 30 | GPT-5.4 miniOpenAI | 95-%-Intervall: 22 bis 61 % | $3.35 | 1.7 s | 2.3 s | 23% | 71% |
| 30 | Mistral Medium 3.5Mistral · offene Modellgewichte | 95-%-Intervall: 22 bis 61 % | $7.40 | 1.6 s | 2.3 s | 38% | 43% |
| 32 | Gemini 3.5 Flash-LiteGoogle | 95-%-Intervall: 18 bis 57 % | $2.47 | 1.2 s | 1.5 s | 23% | 57% |
| 32 | Claude Haiku 4.5Anthropic | 95-%-Intervall: 18 bis 57 % | $6.62 | 2.5 s | 3.4 s | 23% | 57% |
| 34 | GPT-5.4 nanoOpenAI | 95-%-Intervall: 15 bis 52 % | $1.51 | 2.7 s | 3.8 s | 23% | 43% |
| 35 | Ministral 3 14BMistral · offene Modellgewichte | 95-%-Intervall: 8 bis 42 % | $1.07 | 3.9 s | 5.4 s | 8% | 43% |
| 35 | Mistral Small 4Mistral · offene Modellgewichte | 95-%-Intervall: 8 bis 42 % | $1.33 | 2.0 s | 20 s | 15% | 29% |
Die Erfolgsquote ist der Anteil bestandener Durchläufe. Darunter zeigt ein Balken das 95-%-Intervall: Die tatsächliche Erfolgsquote eines Modells könnte irgendwo innerhalb dieses Balkens liegen. Für die Kosten pro bestandenem Durchlauf werden die Kosten aller Durchläufe, einschließlich der fehlgeschlagenen, durch die Zahl der bestandenen Durchläufe geteilt. Ein Sternchen kennzeichnet Kosten, die anhand des Listenpreises des Anbieters berechnet wurden, weil der Provider keine Kosten gemeldet hat.
Nach Art der Arbeit
Der Anteil bestandener Durchläufe je Aufgabenart über alle Modelle hinweg und die Modelle, die dabei am häufigsten bestanden haben.
| Aufgabenart | Aufgaben | Bestandene Durchläufe | Am häufigsten bestanden |
|---|---|---|---|
| Anfragen weiterleiten | 2 | 96% | 33 Modelle mit 100% |
| Rechnungsdaten extrahieren | 2 | 90% | 29 Modelle mit 100% |
| E-Mails sortieren | 1 | 83% | 30 Modelle mit 100% |
| Besprechungen zusammenfassen | 1 | 83% | 30 Modelle mit 100% |
| Betriebliche Berechnungen | 2 | 76% | 19 Modelle mit 100% |
| Leads qualifizieren | 1 | 72% | 26 Modelle mit 100% |
| Buchhaltung | 2 | 71% | 24 Modelle mit 100% |
| Terminplanung | 2 | 69% | 21 Modelle mit 100% |
| Fragen zu Richtlinien | 1 | 69% | 25 Modelle mit 100% |
| Kundensupport | 2 | 67% | 17 Modelle mit 100% |
| Produktbeschreibungen | 1 | 58% | 21 Modelle mit 100% |
| Angebote | 2 | 51% | 9 Modelle mit 100% |
| Auf Bewertungen antworten | 1 | 22% | 8 Modelle mit 100% |
Die Aufgaben
Die schwierigsten zuerst. Jede Seite zeigt die Aufgabe, wie die Modelle sie gesehen haben, ihre Fallstricke, alle Prüfkriterien im Wortlaut und die Fehler der einzelnen Modelle.
Nach Unternehmensart
Die Aufgaben, die eine bestimmte Art von Unternehmen an KI übertragen würde, nebeneinander mit den Ergebnissen aller Modelle für jede Aufgabe.
- Bestes KI-Modell für Steuerberatungs- und Buchhaltungsfirmen
- 6 Aufgaben: einen italienischen Kontoauszug kategorisieren, Banktransaktionen kategorisieren, Rechnungsdaten extrahieren, Daten aus italienischen Lieferantenrechnungen extrahieren, italienische Freiberuflerrechnungen berechnen und Überstundenvergütung berechnen.
- Bestes KI-Modell für Restaurants und Bars
- 4 Aufgaben: auf negative Bewertungen antworten, einen geschäftlichen Posteingang vorsortieren, Banktransaktionen kategorisieren und einen italienischen Kontoauszug kategorisieren.
- Bestes KI-Modell für Geschäfte
- 4 Aufgaben: Erstattungsanfragen beantworten, Gewährleistungsansprüche auf Italienisch beantworten, italienische Produktbeschreibungen schreiben und Besprechungsprotokolle schreiben.
- Bestes KI-Modell für Handwerks- und Dienstleistungsbetriebe
- 6 Aufgaben: einen Auftrag anhand einer Preisliste kalkulieren, Angebots-E-Mails schreiben, Vertriebsleads bewerten, Kundennachrichten zuordnen, Überstundenvergütung berechnen und Fragen zum Mitarbeiterhandbuch beantworten.
So wird bewertet
Für jedes Modell gelten dieselben Anweisungen und dasselbe Material. Jeder Durchlauf liefert eine Antwort und ein Urteil, das nicht davon abhängt, wie überzeugend die Antwort klingt.
- Bestanden oder nicht bestanden
- Eine Antwort besteht nur, wenn sie alle festen Prüfkriterien erfüllt. Bei Aufgaben mit zusätzlichen Bewertungskriterien muss sie außerdem die meisten davon erfüllen. Die wichtigsten Kriterien sind zwingend. Teilpunkte gibt es nicht.
- Feste Prüfkriterien
- Strukturierte Antworten werden Feld für Feld mit den richtigen Werten abgeglichen, bei Geldbeträgen und Stunden mit einer Toleranz. Schriftliche Antworten werden darauf geprüft, was sie enthalten müssen, was sie nicht enthalten dürfen und wie lang sie sein dürfen. Derselbe Code bewertet jedes Modell.
- Bewertung anhand von Kriterien
- gpt-5-6-sol bewertet jedes Kriterium bei Temperatur null und begründet die Bewertung. Jede Antwort wird zweimal bewertet. Bei Kriterien, über die sich die beiden Bewertungen nicht einig sind, entscheidet eine dritte. Das eigene Gesamturteil des Modells wird ignoriert: Der Code wendet die Bestehensregel auf die bewerteten Kriterien an. Vor dem Testlauf wurde das Verfahren zweimal anhand von Antworten mit bekanntem Ergebnis geprüft.
- Ein einheitliches Verfahren
- Jeder Durchlauf besteht aus einer Nachricht mit Anweisungen und einer mit dem Material: keine Tools, keine Websuche, kein JSON-Modus, die Standardeinstellungen des jeweiligen Modells und bis zu 4,000 Token Ausgabe einschließlich der zum Schlussfolgern verwendeten Token. Eine Antwort, die an dieser Grenze abgeschnitten wird, wird so bewertet, wie sie vorliegt. 1 Durchläufe pro Modell und Aufgabe.
- Überprüfte Regeln
- Bevor eine Ausgabe veröffentlicht wird, wird jedes Scheitern an einer ausschlaggebenden Regel geprüft. Lässt eine Regel eine richtige Antwort scheitern, weil ein in den Anweisungen nicht verlangtes Detail fehlt, wird sie korrigiert und die betroffenen Antworten werden erneut bewertet. Eine Regel, die einen echten Fehler erkennt, bleibt bestehen, unabhängig davon, wie viele Modelle daran scheitern.
- Kosten und Zeit
- Ein Durchlauf kostet den vom Anbieter berechneten Betrag. Gibt der Anbieter keine Kosten an, werden die verbrauchten Token zum Listenpreis des Herstellers berechnet. Die Zeit wird von der Anfrage bis zum letzten Wort der Antwort gemessen; fehlgeschlagene Aufrufe werden dabei nicht berücksichtigt.
- Konfidenzintervalle
- Zu jeder Erfolgsquote gehört ein 95%-Wilson-Intervall. Bei nur wenigen Dutzend Durchläufen pro Modell kann ein Abstand von mehreren Prozentpunkten zwischen zwei Modellen Zufall sein. Die Balken machen das sichtbar.
- Die Daten
- Aufgaben, Prüfkriterien und Ergebnisse werden unter CC BY 4.0 veröffentlicht: Nennen Sie AIGROW als Quelle und verlinken Sie diese Seite. Jede Aufgabenseite enthält die Canary-Zeichenfolge der Ausgabe, damit die Aufgaben aus Trainingsdatensätzen herausgehalten werden können.
Setzen Sie die Modelle ein, die bestehen
Ein AIGROW Agent erledigt solche Aufgaben in Ihren eigenen Tools und nach Regeln, die Sie schriftlich freigeben. Wenn Sie die Modelle selbst ausführen möchten, kostet API-Guthaben ein Viertel des Listenpreises.
Ausgabe Oktober 2026, Pilotphase