Schnelle Antworten

AIGrow bietet Monitoring der KI-Sichtbarkeit, einen Business-Assistenten, Blog-Veröffentlichungen und klar abgegrenzte Automatisierungsleistungen. Starten Sie mit dem kostenlosen Scan, um das Ergebnis vor einer Zahlung zu prüfen.

Kostenlosen Scan starten

Der Scan ist kostenlos, und die Monitoring-Tarife beginnen bei $29 pro Monat. Das Betriebsaudit kostet $290, das Sichtbarkeitsaudit kostet $490. Für individuelle Umsetzungen erhalten Sie vor Beginn der Arbeit einen schriftlich mitgeteilten Preis.

Tarife ansehen

Starten Sie den kostenlosen Scan. Er liest Ihre Website aus, fragt mehrere KI-Assistenten, wonach Ihre Kunden fragen, und weist Sie auf eine Sache hin. Eine Registrierung ist nicht erforderlich, und Sie erfahren, wenn Sie uns nicht brauchen.

Jetzt starten

Ja. Nutzen Sie das Kontaktformular für Fragen zu Produkten, Abrechnung, Support oder Projekten. Beschreiben Sie das Ziel und das beteiligte System, damit die erste Antwort konkret sein kann.

AIGrow kontaktieren
Benchmark · Ausgabe Oktober 2026 · Pilotphase

36 KI-Modelle im Test mit 20 echten Aufgaben kleiner Unternehmen

Rechnungen, Angebote, Dienstpläne, Antworten auf Bewertungen und die Sichtung des Posteingangs: Jede Aufgabe enthält eine Falle, in die eine unachtsame Antwort tappt. Jede Antwort besteht oder scheitert als Ganzes, und für jedes Bestehen werden die Kosten berechnet.

Pilotstudie: 20 der 40 Aufgaben dieser Ausgabe, 1 Durchläufe pro Modell.

Höchste Erfolgsquote
95%3 Modelle gleichauf, jeweils 19 von 20 Durchläufen bestanden
Modelle
36
Aufgaben
20 von 40
Durchläufe
720
Bewertung anhand von Kriterien
Kalibriert

Durchgeführt im Oktober 2026. Daten unter CC BY 4.0.

Der AIGROW Benchmark für kleine Unternehmen stellt 36 KI-Modelle vor 20 alltägliche Büroaufgaben und bewertet jede Antwort anhand schriftlich festgelegter Prüfkriterien als bestanden oder nicht bestanden. In der Ausgabe vom Oktober 2026 lagen 3 Modelle mit 95% gemeinsam vorn. Die günstigsten erfolgreichen Durchläufe lieferte gpt-oss-120b für $0.422 pro tausend. Jede Aufgabe, jede Prüfung und jedes Ergebnis wird veröffentlicht.

Ergebnisse

Was die Ausgabe vom Oktober 2026 zeigt und wie belastbar die Ergebnisse sind.

  1. Qwen3.8 Flash, Kimi K3 und Gemini 3.1 Pro (preview) bestanden jeweils 95% ihrer Durchläufe, die höchste Quote dieser Ausgabe.

    Die 95-%-Intervalle von 6 weitere Modellen reichen bis zu dieser Quote. Bei 20 Durchläufen pro Modell lassen sie sich nicht von dem Spitzenmodell unterscheiden. Die Balken in der Rangliste zeigen, wie groß die Unsicherheit jeweils ist.

  2. 1.000 bestandene Durchläufe kosten zwischen $0.422 und $33.11, ein Unterschied um den Faktor 78×.

    gpt-oss-120b erzielte die günstigsten bestandenen Durchläufe, Claude Fable 5.1 die teuersten. Wer häufig scheitert, trägt hier auch die Kosten dieser Fehlversuche, denn jeder Durchlauf fließt in die Berechnung ein.

  3. Antworten Sie öffentlich auf eine negative Restaurantbewertung, ohne private Angaben preiszugeben war die schwierigste Aufgabe: 22% der Durchläufe bestanden.

    Eine Aufgabe aus der Kategorie Auf Bewertungen antworten in der Sprache Englisch. Auf der zugehörigen Seite stehen die Fallstricke und die Prüfkriterien, an denen die meisten Modelle gescheitert sind.

  4. Bei den italienischen Aufgaben bestanden 83% der Durchläufe, bei den englischen 65%.

    Die italienischen Aufgaben sind eigenständige Aufgaben für italienische Unternehmen mit italienischen Steuer- und Kennzeichnungsvorschriften, keine Übersetzungen der englischen Aufgaben. Der Unterschied spiegelt sowohl die Sprache als auch den Schwierigkeitsgrad wider.

  5. Die mediane Antwortzeit reichte von 1.2 s bei Gemini 3.5 Flash-Lite bis 43 s bei Qwen3.8 Max.

    Gemessen wurde vom Absenden der Anfrage bis zum letzten Wort der Antwort. Fehlgeschlagene Aufrufe wurden nicht berücksichtigt. Die Spalte p90 zeigt, wie lange Kunden bei langsameren Antworten warten müssten.

Die Rangliste

Jedes Modell bei jeder Aufgabe, sortiert danach, wie oft seine Antwort bestanden hat. Sortieren Sie nach Kosten, um den Preis pro bestandener Antwort zu sehen, oder nach Geschwindigkeit, um zu sehen, wer zuerst antwortet.

Höchste Erfolgsquote zuerst.

Erfolgsquote, Kosten pro 1.000 bestandenen Durchläufen und Antwortzeit von 36 KI-Modellen
#ModellErfolgsquotePro 1.000 bestandene DurchläufeMedianp90EnglischItalienisch
1Qwen3.8 FlashAlibaba (Qwen)95%95-%-Intervall: 76 bis 99 %$1.0929 s44 s92%100%
1Kimi K3Moonshot AI · offene Modellgewichte95%95-%-Intervall: 76 bis 99 %$18.4415 s78 s100%86%
1Gemini 3.1 Pro (preview)Google95%95-%-Intervall: 76 bis 99 %$29.6717 s21 s92%100%
4GLM-5.3-FlashZ.ai · offene Modellgewichte90%95-%-Intervall: 70 bis 97 %$0.83115 s31 s92%86%
4DeepSeek V4.1 FlashDeepSeek · offene Modellgewichte90%95-%-Intervall: 70 bis 97 %$1.0514 s127 s85%100%
4DeepSeek V4 ProDeepSeek · offene Modellgewichte90%95-%-Intervall: 70 bis 97 %$5.1421 s49 s85%100%
4GLM-5.3Z.ai · offene Modellgewichte90%95-%-Intervall: 70 bis 97 %$7.029.2 s31 s92%86%
4Gemini 3.8 FlashGoogle90%95-%-Intervall: 70 bis 97 %$7.1711 s16 s85%100%
4Grok 4.7xAI90%95-%-Intervall: 70 bis 97 %$9.4117 s27 s92%86%
10Qwen3.7 PlusAlibaba (Qwen)85%95-%-Intervall: 64 bis 95 %$3.5829 s41 s77%100%
10Claude Sonnet 5Anthropic85%95-%-Intervall: 64 bis 95 %$6.70*25 s51 s77%100%
10GPT-5.6 SolOpenAI85%95-%-Intervall: 64 bis 95 %$11.33*27 s37 s77%100%
10Qwen3.8 MaxAlibaba (Qwen)85%95-%-Intervall: 64 bis 95 %$16.3243 s82 s77%100%
10Claude Opus 5Anthropic85%95-%-Intervall: 64 bis 95 %$16.89*27 s83 s77%100%
10GPT-5.5OpenAI85%95-%-Intervall: 64 bis 95 %$17.02*22 s34 s77%100%
10GPT-6 AstraOpenAI85%95-%-Intervall: 64 bis 95 %$27.91*11 s38 s77%100%
10Claude Fable 5.1Anthropic85%95-%-Intervall: 64 bis 95 %$33.11*26 s51 s77%100%
18GPT-5.6 LunaOpenAI80%95-%-Intervall: 58 bis 92 %$0.677*28 s34 s69%100%
18Muse Glimmer 30BMeta · offene Modellgewichte80%95-%-Intervall: 58 bis 92 %$3.1013 s27 s69%100%
18Grok 4.3xAI80%95-%-Intervall: 58 bis 92 %$4.107.4 s9.7 s77%86%
18GPT-5.6 TerraOpenAI80%95-%-Intervall: 58 bis 92 %$6.68*29 s36 s69%100%
18Qwen3.8 27BAlibaba (Qwen) · offene Modellgewichte80%95-%-Intervall: 58 bis 92 %$7.3043 s89 s77%86%
23gpt-oss-120bOpenAI · offene Modellgewichte75%95-%-Intervall: 53 bis 89 %$0.42233 s69 s77%71%
23MiniMax M3MiniMax · offene Modellgewichte75%95-%-Intervall: 53 bis 89 %$1.826.4 s45 s77%71%
23Claude Sonnet 4.6Anthropic75%95-%-Intervall: 53 bis 89 %$11.24*28 s54 s62%100%
23Kimi K2.6Moonshot AI · offene Modellgewichte75%95-%-Intervall: 53 bis 89 %$11.6828 s73 s69%86%
27Gemma 4 31BGoogle · offene Modellgewichte60%95-%-Intervall: 39 bis 78 %$0.55811 s36 s46%86%
28Llama 4 MaverickMeta · offene Modellgewichte45%95-%-Intervall: 26 bis 66 %$0.66514 s21 s38%57%
28Gemini 3.1 Flash-LiteGoogle45%95-%-Intervall: 26 bis 66 %$1.411.7 s3.2 s38%57%
30GPT-5.4 miniOpenAI40%95-%-Intervall: 22 bis 61 %$3.351.7 s2.3 s23%71%
30Mistral Medium 3.5Mistral · offene Modellgewichte40%95-%-Intervall: 22 bis 61 %$7.401.6 s2.3 s38%43%
32Gemini 3.5 Flash-LiteGoogle35%95-%-Intervall: 18 bis 57 %$2.471.2 s1.5 s23%57%
32Claude Haiku 4.5Anthropic35%95-%-Intervall: 18 bis 57 %$6.622.5 s3.4 s23%57%
34GPT-5.4 nanoOpenAI30%95-%-Intervall: 15 bis 52 %$1.512.7 s3.8 s23%43%
35Ministral 3 14BMistral · offene Modellgewichte20%95-%-Intervall: 8 bis 42 %$1.073.9 s5.4 s8%43%
35Mistral Small 4Mistral · offene Modellgewichte20%95-%-Intervall: 8 bis 42 %$1.332.0 s20 s15%29%

Die Erfolgsquote ist der Anteil bestandener Durchläufe. Darunter zeigt ein Balken das 95-%-Intervall: Die tatsächliche Erfolgsquote eines Modells könnte irgendwo innerhalb dieses Balkens liegen. Für die Kosten pro bestandenem Durchlauf werden die Kosten aller Durchläufe, einschließlich der fehlgeschlagenen, durch die Zahl der bestandenen Durchläufe geteilt. Ein Sternchen kennzeichnet Kosten, die anhand des Listenpreises des Anbieters berechnet wurden, weil der Provider keine Kosten gemeldet hat.

Nach Art der Arbeit

Der Anteil bestandener Durchläufe je Aufgabenart über alle Modelle hinweg und die Modelle, die dabei am häufigsten bestanden haben.

Erfolgsquote nach Aufgabenart
AufgabenartAufgabenBestandene DurchläufeAm häufigsten bestanden
Anfragen weiterleiten296%33 Modelle mit 100%
Rechnungsdaten extrahieren290%29 Modelle mit 100%
E-Mails sortieren183%30 Modelle mit 100%
Besprechungen zusammenfassen183%30 Modelle mit 100%
Betriebliche Berechnungen276%19 Modelle mit 100%
Leads qualifizieren172%26 Modelle mit 100%
Buchhaltung271%24 Modelle mit 100%
Terminplanung269%21 Modelle mit 100%
Fragen zu Richtlinien169%25 Modelle mit 100%
Kundensupport267%17 Modelle mit 100%
Produktbeschreibungen158%21 Modelle mit 100%
Angebote251%9 Modelle mit 100%
Auf Bewertungen antworten122%8 Modelle mit 100%

Die Aufgaben

Die schwierigsten zuerst. Jede Seite zeigt die Aufgabe, wie die Modelle sie gesehen haben, ihre Fallstricke, alle Prüfkriterien im Wortlaut und die Fehler der einzelnen Modelle.

Die Aufgaben, die schwierigsten zuerst
AufgabeArtSpracheBestandene Durchläufe
Antworten Sie öffentlich auf eine negative Restaurantbewertung, ohne private Angaben preiszugebenAuf Bewertungen antwortenEnglisch8 von 36
Schreiben Sie eine E-Mail mit einem Angebot für Gartengestaltungsarbeiten, das den Wunsch nach Umsatzsteuerausweis und einen geschützten Baum berücksichtigtAngeboteEnglisch16 von 36
Antworten Sie einem Kunden, der nach Ablauf der Erstattungsfrist eine Rückerstattung verlangtKundensupportEnglisch17 von 36
Berechnen Sie den wöchentlichen Bruttolohn einer Reinigungskraft unter Berücksichtigung von Pausen, Überstunden und SonntagszuschlägenBetriebliche BerechnungenEnglisch19 von 36
Verfassen Sie eine italienische Produktbeschreibung für ein Olivenöl, die die Kennzeichnungsvorschriften einhältProduktbeschreibungenItalienisch21 von 36
Berechnen Sie den Preis für Maler- und Dekorationsarbeiten anhand der Aufmaßdaten und der PreislisteAngeboteEnglisch21 von 36
Planen Sie ein Gespräch zwischen London und New York in der Woche mit abweichender ZeitverschiebungTerminplanungEnglisch23 von 36
Den monatlichen Kontoauszug eines Cafés kategorisieren und seine Betriebskosten summierenBuchhaltungEnglisch24 von 36
Urlaubsfragen einer teilzeitbeschäftigten Person anhand des Mitarbeiterhandbuchs beantwortenFragen zu RichtlinienEnglisch25 von 36
Fünf eingehende Anfragen für Reinigungsleistungen nach den Regeln des Vertriebsteams bewertenLeads qualifizierenEnglisch26 von 36
Die Kontoauszüge einer italienischen Bar kategorisieren und die Kontobewegungen summierenBuchhaltungItalienisch27 von 36
Finden Sie auf Italienisch einen Termin zur professionellen Zahnreinigung rund um einen FeiertagTerminplanungItalienisch27 von 36
Aus einer Teambesprechung der Bäckerei Beschlüsse, Verantwortliche und Fristen festhaltenBesprechungen zusammenfassenEnglisch30 von 36
Sortieren Sie den Montagsposteingang eines Cateringunternehmens, einschließlich einer Phishing-E-Mail und einer Mitteilung über geänderte BankdatenE-Mails sortierenEnglisch30 von 36
Daten aus einer italienischen Lieferantenrechnung mit einer nicht steuerbaren Auslagenposition extrahierenRechnungsdaten extrahierenItalienisch31 von 36
Antworten Sie auf Italienisch einer Kundin, die irrtümlich glaubt, ihre Garantie sei abgelaufenKundensupportItalienisch31 von 36
Ordnen Sie zehn Nachrichten von Mietern dem richtigen Team und der richtigen Priorität zuAnfragen weiterleitenEnglisch33 von 36
Daten aus einer zweiseitigen Lieferantenrechnung für die Kreditorenbuchhaltung extrahierenRechnungsdaten extrahierenEnglisch34 von 36
Zwei italienische Honorarrechnungen mit Beitrag zur Berufskasse, IVA und Quellensteuer berechnenBetriebliche BerechnungenItalienisch36 von 36
Ordnen Sie Nachrichten von Hotelgästen auf Italienisch der richtigen Abteilung zuAnfragen weiterleitenItalienisch36 von 36

Nach Unternehmensart

Die Aufgaben, die eine bestimmte Art von Unternehmen an KI übertragen würde, nebeneinander mit den Ergebnissen aller Modelle für jede Aufgabe.

Bestes KI-Modell für Steuerberatungs- und Buchhaltungsfirmen
6 Aufgaben: einen italienischen Kontoauszug kategorisieren, Banktransaktionen kategorisieren, Rechnungsdaten extrahieren, Daten aus italienischen Lieferantenrechnungen extrahieren, italienische Freiberuflerrechnungen berechnen und Überstundenvergütung berechnen.
Bestes KI-Modell für Restaurants und Bars
4 Aufgaben: auf negative Bewertungen antworten, einen geschäftlichen Posteingang vorsortieren, Banktransaktionen kategorisieren und einen italienischen Kontoauszug kategorisieren.
Bestes KI-Modell für Geschäfte
4 Aufgaben: Erstattungsanfragen beantworten, Gewährleistungsansprüche auf Italienisch beantworten, italienische Produktbeschreibungen schreiben und Besprechungsprotokolle schreiben.
Bestes KI-Modell für Handwerks- und Dienstleistungsbetriebe
6 Aufgaben: einen Auftrag anhand einer Preisliste kalkulieren, Angebots-E-Mails schreiben, Vertriebsleads bewerten, Kundennachrichten zuordnen, Überstundenvergütung berechnen und Fragen zum Mitarbeiterhandbuch beantworten.

So wird bewertet

Für jedes Modell gelten dieselben Anweisungen und dasselbe Material. Jeder Durchlauf liefert eine Antwort und ein Urteil, das nicht davon abhängt, wie überzeugend die Antwort klingt.

Bestanden oder nicht bestanden
Eine Antwort besteht nur, wenn sie alle festen Prüfkriterien erfüllt. Bei Aufgaben mit zusätzlichen Bewertungskriterien muss sie außerdem die meisten davon erfüllen. Die wichtigsten Kriterien sind zwingend. Teilpunkte gibt es nicht.
Feste Prüfkriterien
Strukturierte Antworten werden Feld für Feld mit den richtigen Werten abgeglichen, bei Geldbeträgen und Stunden mit einer Toleranz. Schriftliche Antworten werden darauf geprüft, was sie enthalten müssen, was sie nicht enthalten dürfen und wie lang sie sein dürfen. Derselbe Code bewertet jedes Modell.
Bewertung anhand von Kriterien
gpt-5-6-sol bewertet jedes Kriterium bei Temperatur null und begründet die Bewertung. Jede Antwort wird zweimal bewertet. Bei Kriterien, über die sich die beiden Bewertungen nicht einig sind, entscheidet eine dritte. Das eigene Gesamturteil des Modells wird ignoriert: Der Code wendet die Bestehensregel auf die bewerteten Kriterien an. Vor dem Testlauf wurde das Verfahren zweimal anhand von Antworten mit bekanntem Ergebnis geprüft.
Ein einheitliches Verfahren
Jeder Durchlauf besteht aus einer Nachricht mit Anweisungen und einer mit dem Material: keine Tools, keine Websuche, kein JSON-Modus, die Standardeinstellungen des jeweiligen Modells und bis zu 4,000 Token Ausgabe einschließlich der zum Schlussfolgern verwendeten Token. Eine Antwort, die an dieser Grenze abgeschnitten wird, wird so bewertet, wie sie vorliegt. 1 Durchläufe pro Modell und Aufgabe.
Überprüfte Regeln
Bevor eine Ausgabe veröffentlicht wird, wird jedes Scheitern an einer ausschlaggebenden Regel geprüft. Lässt eine Regel eine richtige Antwort scheitern, weil ein in den Anweisungen nicht verlangtes Detail fehlt, wird sie korrigiert und die betroffenen Antworten werden erneut bewertet. Eine Regel, die einen echten Fehler erkennt, bleibt bestehen, unabhängig davon, wie viele Modelle daran scheitern.
Kosten und Zeit
Ein Durchlauf kostet den vom Anbieter berechneten Betrag. Gibt der Anbieter keine Kosten an, werden die verbrauchten Token zum Listenpreis des Herstellers berechnet. Die Zeit wird von der Anfrage bis zum letzten Wort der Antwort gemessen; fehlgeschlagene Aufrufe werden dabei nicht berücksichtigt.
Konfidenzintervalle
Zu jeder Erfolgsquote gehört ein 95%-Wilson-Intervall. Bei nur wenigen Dutzend Durchläufen pro Modell kann ein Abstand von mehreren Prozentpunkten zwischen zwei Modellen Zufall sein. Die Balken machen das sichtbar.
Die Daten
Aufgaben, Prüfkriterien und Ergebnisse werden unter CC BY 4.0 veröffentlicht: Nennen Sie AIGROW als Quelle und verlinken Sie diese Seite. Jede Aufgabenseite enthält die Canary-Zeichenfolge der Ausgabe, damit die Aufgaben aus Trainingsdatensätzen herausgehalten werden können.

Setzen Sie die Modelle ein, die bestehen

Ein AIGROW Agent erledigt solche Aufgaben in Ihren eigenen Tools und nach Regeln, die Sie schriftlich freigeben. Wenn Sie die Modelle selbst ausführen möchten, kostet API-Guthaben ein Viertel des Listenpreises.

Ausgabe Oktober 2026, Pilotphase