Bestes KI-Modell für Restaurants und Bars
Die Aufgaben des AIGROW-Benchmarks für kleine Unternehmen, die ein Restaurant oder eine Bar an KI vergeben würde, und die Ergebnisse aller 36 Modelle bei jeder Aufgabe, bewertet als bestanden oder nicht bestanden anhand schriftlich festgelegter Prüfkriterien.
Ausgabe Oktober 2026, Pilotphase, 1 Durchlauf pro Modell und Aufgabe.
- Qwen3.8 Flash
- 4 von 4
- Kimi K3
- 4 von 4
- GLM-5.3-Flash
- 4 von 4
- Claude Opus 5
- 4 von 4
- Claude Fable 5.1
- 4 von 4
- MiniMax M3
- 4 von 4
Bei Gleichstand entscheidet die bessere Bilanz über alle 20 Aufgaben hinweg.
Der AIGROW-Benchmark für kleine Unternehmen umfasst 4 Aufgaben, die ein Restaurant oder eine Bar an KI vergeben würde: auf negative Bewertungen antworten, einen geschäftlichen Posteingang vorsortieren, Banktransaktionen kategorisieren und einen italienischen Kontoauszug kategorisieren. In der Ausgabe vom Oktober 2026 bestand 6 Modelle alle 4. Unter diesen lieferte GLM-5.3-Flash die günstigsten erfolgreichen Durchläufe im gesamten Benchmark, für $0.831 pro tausend.
Alle Modelle bei diesen Aufgaben
Die meisten bestandenen Durchläufe zuerst. Bei Gleichstand entscheidet die bessere Bilanz über alle 20 Aufgaben hinweg. Die Kosten für 1.000 bestandene Durchläufe beruhen auf dem gesamten Benchmark, einschließlich fehlgeschlagener Durchläufe.
| Modell | Auf negative Bewertungen antworten | Einen geschäftlichen Posteingang vorsortieren | Banktransaktionen kategorisieren | Einen italienischen Kontoauszug kategorisieren | Bestanden | 1.000 erfolgreiche Durchläufe |
|---|---|---|---|---|---|---|
| Qwen3.8 Flash | Bestanden | Bestanden | Bestanden | Bestanden | 4 von 4 | $1.09 |
| Kimi K3 | Bestanden | Bestanden | Bestanden | Bestanden | 4 von 4 | $18.44 |
| GLM-5.3-Flash | Bestanden | Bestanden | Bestanden | Bestanden | 4 von 4 | $0.831 |
| Claude Opus 5 | Bestanden | Bestanden | Bestanden | Bestanden | 4 von 4 | $16.89 |
| Claude Fable 5.1 | Bestanden | Bestanden | Bestanden | Bestanden | 4 von 4 | $33.11 |
| MiniMax M3 | Bestanden | Bestanden | Bestanden | Bestanden | 4 von 4 | $1.82 |
| Gemini 3.1 Pro (preview) | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $29.67 |
| DeepSeek V4.1 Flash | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $1.05 |
| DeepSeek V4 Pro | Bestanden | Bestanden | Nicht bestanden | Bestanden | 3 von 4 | $5.14 |
| GLM-5.3 | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $7.02 |
| Gemini 3.8 Flash | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $7.17 |
| Grok 4.7 | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $9.41 |
| Qwen3.7 Plus | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $3.58 |
| Claude Sonnet 5 | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $6.70 |
| GPT-5.6 Sol | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $11.33 |
| Qwen3.8 Max | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $16.32 |
| GPT-5.5 | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $17.02 |
| GPT-6 Astra | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $27.91 |
| GPT-5.6 Luna | Bestanden | Bestanden | Nicht bestanden | Bestanden | 3 von 4 | $0.677 |
| Muse Glimmer 30B | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $3.10 |
| GPT-5.6 Terra | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $6.68 |
| Qwen3.8 27B | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $7.30 |
| Claude Sonnet 4.6 | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $11.24 |
| Kimi K2.6 | Nicht bestanden | Bestanden | Bestanden | Bestanden | 3 von 4 | $11.68 |
| Grok 4.3 | Nicht bestanden | Nicht bestanden | Bestanden | Bestanden | 2 von 4 | $4.10 |
| gpt-oss-120b | Nicht bestanden | Nicht bestanden | Bestanden | Bestanden | 2 von 4 | $0.422 |
| Gemma 4 31B | Nicht bestanden | Bestanden | Nicht bestanden | Nicht bestanden | 1 von 4 | $0.558 |
| Llama 4 Maverick | Nicht bestanden | Bestanden | Nicht bestanden | Nicht bestanden | 1 von 4 | $0.665 |
| Gemini 3.1 Flash-Lite | Nicht bestanden | Bestanden | Nicht bestanden | Nicht bestanden | 1 von 4 | $1.41 |
| GPT-5.4 mini | Nicht bestanden | Bestanden | Nicht bestanden | Nicht bestanden | 1 von 4 | $3.35 |
| Mistral Medium 3.5 | Nicht bestanden | Bestanden | Nicht bestanden | Nicht bestanden | 1 von 4 | $7.40 |
| Gemini 3.5 Flash-Lite | Nicht bestanden | Nicht bestanden | Nicht bestanden | Bestanden | 1 von 4 | $2.47 |
| Claude Haiku 4.5 | Nicht bestanden | Bestanden | Nicht bestanden | Nicht bestanden | 1 von 4 | $6.62 |
| GPT-5.4 nano | Nicht bestanden | Nicht bestanden | Nicht bestanden | Nicht bestanden | 0 von 4 | $1.51 |
| Ministral 3 14B | Nicht bestanden | Nicht bestanden | Nicht bestanden | Nicht bestanden | 0 von 4 | $1.07 |
| Mistral Small 4 | Nicht bestanden | Nicht bestanden | Nicht bestanden | Nicht bestanden | 0 von 4 | $1.33 |
Die Aufgaben
Jede Seite zeigt die Aufgabe so, wie die Modelle sie erhalten haben, ihre Fallstricke, alle Prüfkriterien in Worten und die Fehler jedes Modells.
- Antworten Sie öffentlich auf eine negative Restaurantbewertung, ohne private Angaben preiszugeben
- Englisch. 8 von 36 Durchläufen bestanden.
- Sortieren Sie den Montagsposteingang eines Cateringunternehmens, einschließlich einer Phishing-E-Mail und einer Mitteilung über geänderte Bankdaten
- Englisch. 30 von 36 Durchläufen bestanden.
- Den monatlichen Kontoauszug eines Cafés kategorisieren und seine Betriebskosten summieren
- Englisch. 24 von 36 Durchläufen bestanden.
- Die Kontoauszüge einer italienischen Bar kategorisieren und die Kontobewegungen summieren
- Italienisch. 27 von 36 Durchläufen bestanden.
Diese Arbeit einem Agenten übertragen
Ein AIGROW-Agent erledigt solche Aufgaben in Ihren eigenen Tools nach Regeln, die Sie schriftlich freigegeben haben. Was die Regeln nicht abdecken, gibt er zur Klärung weiter, statt zu raten.
Ausgabe Oktober 2026