36 modeli AI sprawdzone na 20 rzeczywistych zadaniach małych firm
Faktury, oferty, grafiki pracy, odpowiedzi na opinie i porządkowanie skrzynki odbiorczej. W każdym zadaniu kryje się pułapka, w którą łatwo wpaść. Każda odpowiedź jest oceniana w całości: zaliczona albo nie. Podajemy też koszt każdego zaliczenia.
Pilotaż: 20 z 40 zadań tej edycji, 1 uruchomienie na model.
- Modele
- 36
- Zadania
- 20 z 40
- Przejścia
- 720
- Ocena według kryteriów
- Skalibrowana
Test przeprowadzono w październik 2026. Dane na licencji CC BY 4.0.
W benchmarku AIGROW dla małych firm 36 modeli AI otrzymuje 20 codziennych zadań biurowych. Każda odpowiedź jest oceniana jako zaliczona lub niezaliczona według pisemnych kryteriów. W edycji z październik 2026 3 modele zajęli ex aequo pierwsze miejsce z wynikiem 95%, a gpt-oss-120b osiągnął najniższy koszt zaliczenia: $0.422 za tysiąc. Publikujemy każde zadanie, każdy test i każdy wynik.
Wnioski
Co pokazuje edycja październik 2026 i na ile pewne są jej wyniki.
Qwen3.8 Flash, Kimi K3 i Gemini 3.1 Pro (preview) modeli zaliczyło po 95% swoich prób, co jest najwyższym wynikiem w tej edycji.
Przedziały ufności 95% kolejnych 6 modeli (kolejnych) sięgają tego wyniku. Przy 20 uruchomieniach na model nie da się odróżnić ich wyników od wyniku modelu lidera. Słupki w rankingu pokazują, jak bardzo może zmienić się pozycja każdego modelu.
Tysiąc zaliczeń kosztuje od $0.422 do $33.11, co oznacza 78× różnicy.
Najtańsze zaliczenia zapewnił gpt-oss-120b, a najdroższe Claude Fable 5.1. Model, który często nie zalicza prób, ponosi tu koszt tych niepowodzeń, ponieważ do obliczeń wliczono każdą jego próbę.
Najtrudniejsze zadanie to Odpowiedz publicznie na negatywną opinię o restauracji, nie ujawniając prywatnych informacji: zaliczono 22% prób.
Zadanie (język: angielski, kategoria: odpowiedzi na opinie). Na jego stronie opisano pułapki i kryteria, których większość modeli nie spełniła.
Zadania po włosku zaliczono w 83% prób, a zadania po angielsku w 65%.
Zadania po włosku napisano specjalnie dla włoskich firm, z uwzględnieniem miejscowych przepisów podatkowych i zasad oznakowania. Nie są tłumaczeniami zadań angielskich. Różnica w wynikach odzwierciedla więc zarówno język, jak i poziom trudności.
Mediana czasu odpowiedzi wyniosła od 1.2 s dla Gemini 3.5 Flash-Lite do 43 s dla Qwen3.8 Max.
Czas mierzono od wysłania żądania do ostatniego słowa odpowiedzi, bez nieudanych wywołań. Kolumna p90 pokazuje długi czas oczekiwania, z którym może zetknąć się klient.
Ranking
Wszystkie modele w każdym zadaniu, uszeregowane według częstotliwości zaliczeń. Posortuj według kosztu, by sprawdzić cenę zaliczenia, albo według czasu, by zobaczyć, który model odpowiada najszybciej.
Najpierw najwyższy wskaźnik zaliczeń.
| # | Model | Odsetek zaliczonych prób | Na 1,000 zaliczeń | Mediana | p90 | Angielski | Włoski |
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.8 FlashAlibaba (Qwen) | 95% przedział: od 76 do 99% | $1.09 | 29 s | 44 s | 92% | 100% |
| 1 | Kimi K3Moonshot AI · otwarte wagi | 95% przedział: od 76 do 99% | $18.44 | 15 s | 78 s | 100% | 86% |
| 1 | Gemini 3.1 Pro (preview)Google | 95% przedział: od 76 do 99% | $29.67 | 17 s | 21 s | 92% | 100% |
| 4 | GLM-5.3-FlashZ.ai · otwarte wagi | 95% przedział: od 70 do 97% | $0.831 | 15 s | 31 s | 92% | 86% |
| 4 | DeepSeek V4.1 FlashDeepSeek · otwarte wagi | 95% przedział: od 70 do 97% | $1.05 | 14 s | 127 s | 85% | 100% |
| 4 | DeepSeek V4 ProDeepSeek · otwarte wagi | 95% przedział: od 70 do 97% | $5.14 | 21 s | 49 s | 85% | 100% |
| 4 | GLM-5.3Z.ai · otwarte wagi | 95% przedział: od 70 do 97% | $7.02 | 9.2 s | 31 s | 92% | 86% |
| 4 | Gemini 3.8 FlashGoogle | 95% przedział: od 70 do 97% | $7.17 | 11 s | 16 s | 85% | 100% |
| 4 | Grok 4.7xAI | 95% przedział: od 70 do 97% | $9.41 | 17 s | 27 s | 92% | 86% |
| 10 | Qwen3.7 PlusAlibaba (Qwen) | 95% przedział: od 64 do 95% | $3.58 | 29 s | 41 s | 77% | 100% |
| 10 | Claude Sonnet 5Anthropic | 95% przedział: od 64 do 95% | $6.70* | 25 s | 51 s | 77% | 100% |
| 10 | GPT-5.6 SolOpenAI | 95% przedział: od 64 do 95% | $11.33* | 27 s | 37 s | 77% | 100% |
| 10 | Qwen3.8 MaxAlibaba (Qwen) | 95% przedział: od 64 do 95% | $16.32 | 43 s | 82 s | 77% | 100% |
| 10 | Claude Opus 5Anthropic | 95% przedział: od 64 do 95% | $16.89* | 27 s | 83 s | 77% | 100% |
| 10 | GPT-5.5OpenAI | 95% przedział: od 64 do 95% | $17.02* | 22 s | 34 s | 77% | 100% |
| 10 | GPT-6 AstraOpenAI | 95% przedział: od 64 do 95% | $27.91* | 11 s | 38 s | 77% | 100% |
| 10 | Claude Fable 5.1Anthropic | 95% przedział: od 64 do 95% | $33.11* | 26 s | 51 s | 77% | 100% |
| 18 | GPT-5.6 LunaOpenAI | 95% przedział: od 58 do 92% | $0.677* | 28 s | 34 s | 69% | 100% |
| 18 | Muse Glimmer 30BMeta · otwarte wagi | 95% przedział: od 58 do 92% | $3.10 | 13 s | 27 s | 69% | 100% |
| 18 | Grok 4.3xAI | 95% przedział: od 58 do 92% | $4.10 | 7.4 s | 9.7 s | 77% | 86% |
| 18 | GPT-5.6 TerraOpenAI | 95% przedział: od 58 do 92% | $6.68* | 29 s | 36 s | 69% | 100% |
| 18 | Qwen3.8 27BAlibaba (Qwen) · otwarte wagi | 95% przedział: od 58 do 92% | $7.30 | 43 s | 89 s | 77% | 86% |
| 23 | gpt-oss-120bOpenAI · otwarte wagi | 95% przedział: od 53 do 89% | $0.422 | 33 s | 69 s | 77% | 71% |
| 23 | MiniMax M3MiniMax · otwarte wagi | 95% przedział: od 53 do 89% | $1.82 | 6.4 s | 45 s | 77% | 71% |
| 23 | Claude Sonnet 4.6Anthropic | 95% przedział: od 53 do 89% | $11.24* | 28 s | 54 s | 62% | 100% |
| 23 | Kimi K2.6Moonshot AI · otwarte wagi | 95% przedział: od 53 do 89% | $11.68 | 28 s | 73 s | 69% | 86% |
| 27 | Gemma 4 31BGoogle · otwarte wagi | 95% przedział: od 39 do 78% | $0.558 | 11 s | 36 s | 46% | 86% |
| 28 | Llama 4 MaverickMeta · otwarte wagi | 95% przedział: od 26 do 66% | $0.665 | 14 s | 21 s | 38% | 57% |
| 28 | Gemini 3.1 Flash-LiteGoogle | 95% przedział: od 26 do 66% | $1.41 | 1.7 s | 3.2 s | 38% | 57% |
| 30 | GPT-5.4 miniOpenAI | 95% przedział: od 22 do 61% | $3.35 | 1.7 s | 2.3 s | 23% | 71% |
| 30 | Mistral Medium 3.5Mistral · otwarte wagi | 95% przedział: od 22 do 61% | $7.40 | 1.6 s | 2.3 s | 38% | 43% |
| 32 | Gemini 3.5 Flash-LiteGoogle | 95% przedział: od 18 do 57% | $2.47 | 1.2 s | 1.5 s | 23% | 57% |
| 32 | Claude Haiku 4.5Anthropic | 95% przedział: od 18 do 57% | $6.62 | 2.5 s | 3.4 s | 23% | 57% |
| 34 | GPT-5.4 nanoOpenAI | 95% przedział: od 15 do 52% | $1.51 | 2.7 s | 3.8 s | 23% | 43% |
| 35 | Ministral 3 14BMistral · otwarte wagi | 95% przedział: od 8 do 42% | $1.07 | 3.9 s | 5.4 s | 8% | 43% |
| 35 | Mistral Small 4Mistral · otwarte wagi | 95% przedział: od 8 do 42% | $1.33 | 2.0 s | 20 s | 15% | 29% |
Wskaźnik zaliczeń to odsetek zaliczonych prób. Pod nim pokazano 95% przedział: rzeczywisty wskaźnik modelu może leżeć w dowolnym miejscu tego zakresu. Koszt zaliczenia to koszt wszystkich prób, także nieudanych, podzielony przez liczbę zaliczonych prób. Gwiazdka oznacza koszt obliczony według ceny katalogowej producenta, gdy dostawca nie podał kosztu.
Według rodzaju pracy
Odsetek zaliczonych prób dla każdego rodzaju zadania, liczony dla wszystkich modeli, oraz modele, które zaliczały je najczęściej.
| Rodzaj zadania | Zadania | Zaliczone próby | Najczęściej zaliczały |
|---|---|---|---|
| Kierowanie zgłoszeń | 2 | 96% | 33 modele z wynikiem 100% |
| Odczytywanie danych z faktur | 2 | 90% | 29 modeli z wynikiem 100% |
| Sortowanie wiadomości e-mail | 1 | 83% | 30 modeli z wynikiem 100% |
| Podsumowania spotkań | 1 | 83% | 30 modeli z wynikiem 100% |
| Obliczenia biznesowe | 2 | 76% | 19 modeli z wynikiem 100% |
| Kwalifikacja leadów | 1 | 72% | 26 modeli z wynikiem 100% |
| Księgowość | 2 | 71% | 24 modele z wynikiem 100% |
| Umawianie wizyt | 2 | 69% | 21 modeli z wynikiem 100% |
| Pytania dotyczące zasad | 1 | 69% | 25 modeli z wynikiem 100% |
| Obsługa klienta | 2 | 67% | 17 modeli z wynikiem 100% |
| Opisy produktów | 1 | 58% | 21 modeli z wynikiem 100% |
| Wyceny | 2 | 51% | 9 modeli z wynikiem 100% |
| Odpowiedzi na opinie | 1 | 22% | 8 modeli z wynikiem 100% |
Zadania
Od najtrudniejszych. Na stronie każdego zadania znajdziesz jego treść w postaci przekazanej modelom, ukryte w nim pułapki, wszystkie kryteria oceny opisane słowami oraz błędy popełnione przez każdy model.
Według rodzaju firmy
Zadania, które firma danego rodzaju powierzyłaby AI, zestawione obok siebie wraz z wynikiem każdego modelu.
- Najlepszy model AI dla biur rachunkowych
- 6 zadań. Zakres: kategoryzowanie pozycji na włoskim wyciągu bankowym, kategoryzowanie transakcji bankowych, wyodrębnianie danych z faktur, wyodrębnianie danych z włoskich faktur od dostawców, obliczanie kwot na włoskich fakturach wystawianych przez specjalistów i obliczanie wynagrodzenia za nadgodziny.
- Najlepszy model AI dla restauracji i barów
- 4 zadania. Zakres: odpowiadanie na negatywne opinie, sortowanie wiadomości w firmowej skrzynce odbiorczej, kategoryzowanie transakcji bankowych i kategoryzowanie pozycji na włoskim wyciągu bankowym.
- Najlepszy model AI dla sklepów
- 4 zadania. Zakres: odpowiadanie na prośby o zwrot pieniędzy, odpowiadanie na zgłoszenia gwarancyjne po włosku, pisanie opisów produktów po włosku i sporządzanie protokołów ze spotkań.
- Najlepszy model AI dla firm usługowych i wykonawców
- 6 zadań. Zakres: wycena zlecenia na podstawie cennika, pisanie e-maili z ofertą cenową, ocena leadów sprzedażowych, kierowanie wiadomości od klientów, obliczanie wynagrodzenia za nadgodziny i odpowiadanie na pytania dotyczące podręcznika pracownika.
Jak oceniamy
Każdy model dostaje te same instrukcje i materiały. Jedna próba to jedna odpowiedź, a jej ocena nie zależy od tego, jak dobrze brzmi.
- Zaliczone albo nie
- Odpowiedź jest zaliczona tylko wtedy, gdy przejdzie wszystkie stałe kontrole. W zadaniach ocenianych również według kryteriów musi ponadto spełnić większość z nich, w tym wszystkie obowiązkowe. Nie przyznajemy punktów za częściowo poprawne odpowiedzi.
- Stałe kontrole
- Odpowiedzi ustrukturyzowane sprawdzamy pole po polu względem prawidłowych wartości, z dopuszczalnym odchyleniem dla kwot i godzin. W odpowiedziach pisemnych sprawdzamy, co musi się w nich znaleźć, czego nie wolno w nich napisać i jak długie mogą być. Wszystkie modele ocenia ten sam kod.
- Ocena według kryteriów
- Kryteria ocenia gpt-5-6-sol przy temperaturze zero, podając uzasadnienie dla każdego z nich. Każda odpowiedź jest oceniana dwukrotnie, a przy rozbieżności w danym kryterium rozstrzyga trzecia ocena. Werdykt samego modelu jest pomijany: o zaliczeniu decyduje kod na podstawie ocenionych kryteriów. Przed rozpoczęciem testu model oceniający został dwukrotnie sprawdzony na odpowiedziach o znanym wyniku.
- Jeden protokół
- Każda próba obejmuje jedną wiadomość z instrukcją i jedną z materiałem: bez narzędzi, wyszukiwania w internecie i trybu JSON. Każdy model korzysta z domyślnych ustawień próbkowania i może wygenerować do 4,000 tokenów, łącznie z rozumowaniem. Odpowiedź ucięta na tym limicie jest oceniana w zastanej postaci. Na każde zadanie przypada 1 próba każdego modelu.
- Sprawdzone zasady oceny
- Przed publikacją edycji analizujemy każdy przypadek niezaliczenia wynikający z zasady rozstrzygającej o wyniku. Jeśli zasada odrzuca poprawną odpowiedź za brak szczegółu, którego nie wymagano w instrukcjach, poprawiamy ją i ponownie oceniamy te odpowiedzi. Zasada wychwytująca rzeczywisty błąd pozostaje, niezależnie od tego, ile modeli przez nią nie zaliczyło.
- Koszt i czas
- Koszt próby to kwota naliczona przez dostawcę albo, jeśli dostawca nie podaje kosztu, koszt tokenów według cennika producenta. Czas mierzymy od wysłania żądania do ostatniego słowa odpowiedzi. Nie uwzględniamy wywołań zakończonych błędem.
- Przedziały
- Przy każdym odsetku zaliczeń podajemy 95% przedział Wilsona. Gdy model ma za sobą zaledwie kilkadziesiąt prób, różnica kilku punktów między dwoma modelami może wynikać z przypadku. Przedziały pokazują tę niepewność.
- Dane
- Zadania, kontrole i wyniki publikujemy na licencji CC BY 4.0. Cytując je, podaj AIGROW i link do tej strony. Strona każdego zadania zawiera ciąg kontrolny tej edycji, który pomaga wykluczyć zadania ze zbiorów treningowych.
Daj pracę modelom, które zaliczają test
Agent AIGROW wykonuje takie zadania w twoich narzędziach, zgodnie z zasadami, które zatwierdzisz na piśmie. Jeśli chcesz samodzielnie uruchamiać modele, środki na API kosztują jedną czwartą ceny katalogowej.
Edycja październik 2026, pilotaż