Szybkie odpowiedzi

AIGrow oferuje monitorowanie widoczności w AI, asystenta biznesowego, publikowanie wpisów na blogu oraz usługi automatyzacji w ustalonym zakresie. Zacznij od bezpłatnego skanu, aby sprawdzić wynik przed dokonaniem płatności.

Uruchom bezpłatny skan

Skan jest bezpłatny, a plany monitorowania zaczynają się od $29 miesięcznie. Audyt operacyjny kosztuje $290, audyt widoczności $490, a w przypadku niestandardowych wdrożeń otrzymasz pisemną wycenę przed rozpoczęciem prac.

Zobacz plany

Uruchom bezpłatny skan. Przeanalizuje twoją stronę, zapyta kilku asystentów AI, o co pytają twoi klienci, i wskaże ci jedną rzecz. Rejestracja nie jest wymagana. Skan poinformuje cię też, jeśli nie potrzebujesz naszej pomocy.

Zacznij teraz

Tak. Skorzystaj z formularza kontaktowego w sprawach dotyczących produktu, płatności, wsparcia lub projektu. Opisz cel i system, którego dotyczy sprawa, aby pierwsza odpowiedź mogła być konkretna.

Skontaktuj się z AIGrow
Benchmark · edycja październik 2026 · pilotaż

36 modeli AI sprawdzone na 20 rzeczywistych zadaniach małych firm

Faktury, oferty, grafiki pracy, odpowiedzi na opinie i porządkowanie skrzynki odbiorczej. W każdym zadaniu kryje się pułapka, w którą łatwo wpaść. Każda odpowiedź jest oceniana w całości: zaliczona albo nie. Podajemy też koszt każdego zaliczenia.

Pilotaż: 20 z 40 zadań tej edycji, 1 uruchomienie na model.

Najwyższy odsetek zaliczeń
95%Wspólne dla 3 modeli, każdy zaliczył 19 z 20 prób
Modele
36
Zadania
20 z 40
Przejścia
720
Ocena według kryteriów
Skalibrowana

Test przeprowadzono w październik 2026. Dane na licencji CC BY 4.0.

W benchmarku AIGROW dla małych firm 36 modeli AI otrzymuje 20 codziennych zadań biurowych. Każda odpowiedź jest oceniana jako zaliczona lub niezaliczona według pisemnych kryteriów. W edycji z październik 2026 3 modele zajęli ex aequo pierwsze miejsce z wynikiem 95%, a gpt-oss-120b osiągnął najniższy koszt zaliczenia: $0.422 za tysiąc. Publikujemy każde zadanie, każdy test i każdy wynik.

Wnioski

Co pokazuje edycja październik 2026 i na ile pewne są jej wyniki.

  1. Qwen3.8 Flash, Kimi K3 i Gemini 3.1 Pro (preview) modeli zaliczyło po 95% swoich prób, co jest najwyższym wynikiem w tej edycji.

    Przedziały ufności 95% kolejnych 6 modeli (kolejnych) sięgają tego wyniku. Przy 20 uruchomieniach na model nie da się odróżnić ich wyników od wyniku modelu lidera. Słupki w rankingu pokazują, jak bardzo może zmienić się pozycja każdego modelu.

  2. Tysiąc zaliczeń kosztuje od $0.422 do $33.11, co oznacza 78× różnicy.

    Najtańsze zaliczenia zapewnił gpt-oss-120b, a najdroższe Claude Fable 5.1. Model, który często nie zalicza prób, ponosi tu koszt tych niepowodzeń, ponieważ do obliczeń wliczono każdą jego próbę.

  3. Najtrudniejsze zadanie to Odpowiedz publicznie na negatywną opinię o restauracji, nie ujawniając prywatnych informacji: zaliczono 22% prób.

    Zadanie (język: angielski, kategoria: odpowiedzi na opinie). Na jego stronie opisano pułapki i kryteria, których większość modeli nie spełniła.

  4. Zadania po włosku zaliczono w 83% prób, a zadania po angielsku w 65%.

    Zadania po włosku napisano specjalnie dla włoskich firm, z uwzględnieniem miejscowych przepisów podatkowych i zasad oznakowania. Nie są tłumaczeniami zadań angielskich. Różnica w wynikach odzwierciedla więc zarówno język, jak i poziom trudności.

  5. Mediana czasu odpowiedzi wyniosła od 1.2 s dla Gemini 3.5 Flash-Lite do 43 s dla Qwen3.8 Max.

    Czas mierzono od wysłania żądania do ostatniego słowa odpowiedzi, bez nieudanych wywołań. Kolumna p90 pokazuje długi czas oczekiwania, z którym może zetknąć się klient.

Ranking

Wszystkie modele w każdym zadaniu, uszeregowane według częstotliwości zaliczeń. Posortuj według kosztu, by sprawdzić cenę zaliczenia, albo według czasu, by zobaczyć, który model odpowiada najszybciej.

Najpierw najwyższy wskaźnik zaliczeń.

Wskaźnik powodzenia, koszt tysiąca zaliczonych prób i czas odpowiedzi dla 36 modeli AI
#ModelOdsetek zaliczonych próbNa 1,000 zaliczeńMedianap90AngielskiWłoski
1Qwen3.8 FlashAlibaba (Qwen)95%95% przedział: od 76 do 99%$1.0929 s44 s92%100%
1Kimi K3Moonshot AI · otwarte wagi95%95% przedział: od 76 do 99%$18.4415 s78 s100%86%
1Gemini 3.1 Pro (preview)Google95%95% przedział: od 76 do 99%$29.6717 s21 s92%100%
4GLM-5.3-FlashZ.ai · otwarte wagi90%95% przedział: od 70 do 97%$0.83115 s31 s92%86%
4DeepSeek V4.1 FlashDeepSeek · otwarte wagi90%95% przedział: od 70 do 97%$1.0514 s127 s85%100%
4DeepSeek V4 ProDeepSeek · otwarte wagi90%95% przedział: od 70 do 97%$5.1421 s49 s85%100%
4GLM-5.3Z.ai · otwarte wagi90%95% przedział: od 70 do 97%$7.029.2 s31 s92%86%
4Gemini 3.8 FlashGoogle90%95% przedział: od 70 do 97%$7.1711 s16 s85%100%
4Grok 4.7xAI90%95% przedział: od 70 do 97%$9.4117 s27 s92%86%
10Qwen3.7 PlusAlibaba (Qwen)85%95% przedział: od 64 do 95%$3.5829 s41 s77%100%
10Claude Sonnet 5Anthropic85%95% przedział: od 64 do 95%$6.70*25 s51 s77%100%
10GPT-5.6 SolOpenAI85%95% przedział: od 64 do 95%$11.33*27 s37 s77%100%
10Qwen3.8 MaxAlibaba (Qwen)85%95% przedział: od 64 do 95%$16.3243 s82 s77%100%
10Claude Opus 5Anthropic85%95% przedział: od 64 do 95%$16.89*27 s83 s77%100%
10GPT-5.5OpenAI85%95% przedział: od 64 do 95%$17.02*22 s34 s77%100%
10GPT-6 AstraOpenAI85%95% przedział: od 64 do 95%$27.91*11 s38 s77%100%
10Claude Fable 5.1Anthropic85%95% przedział: od 64 do 95%$33.11*26 s51 s77%100%
18GPT-5.6 LunaOpenAI80%95% przedział: od 58 do 92%$0.677*28 s34 s69%100%
18Muse Glimmer 30BMeta · otwarte wagi80%95% przedział: od 58 do 92%$3.1013 s27 s69%100%
18Grok 4.3xAI80%95% przedział: od 58 do 92%$4.107.4 s9.7 s77%86%
18GPT-5.6 TerraOpenAI80%95% przedział: od 58 do 92%$6.68*29 s36 s69%100%
18Qwen3.8 27BAlibaba (Qwen) · otwarte wagi80%95% przedział: od 58 do 92%$7.3043 s89 s77%86%
23gpt-oss-120bOpenAI · otwarte wagi75%95% przedział: od 53 do 89%$0.42233 s69 s77%71%
23MiniMax M3MiniMax · otwarte wagi75%95% przedział: od 53 do 89%$1.826.4 s45 s77%71%
23Claude Sonnet 4.6Anthropic75%95% przedział: od 53 do 89%$11.24*28 s54 s62%100%
23Kimi K2.6Moonshot AI · otwarte wagi75%95% przedział: od 53 do 89%$11.6828 s73 s69%86%
27Gemma 4 31BGoogle · otwarte wagi60%95% przedział: od 39 do 78%$0.55811 s36 s46%86%
28Llama 4 MaverickMeta · otwarte wagi45%95% przedział: od 26 do 66%$0.66514 s21 s38%57%
28Gemini 3.1 Flash-LiteGoogle45%95% przedział: od 26 do 66%$1.411.7 s3.2 s38%57%
30GPT-5.4 miniOpenAI40%95% przedział: od 22 do 61%$3.351.7 s2.3 s23%71%
30Mistral Medium 3.5Mistral · otwarte wagi40%95% przedział: od 22 do 61%$7.401.6 s2.3 s38%43%
32Gemini 3.5 Flash-LiteGoogle35%95% przedział: od 18 do 57%$2.471.2 s1.5 s23%57%
32Claude Haiku 4.5Anthropic35%95% przedział: od 18 do 57%$6.622.5 s3.4 s23%57%
34GPT-5.4 nanoOpenAI30%95% przedział: od 15 do 52%$1.512.7 s3.8 s23%43%
35Ministral 3 14BMistral · otwarte wagi20%95% przedział: od 8 do 42%$1.073.9 s5.4 s8%43%
35Mistral Small 4Mistral · otwarte wagi20%95% przedział: od 8 do 42%$1.332.0 s20 s15%29%

Wskaźnik zaliczeń to odsetek zaliczonych prób. Pod nim pokazano 95% przedział: rzeczywisty wskaźnik modelu może leżeć w dowolnym miejscu tego zakresu. Koszt zaliczenia to koszt wszystkich prób, także nieudanych, podzielony przez liczbę zaliczonych prób. Gwiazdka oznacza koszt obliczony według ceny katalogowej producenta, gdy dostawca nie podał kosztu.

Według rodzaju pracy

Odsetek zaliczonych prób dla każdego rodzaju zadania, liczony dla wszystkich modeli, oraz modele, które zaliczały je najczęściej.

Odsetek zaliczeń według rodzaju zadania
Rodzaj zadaniaZadaniaZaliczone próbyNajczęściej zaliczały
Kierowanie zgłoszeń296%33 modele z wynikiem 100%
Odczytywanie danych z faktur290%29 modeli z wynikiem 100%
Sortowanie wiadomości e-mail183%30 modeli z wynikiem 100%
Podsumowania spotkań183%30 modeli z wynikiem 100%
Obliczenia biznesowe276%19 modeli z wynikiem 100%
Kwalifikacja leadów172%26 modeli z wynikiem 100%
Księgowość271%24 modele z wynikiem 100%
Umawianie wizyt269%21 modeli z wynikiem 100%
Pytania dotyczące zasad169%25 modeli z wynikiem 100%
Obsługa klienta267%17 modeli z wynikiem 100%
Opisy produktów158%21 modeli z wynikiem 100%
Wyceny251%9 modeli z wynikiem 100%
Odpowiedzi na opinie122%8 modeli z wynikiem 100%

Zadania

Od najtrudniejszych. Na stronie każdego zadania znajdziesz jego treść w postaci przekazanej modelom, ukryte w nim pułapki, wszystkie kryteria oceny opisane słowami oraz błędy popełnione przez każdy model.

Zadania od najtrudniejszych
ZadanieRodzajJęzykZaliczone próby
Odpowiedz publicznie na negatywną opinię o restauracji, nie ujawniając prywatnych informacjiOdpowiedzi na opinieAngielski8 z 36
Napisz e-mail z wyceną prac ogrodowych, uwzględniając prośbę dotyczącą VAT i drzewo objęte ochronąWycenyAngielski16 z 36
Odpowiedz klientce proszącej o zwrot pieniędzy po upływie terminu zwrotu na kartęObsługa klientaAngielski17 z 36
Oblicz tygodniowe wynagrodzenie brutto osoby sprzątającej, uwzględniając przerwy, nadgodziny i stawki niedzielneObliczenia biznesoweAngielski19 z 36
Napisz po włosku opis oliwy do sklepu, zgodny z przepisami dotyczącymi etykietowaniaOpisy produktówWłoski21 z 36
Wyceń prace malarskie na podstawie pomiarów z oględzin i cennikaWycenyAngielski21 z 36
Zaplanuj rozmowę między Londynem a Nowym Jorkiem w tygodniu, gdy różnica czasu między nimi jest inna niż zwykleUmawianie wizytAngielski23 z 36
Sklasyfikuj transakcje na miesięcznym wyciągu bankowym kawiarni i oblicz łączne koszty operacyjneKsięgowośćAngielski24 z 36
Odpowiedz na pytania pracownika zatrudnionego w niepełnym wymiarze czasu pracy dotyczące urlopów na podstawie regulaminu pracowniczegoPytania dotyczące zasadAngielski25 z 36
Oceń pięć zapytań od potencjalnych klientów firmy sprzątającej według zasad zespołu sprzedażyKwalifikacja leadówAngielski26 z 36
Sklasyfikuj transakcje na wyciągu bankowym włoskiego baru i podsumuj przepływyKsięgowośćWłoski27 z 36
Znajdź termin wizyty higienizacyjnej w okolicach święta państwowego, po włoskuUmawianie wizytWłoski27 z 36
Zamień notatki ze spotkania zespołu piekarni w listę decyzji, osób odpowiedzialnych i terminówPodsumowania spotkańAngielski30 z 36
Posortuj poniedziałkową skrzynkę firmy cateringowej, uwzględniając wiadomość phishingową i prośbę o zmianę rachunku bankowegoSortowanie wiadomości e-mailAngielski30 z 36
Wyodrębnij dane z faktury włoskiego dostawcy, która zawiera wydatek niepodlegający VATOdczytywanie danych z fakturWłoski31 z 36
Odpowiedz po włosku klientce, która błędnie uważa, że jej gwarancja wygasłaObsługa klientaWłoski31 z 36
Przypisz dziesięć wiadomości od najemców do właściwych zespołów i nadaj im odpowiedni priorytetKierowanie zgłoszeńAngielski33 z 36
Wyodrębnij dane z dwustronicowej faktury dostawcy na potrzeby rozliczenia zobowiązańOdczytywanie danych z fakturAngielski34 z 36
Oblicz kwoty dwóch włoskich faktur za usługi profesjonalne, uwzględniając składkę na fundusz emerytalny, IVA i podatek pobierany u źródłaObliczenia biznesoweWłoski36 z 36
Przypisz wiadomości od gości hotelowych do właściwych działów, po włoskuKierowanie zgłoszeńWłoski36 z 36

Według rodzaju firmy

Zadania, które firma danego rodzaju powierzyłaby AI, zestawione obok siebie wraz z wynikiem każdego modelu.

Najlepszy model AI dla biur rachunkowych
6 zadań. Zakres: kategoryzowanie pozycji na włoskim wyciągu bankowym, kategoryzowanie transakcji bankowych, wyodrębnianie danych z faktur, wyodrębnianie danych z włoskich faktur od dostawców, obliczanie kwot na włoskich fakturach wystawianych przez specjalistów i obliczanie wynagrodzenia za nadgodziny.
Najlepszy model AI dla restauracji i barów
4 zadania. Zakres: odpowiadanie na negatywne opinie, sortowanie wiadomości w firmowej skrzynce odbiorczej, kategoryzowanie transakcji bankowych i kategoryzowanie pozycji na włoskim wyciągu bankowym.
Najlepszy model AI dla sklepów
4 zadania. Zakres: odpowiadanie na prośby o zwrot pieniędzy, odpowiadanie na zgłoszenia gwarancyjne po włosku, pisanie opisów produktów po włosku i sporządzanie protokołów ze spotkań.
Najlepszy model AI dla firm usługowych i wykonawców
6 zadań. Zakres: wycena zlecenia na podstawie cennika, pisanie e-maili z ofertą cenową, ocena leadów sprzedażowych, kierowanie wiadomości od klientów, obliczanie wynagrodzenia za nadgodziny i odpowiadanie na pytania dotyczące podręcznika pracownika.

Jak oceniamy

Każdy model dostaje te same instrukcje i materiały. Jedna próba to jedna odpowiedź, a jej ocena nie zależy od tego, jak dobrze brzmi.

Zaliczone albo nie
Odpowiedź jest zaliczona tylko wtedy, gdy przejdzie wszystkie stałe kontrole. W zadaniach ocenianych również według kryteriów musi ponadto spełnić większość z nich, w tym wszystkie obowiązkowe. Nie przyznajemy punktów za częściowo poprawne odpowiedzi.
Stałe kontrole
Odpowiedzi ustrukturyzowane sprawdzamy pole po polu względem prawidłowych wartości, z dopuszczalnym odchyleniem dla kwot i godzin. W odpowiedziach pisemnych sprawdzamy, co musi się w nich znaleźć, czego nie wolno w nich napisać i jak długie mogą być. Wszystkie modele ocenia ten sam kod.
Ocena według kryteriów
Kryteria ocenia gpt-5-6-sol przy temperaturze zero, podając uzasadnienie dla każdego z nich. Każda odpowiedź jest oceniana dwukrotnie, a przy rozbieżności w danym kryterium rozstrzyga trzecia ocena. Werdykt samego modelu jest pomijany: o zaliczeniu decyduje kod na podstawie ocenionych kryteriów. Przed rozpoczęciem testu model oceniający został dwukrotnie sprawdzony na odpowiedziach o znanym wyniku.
Jeden protokół
Każda próba obejmuje jedną wiadomość z instrukcją i jedną z materiałem: bez narzędzi, wyszukiwania w internecie i trybu JSON. Każdy model korzysta z domyślnych ustawień próbkowania i może wygenerować do 4,000 tokenów, łącznie z rozumowaniem. Odpowiedź ucięta na tym limicie jest oceniana w zastanej postaci. Na każde zadanie przypada 1 próba każdego modelu.
Sprawdzone zasady oceny
Przed publikacją edycji analizujemy każdy przypadek niezaliczenia wynikający z zasady rozstrzygającej o wyniku. Jeśli zasada odrzuca poprawną odpowiedź za brak szczegółu, którego nie wymagano w instrukcjach, poprawiamy ją i ponownie oceniamy te odpowiedzi. Zasada wychwytująca rzeczywisty błąd pozostaje, niezależnie od tego, ile modeli przez nią nie zaliczyło.
Koszt i czas
Koszt próby to kwota naliczona przez dostawcę albo, jeśli dostawca nie podaje kosztu, koszt tokenów według cennika producenta. Czas mierzymy od wysłania żądania do ostatniego słowa odpowiedzi. Nie uwzględniamy wywołań zakończonych błędem.
Przedziały
Przy każdym odsetku zaliczeń podajemy 95% przedział Wilsona. Gdy model ma za sobą zaledwie kilkadziesiąt prób, różnica kilku punktów między dwoma modelami może wynikać z przypadku. Przedziały pokazują tę niepewność.
Dane
Zadania, kontrole i wyniki publikujemy na licencji CC BY 4.0. Cytując je, podaj AIGROW i link do tej strony. Strona każdego zadania zawiera ciąg kontrolny tej edycji, który pomaga wykluczyć zadania ze zbiorów treningowych.

Daj pracę modelom, które zaliczają test

Agent AIGROW wykonuje takie zadania w twoich narzędziach, zgodnie z zasadami, które zatwierdzisz na piśmie. Jeśli chcesz samodzielnie uruchamiać modele, środki na API kosztują jedną czwartą ceny katalogowej.

Edycja październik 2026, pilotaż