36 modelos de IA em 20 tarefas reais de pequenas empresas
Faturas, orçamentos, escalas de trabalho, respostas a avaliações e triagem da caixa de entrada. Cada tarefa tem uma armadilha em que uma resposta descuidada pode cair. Cada resposta passa ou falha por inteiro, e cada aprovação tem um custo calculado.
Um estudo-piloto: 20 das 40 tarefas desta edição, com 1 execuções por modelo.
- Modelos
- 36
- Tarefas
- 20 de 40
- Execuções
- 720
- Avaliador por critérios
- Calibrado
Executado em outubro de 2026. Dados sob a licença CC BY 4.0.
O benchmark da AIGROW para pequenas empresas apresenta 20 tarefas administrativas do dia a dia a 36 modelos de IA e avalia cada resposta, com base em verificações definidas por escrito, como aprovada ou reprovada. Na edição de outubro de 2026, 3 modelos empataram no primeiro lugar, com 95%, e gpt-oss-120b tiveram as aprovações mais baratas, a $0.422 por mil. Todas as tarefas, verificações e resultados são publicados.
Resultados
O que mostra a edição de outubro de 2026 e qual é o grau de certeza dos resultados.
Qwen3.8 Flash, Kimi K3 e Gemini 3.1 Pro (preview) passaram em 95% das suas execuções, a maior taxa desta edição.
Os intervalos de 95% de 6 mais modelos alcançam essa taxa. Com 20 execuções por modelo, não é possível distingui-los de o líder, e as barras da classificação mostram quanto o resultado de cada um pode variar.
Mil aprovações custam entre $0.422 e $33.11, uma diferença de 78×.
gpt-oss-120b teve as aprovações mais baratas e Claude Fable 5.1, as mais caras. As falhas pesam no custo de um modelo que reprova com frequência, pois todas as suas execuções entram no cálculo.
Responda publicamente a uma avaliação negativa de um restaurante sem revelar informações privadas foi a tarefa mais difícil: 22% das execuções passaram.
Uma tarefa no idioma inglês, da categoria respostas a avaliações. A página mostra as armadilhas e os critérios em que a maioria dos modelos falhou.
As tarefas em italiano passaram em 83% das execuções, contra 65% nas tarefas em inglês.
As tarefas em italiano foram criadas para empresas italianas, com regras fiscais e de rotulagem italianas, e não são traduções das tarefas em inglês. A diferença reflete tanto a língua como a dificuldade.
O tempo mediano de resposta variou entre 1.2 s para Gemini 3.5 Flash-Lite e 43 s para Qwen3.8 Max.
Medido desde o pedido até à última palavra da resposta, excluindo as chamadas que falharam. A coluna p90 mostra o tempo de espera nas respostas mais lentas.
A classificação
Todos os modelos em todas as tarefas, ordenados pela frequência com que as respostas passaram. Ordene por custo para ver quanto custa uma aprovação ou por rapidez para ver quem responde primeiro.
Maior taxa de sucesso primeiro.
| # | Modelo | Taxa de sucesso | Por 1.000 aprovações | Mediana | p90 | Inglês | Italiano |
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.8 FlashAlibaba (Qwen) | Intervalo de 95%: 76 a 99% | $1.09 | 29 s | 44 s | 92% | 100% |
| 1 | Kimi K3Moonshot AI · pesos abertos | Intervalo de 95%: 76 a 99% | $18.44 | 15 s | 78 s | 100% | 86% |
| 1 | Gemini 3.1 Pro (preview)Google | Intervalo de 95%: 76 a 99% | $29.67 | 17 s | 21 s | 92% | 100% |
| 4 | GLM-5.3-FlashZ.ai · pesos abertos | Intervalo de 95%: 70 a 97% | $0.831 | 15 s | 31 s | 92% | 86% |
| 4 | DeepSeek V4.1 FlashDeepSeek · pesos abertos | Intervalo de 95%: 70 a 97% | $1.05 | 14 s | 127 s | 85% | 100% |
| 4 | DeepSeek V4 ProDeepSeek · pesos abertos | Intervalo de 95%: 70 a 97% | $5.14 | 21 s | 49 s | 85% | 100% |
| 4 | GLM-5.3Z.ai · pesos abertos | Intervalo de 95%: 70 a 97% | $7.02 | 9.2 s | 31 s | 92% | 86% |
| 4 | Gemini 3.8 FlashGoogle | Intervalo de 95%: 70 a 97% | $7.17 | 11 s | 16 s | 85% | 100% |
| 4 | Grok 4.7xAI | Intervalo de 95%: 70 a 97% | $9.41 | 17 s | 27 s | 92% | 86% |
| 10 | Qwen3.7 PlusAlibaba (Qwen) | Intervalo de 95%: 64 a 95% | $3.58 | 29 s | 41 s | 77% | 100% |
| 10 | Claude Sonnet 5Anthropic | Intervalo de 95%: 64 a 95% | $6.70* | 25 s | 51 s | 77% | 100% |
| 10 | GPT-5.6 SolOpenAI | Intervalo de 95%: 64 a 95% | $11.33* | 27 s | 37 s | 77% | 100% |
| 10 | Qwen3.8 MaxAlibaba (Qwen) | Intervalo de 95%: 64 a 95% | $16.32 | 43 s | 82 s | 77% | 100% |
| 10 | Claude Opus 5Anthropic | Intervalo de 95%: 64 a 95% | $16.89* | 27 s | 83 s | 77% | 100% |
| 10 | GPT-5.5OpenAI | Intervalo de 95%: 64 a 95% | $17.02* | 22 s | 34 s | 77% | 100% |
| 10 | GPT-6 AstraOpenAI | Intervalo de 95%: 64 a 95% | $27.91* | 11 s | 38 s | 77% | 100% |
| 10 | Claude Fable 5.1Anthropic | Intervalo de 95%: 64 a 95% | $33.11* | 26 s | 51 s | 77% | 100% |
| 18 | GPT-5.6 LunaOpenAI | Intervalo de 95%: 58 a 92% | $0.677* | 28 s | 34 s | 69% | 100% |
| 18 | Muse Glimmer 30BMeta · pesos abertos | Intervalo de 95%: 58 a 92% | $3.10 | 13 s | 27 s | 69% | 100% |
| 18 | Grok 4.3xAI | Intervalo de 95%: 58 a 92% | $4.10 | 7.4 s | 9.7 s | 77% | 86% |
| 18 | GPT-5.6 TerraOpenAI | Intervalo de 95%: 58 a 92% | $6.68* | 29 s | 36 s | 69% | 100% |
| 18 | Qwen3.8 27BAlibaba (Qwen) · pesos abertos | Intervalo de 95%: 58 a 92% | $7.30 | 43 s | 89 s | 77% | 86% |
| 23 | gpt-oss-120bOpenAI · pesos abertos | Intervalo de 95%: 53 a 89% | $0.422 | 33 s | 69 s | 77% | 71% |
| 23 | MiniMax M3MiniMax · pesos abertos | Intervalo de 95%: 53 a 89% | $1.82 | 6.4 s | 45 s | 77% | 71% |
| 23 | Claude Sonnet 4.6Anthropic | Intervalo de 95%: 53 a 89% | $11.24* | 28 s | 54 s | 62% | 100% |
| 23 | Kimi K2.6Moonshot AI · pesos abertos | Intervalo de 95%: 53 a 89% | $11.68 | 28 s | 73 s | 69% | 86% |
| 27 | Gemma 4 31BGoogle · pesos abertos | Intervalo de 95%: 39 a 78% | $0.558 | 11 s | 36 s | 46% | 86% |
| 28 | Llama 4 MaverickMeta · pesos abertos | Intervalo de 95%: 26 a 66% | $0.665 | 14 s | 21 s | 38% | 57% |
| 28 | Gemini 3.1 Flash-LiteGoogle | Intervalo de 95%: 26 a 66% | $1.41 | 1.7 s | 3.2 s | 38% | 57% |
| 30 | GPT-5.4 miniOpenAI | Intervalo de 95%: 22 a 61% | $3.35 | 1.7 s | 2.3 s | 23% | 71% |
| 30 | Mistral Medium 3.5Mistral · pesos abertos | Intervalo de 95%: 22 a 61% | $7.40 | 1.6 s | 2.3 s | 38% | 43% |
| 32 | Gemini 3.5 Flash-LiteGoogle | Intervalo de 95%: 18 a 57% | $2.47 | 1.2 s | 1.5 s | 23% | 57% |
| 32 | Claude Haiku 4.5Anthropic | Intervalo de 95%: 18 a 57% | $6.62 | 2.5 s | 3.4 s | 23% | 57% |
| 34 | GPT-5.4 nanoOpenAI | Intervalo de 95%: 15 a 52% | $1.51 | 2.7 s | 3.8 s | 23% | 43% |
| 35 | Ministral 3 14BMistral · pesos abertos | Intervalo de 95%: 8 a 42% | $1.07 | 3.9 s | 5.4 s | 8% | 43% |
| 35 | Mistral Small 4Mistral · pesos abertos | Intervalo de 95%: 8 a 42% | $1.33 | 2.0 s | 20 s | 15% | 29% |
A taxa de sucesso é a proporção de execuções aprovadas, com o intervalo de 95% apresentado por baixo: a taxa real do modelo pode situar-se em qualquer ponto da barra. O custo por aprovação divide o custo de todas as execuções, incluindo as reprovadas, pelo número de execuções aprovadas. Um asterisco indica um custo calculado com base no preço de tabela do fabricante, quando o fornecedor não informou o custo.
Por tipo de trabalho
A percentagem de execuções aprovadas em cada tipo de tarefa, considerando todos os modelos, e os modelos que passaram com mais frequência.
| Tipo de tarefa | Tarefas | Execuções aprovadas | Mais aprovados |
|---|---|---|---|
| Encaminhamento de solicitações | 2 | 96% | 33 modelos com 100% |
| Extração de dados de faturas | 2 | 90% | 29 modelos com 100% |
| Triagem de emails | 1 | 83% | 30 modelos com 100% |
| Resumos de reuniões | 1 | 83% | 30 modelos com 100% |
| Cálculos empresariais | 2 | 76% | 19 modelos com 100% |
| Qualificação de leads | 1 | 72% | 26 modelos com 100% |
| Contabilidade | 2 | 71% | 24 modelos com 100% |
| Agendamento de compromissos | 2 | 69% | 21 modelos com 100% |
| Perguntas sobre políticas | 1 | 69% | 25 modelos com 100% |
| Suporte ao cliente | 2 | 67% | 17 modelos com 100% |
| Descrições de produtos | 1 | 58% | 21 modelos com 100% |
| Orçamentos | 2 | 51% | 9 modelos com 100% |
| Respostas a avaliações | 1 | 22% | 8 modelos com 100% |
As tarefas
As mais difíceis primeiro. Cada página mostra a tarefa tal como os modelos a receberam, as armadilhas, todas as verificações explicadas e o que cada modelo errou.
Por tipo de empresa
As tarefas que um determinado tipo de empresa confiaria à IA, lado a lado, com o resultado de cada modelo em cada uma.
- Melhor modelo de IA para escritórios de contabilidade
- 6 tarefas: categorizar um extrato bancário italiano, categorizar transações bancárias, extrair dados de faturas, extrair dados de faturas de fornecedores italianos, calcular faturas de profissionais liberais em Itália e calcular o pagamento de horas extras.
- Melhor modelo de IA para restaurantes e bares
- 4 tarefas: responder a avaliações negativas, fazer a triagem da caixa de entrada de uma empresa, categorizar transações bancárias e categorizar um extrato bancário italiano.
- Melhor modelo de IA para lojas
- 4 tarefas: responder a pedidos de reembolso, responder a pedidos de garantia em italiano, escrever descrições de produtos em italiano e redigir atas de reuniões.
- Melhor modelo de IA para profissionais de ofícios e serviços
- 6 tarefas: definir o preço de um serviço com base numa tabela de preços, redigir emails com orçamentos, classificar leads de vendas, encaminhar mensagens de clientes, calcular o pagamento de horas extras e responder a perguntas sobre o manual dos colaboradores.
Como são avaliadas as respostas
As mesmas instruções e o mesmo material para todos os modelos, uma resposta por execução e um resultado que não depende da forma como a resposta soa.
- Passa ou falha
- Uma resposta só passa se cumprir todas as verificações fixas. Nas tarefas que também incluem critérios de avaliação, tem de cumprir a maioria deles, incluindo obrigatoriamente os mais importantes. Não há aprovação parcial.
- Verificações fixas
- As respostas estruturadas são verificadas campo a campo face aos valores corretos, com uma margem de tolerância para montantes e horas. Nas respostas escritas, verifica-se o que devem dizer, o que não podem dizer e o limite de extensão. O mesmo código avalia todos os modelos.
- O avaliador por critérios
- Os critérios são avaliados por gpt-5-6-sol com temperatura zero, cada um com uma justificação. Cada resposta é avaliada duas vezes, e uma terceira avaliação resolve qualquer divergência entre as duas. O veredito do próprio modelo é ignorado: o código aplica a regra de aprovação aos critérios que ele avaliou. Antes das execuções, o avaliador foi testado duas vezes com respostas cujo resultado já era conhecido.
- Um único protocolo
- Cada execução inclui uma mensagem de instruções e outra com o material: sem ferramentas, sem pesquisa na web, sem modo JSON, com as definições de amostragem padrão de cada modelo e até 4,000 tokens de saída, incluindo o raciocínio. Se uma resposta for interrompida nesse limite, é avaliada tal como ficou. 1 execuções por modelo em cada tarefa.
- Regras auditadas
- Antes da publicação de cada edição, todas as reprovações causadas por uma regra decisiva são analisadas. Se uma regra reprovar uma resposta correta por omitir um detalhe que as instruções nunca pediram, é corrigida e essas respostas são avaliadas novamente. Uma regra que detete um erro real permanece, independentemente de quantos modelos reprove.
- Custo e tempo
- O custo de uma execução é o valor cobrado pelo fornecedor ou, quando este não informa o custo, o valor dos tokens ao preço de tabela do fabricante. O tempo vai do pedido até à última palavra da resposta; as chamadas que falharam não entram no cálculo.
- Intervalos
- Cada taxa de aprovação inclui um intervalo de Wilson de 95%. Com algumas dezenas de execuções por modelo, uma diferença de vários pontos entre dois modelos pode dever-se ao acaso, e as barras mostram essa incerteza.
- Os dados
- As tarefas, verificações e resultados são publicados sob a licença CC BY 4.0: cite a AIGROW e inclua um link para esta página. Cada página de tarefa contém a string canário da edição, para ajudar a manter as tarefas fora dos conjuntos de treino.
Ponha os modelos aprovados a trabalhar
Um agente da AIGROW faz este tipo de trabalho nas suas próprias ferramentas, seguindo regras que você aprova por escrito. Se quiser executar os modelos diretamente, o crédito de API custa um quarto do preço de tabela.
Edição de outubro de 2026, piloto