Respostas rápidas

AIGrow oferece monitorização da visibilidade em IA, um assistente para empresas, publicação de artigos no blog e serviços de automação com escopo definido. Comece pela análise gratuita para avaliar o resultado antes de pagar.

Faça a análise gratuita

A análise é gratuita e os planos de monitorização começam em $29 por mês. A auditoria de operações custa $290, a auditoria de visibilidade custa $490 e os projetos personalizados recebem um preço por escrito antes do início do trabalho.

Ver os planos

Faça a análise gratuita. Ela lê o seu site, pergunta a vários assistentes de IA o que os seus clientes perguntam e indica-lhe uma coisa. Não é necessário criar uma conta e a análise dirá se não precisa de nós.

Comece agora

Sim. Use o formulário de contacto para questões sobre o produto, faturação, suporte ou projetos. Descreva o objetivo e o sistema envolvido para que a primeira resposta possa ser específica.

Contactar a AIGrow
Benchmark · edição de outubro de 2026 · piloto

36 modelos de IA em 20 tarefas reais de pequenas empresas

Faturas, orçamentos, escalas de trabalho, respostas a avaliações e triagem da caixa de entrada. Cada tarefa tem uma armadilha em que uma resposta descuidada pode cair. Cada resposta passa ou falha por inteiro, e cada aprovação tem um custo calculado.

Um estudo-piloto: 20 das 40 tarefas desta edição, com 1 execuções por modelo.

Maior taxa de aprovação
95%Empate entre 3 modelos, com 19 de 20 execuções aprovadas cada
Modelos
36
Tarefas
20 de 40
Execuções
720
Avaliador por critérios
Calibrado

Executado em outubro de 2026. Dados sob a licença CC BY 4.0.

O benchmark da AIGROW para pequenas empresas apresenta 20 tarefas administrativas do dia a dia a 36 modelos de IA e avalia cada resposta, com base em verificações definidas por escrito, como aprovada ou reprovada. Na edição de outubro de 2026, 3 modelos empataram no primeiro lugar, com 95%, e gpt-oss-120b tiveram as aprovações mais baratas, a $0.422 por mil. Todas as tarefas, verificações e resultados são publicados.

Resultados

O que mostra a edição de outubro de 2026 e qual é o grau de certeza dos resultados.

  1. Qwen3.8 Flash, Kimi K3 e Gemini 3.1 Pro (preview) passaram em 95% das suas execuções, a maior taxa desta edição.

    Os intervalos de 95% de 6 mais modelos alcançam essa taxa. Com 20 execuções por modelo, não é possível distingui-los de o líder, e as barras da classificação mostram quanto o resultado de cada um pode variar.

  2. Mil aprovações custam entre $0.422 e $33.11, uma diferença de 78×.

    gpt-oss-120b teve as aprovações mais baratas e Claude Fable 5.1, as mais caras. As falhas pesam no custo de um modelo que reprova com frequência, pois todas as suas execuções entram no cálculo.

  3. Responda publicamente a uma avaliação negativa de um restaurante sem revelar informações privadas foi a tarefa mais difícil: 22% das execuções passaram.

    Uma tarefa no idioma inglês, da categoria respostas a avaliações. A página mostra as armadilhas e os critérios em que a maioria dos modelos falhou.

  4. As tarefas em italiano passaram em 83% das execuções, contra 65% nas tarefas em inglês.

    As tarefas em italiano foram criadas para empresas italianas, com regras fiscais e de rotulagem italianas, e não são traduções das tarefas em inglês. A diferença reflete tanto a língua como a dificuldade.

  5. O tempo mediano de resposta variou entre 1.2 s para Gemini 3.5 Flash-Lite e 43 s para Qwen3.8 Max.

    Medido desde o pedido até à última palavra da resposta, excluindo as chamadas que falharam. A coluna p90 mostra o tempo de espera nas respostas mais lentas.

A classificação

Todos os modelos em todas as tarefas, ordenados pela frequência com que as respostas passaram. Ordene por custo para ver quanto custa uma aprovação ou por rapidez para ver quem responde primeiro.

Maior taxa de sucesso primeiro.

Taxa de sucesso, custo por mil aprovações e tempo de resposta de 36 modelos de IA
#ModeloTaxa de sucessoPor 1.000 aprovaçõesMedianap90InglêsItaliano
1Qwen3.8 FlashAlibaba (Qwen)95%Intervalo de 95%: 76 a 99% $1.0929 s44 s92%100%
1Kimi K3Moonshot AI · pesos abertos95%Intervalo de 95%: 76 a 99% $18.4415 s78 s100%86%
1Gemini 3.1 Pro (preview)Google95%Intervalo de 95%: 76 a 99% $29.6717 s21 s92%100%
4GLM-5.3-FlashZ.ai · pesos abertos90%Intervalo de 95%: 70 a 97% $0.83115 s31 s92%86%
4DeepSeek V4.1 FlashDeepSeek · pesos abertos90%Intervalo de 95%: 70 a 97% $1.0514 s127 s85%100%
4DeepSeek V4 ProDeepSeek · pesos abertos90%Intervalo de 95%: 70 a 97% $5.1421 s49 s85%100%
4GLM-5.3Z.ai · pesos abertos90%Intervalo de 95%: 70 a 97% $7.029.2 s31 s92%86%
4Gemini 3.8 FlashGoogle90%Intervalo de 95%: 70 a 97% $7.1711 s16 s85%100%
4Grok 4.7xAI90%Intervalo de 95%: 70 a 97% $9.4117 s27 s92%86%
10Qwen3.7 PlusAlibaba (Qwen)85%Intervalo de 95%: 64 a 95% $3.5829 s41 s77%100%
10Claude Sonnet 5Anthropic85%Intervalo de 95%: 64 a 95% $6.70*25 s51 s77%100%
10GPT-5.6 SolOpenAI85%Intervalo de 95%: 64 a 95% $11.33*27 s37 s77%100%
10Qwen3.8 MaxAlibaba (Qwen)85%Intervalo de 95%: 64 a 95% $16.3243 s82 s77%100%
10Claude Opus 5Anthropic85%Intervalo de 95%: 64 a 95% $16.89*27 s83 s77%100%
10GPT-5.5OpenAI85%Intervalo de 95%: 64 a 95% $17.02*22 s34 s77%100%
10GPT-6 AstraOpenAI85%Intervalo de 95%: 64 a 95% $27.91*11 s38 s77%100%
10Claude Fable 5.1Anthropic85%Intervalo de 95%: 64 a 95% $33.11*26 s51 s77%100%
18GPT-5.6 LunaOpenAI80%Intervalo de 95%: 58 a 92% $0.677*28 s34 s69%100%
18Muse Glimmer 30BMeta · pesos abertos80%Intervalo de 95%: 58 a 92% $3.1013 s27 s69%100%
18Grok 4.3xAI80%Intervalo de 95%: 58 a 92% $4.107.4 s9.7 s77%86%
18GPT-5.6 TerraOpenAI80%Intervalo de 95%: 58 a 92% $6.68*29 s36 s69%100%
18Qwen3.8 27BAlibaba (Qwen) · pesos abertos80%Intervalo de 95%: 58 a 92% $7.3043 s89 s77%86%
23gpt-oss-120bOpenAI · pesos abertos75%Intervalo de 95%: 53 a 89% $0.42233 s69 s77%71%
23MiniMax M3MiniMax · pesos abertos75%Intervalo de 95%: 53 a 89% $1.826.4 s45 s77%71%
23Claude Sonnet 4.6Anthropic75%Intervalo de 95%: 53 a 89% $11.24*28 s54 s62%100%
23Kimi K2.6Moonshot AI · pesos abertos75%Intervalo de 95%: 53 a 89% $11.6828 s73 s69%86%
27Gemma 4 31BGoogle · pesos abertos60%Intervalo de 95%: 39 a 78% $0.55811 s36 s46%86%
28Llama 4 MaverickMeta · pesos abertos45%Intervalo de 95%: 26 a 66% $0.66514 s21 s38%57%
28Gemini 3.1 Flash-LiteGoogle45%Intervalo de 95%: 26 a 66% $1.411.7 s3.2 s38%57%
30GPT-5.4 miniOpenAI40%Intervalo de 95%: 22 a 61% $3.351.7 s2.3 s23%71%
30Mistral Medium 3.5Mistral · pesos abertos40%Intervalo de 95%: 22 a 61% $7.401.6 s2.3 s38%43%
32Gemini 3.5 Flash-LiteGoogle35%Intervalo de 95%: 18 a 57% $2.471.2 s1.5 s23%57%
32Claude Haiku 4.5Anthropic35%Intervalo de 95%: 18 a 57% $6.622.5 s3.4 s23%57%
34GPT-5.4 nanoOpenAI30%Intervalo de 95%: 15 a 52% $1.512.7 s3.8 s23%43%
35Ministral 3 14BMistral · pesos abertos20%Intervalo de 95%: 8 a 42% $1.073.9 s5.4 s8%43%
35Mistral Small 4Mistral · pesos abertos20%Intervalo de 95%: 8 a 42% $1.332.0 s20 s15%29%

A taxa de sucesso é a proporção de execuções aprovadas, com o intervalo de 95% apresentado por baixo: a taxa real do modelo pode situar-se em qualquer ponto da barra. O custo por aprovação divide o custo de todas as execuções, incluindo as reprovadas, pelo número de execuções aprovadas. Um asterisco indica um custo calculado com base no preço de tabela do fabricante, quando o fornecedor não informou o custo.

Por tipo de trabalho

A percentagem de execuções aprovadas em cada tipo de tarefa, considerando todos os modelos, e os modelos que passaram com mais frequência.

Taxa de aprovação por tipo de tarefa
Tipo de tarefaTarefasExecuções aprovadasMais aprovados
Encaminhamento de solicitações296%33 modelos com 100%
Extração de dados de faturas290%29 modelos com 100%
Triagem de emails183%30 modelos com 100%
Resumos de reuniões183%30 modelos com 100%
Cálculos empresariais276%19 modelos com 100%
Qualificação de leads172%26 modelos com 100%
Contabilidade271%24 modelos com 100%
Agendamento de compromissos269%21 modelos com 100%
Perguntas sobre políticas169%25 modelos com 100%
Suporte ao cliente267%17 modelos com 100%
Descrições de produtos158%21 modelos com 100%
Orçamentos251%9 modelos com 100%
Respostas a avaliações122%8 modelos com 100%

As tarefas

As mais difíceis primeiro. Cada página mostra a tarefa tal como os modelos a receberam, as armadilhas, todas as verificações explicadas e o que cada modelo errou.

As tarefas, das mais difíceis às mais fáceis
TarefaTipoIdiomaExecuções aprovadas
Responda publicamente a uma avaliação negativa de um restaurante sem revelar informações privadasRespostas a avaliaçõesInglês8 de 36
Envie por email um orçamento de jardinagem que trate de um pedido relativo ao IVA e de uma árvore protegidaOrçamentosInglês16 de 36
Responda a uma cliente que pede um reembolso fora do prazo previstoSuporte ao clienteInglês17 de 36
Calcule o salário bruto semanal de um profissional de limpeza, incluindo pausas, horas extras e remuneração aos domingosCálculos empresariaisInglês19 de 36
Escreva uma descrição de um azeite para uma loja italiana que respeite as regras de rotulagemDescrições de produtosItaliano21 de 36
Calcule o preço de um trabalho de pintura e decoração com base nas medidas recolhidas na visita e na tabela de preçosOrçamentosInglês21 de 36
Agende uma chamada entre Londres e Nova Iorque na semana em que a diferença horária é diferente do habitualAgendamento de compromissosInglês23 de 36
Categorizar o extrato bancário mensal de um café e calcular o total dos custos operacionaisContabilidadeInglês24 de 36
Responda às dúvidas de um funcionário em tempo parcial sobre licenças com base no manual da equipePerguntas sobre políticasInglês25 de 36
Avalie cinco novos contatos comerciais para serviços de limpeza segundo as regras da equipe de vendasQualificação de leadsInglês26 de 36
Categorizar o extrato bancário de um bar italiano e calcular o total das movimentaçõesContabilidadeItaliano27 de 36
Encontre uma consulta de higiene dentária perto de um feriado, em italianoAgendamento de compromissosItaliano27 de 36
Transforme uma reunião da equipe de uma padaria em decisões, responsáveis e prazosResumos de reuniõesInglês30 de 36
Faça a triagem dos emails de segunda-feira de uma empresa de catering, incluindo uma tentativa de phishing e um pedido de alteração de dados bancáriosTriagem de emailsInglês30 de 36
Extraia os dados de uma fatura de um fornecedor italiano com uma despesa fora do âmbito do IVAExtração de dados de faturasItaliano31 de 36
Responda em italiano a uma cliente que pensa, erradamente, que a garantia expirouSuporte ao clienteItaliano31 de 36
Encaminhe dez mensagens de inquilinos para a equipa certa, com a prioridade adequadaEncaminhamento de solicitaçõesInglês33 de 36
Extraia os dados de uma fatura de fornecedor com duas páginas para contas a pagarExtração de dados de faturasInglês34 de 36
Calcular duas faturas de um profissional italiano com contribuição previdenciária, IVA e retenção na fonteCálculos empresariaisItaliano36 de 36
Encaminhe as mensagens dos hóspedes de um hotel para os departamentos certos, em italianoEncaminhamento de solicitaçõesItaliano36 de 36

Por tipo de empresa

As tarefas que um determinado tipo de empresa confiaria à IA, lado a lado, com o resultado de cada modelo em cada uma.

Melhor modelo de IA para escritórios de contabilidade
6 tarefas: categorizar um extrato bancário italiano, categorizar transações bancárias, extrair dados de faturas, extrair dados de faturas de fornecedores italianos, calcular faturas de profissionais liberais em Itália e calcular o pagamento de horas extras.
Melhor modelo de IA para restaurantes e bares
4 tarefas: responder a avaliações negativas, fazer a triagem da caixa de entrada de uma empresa, categorizar transações bancárias e categorizar um extrato bancário italiano.
Melhor modelo de IA para lojas
4 tarefas: responder a pedidos de reembolso, responder a pedidos de garantia em italiano, escrever descrições de produtos em italiano e redigir atas de reuniões.
Melhor modelo de IA para profissionais de ofícios e serviços
6 tarefas: definir o preço de um serviço com base numa tabela de preços, redigir emails com orçamentos, classificar leads de vendas, encaminhar mensagens de clientes, calcular o pagamento de horas extras e responder a perguntas sobre o manual dos colaboradores.

Como são avaliadas as respostas

As mesmas instruções e o mesmo material para todos os modelos, uma resposta por execução e um resultado que não depende da forma como a resposta soa.

Passa ou falha
Uma resposta só passa se cumprir todas as verificações fixas. Nas tarefas que também incluem critérios de avaliação, tem de cumprir a maioria deles, incluindo obrigatoriamente os mais importantes. Não há aprovação parcial.
Verificações fixas
As respostas estruturadas são verificadas campo a campo face aos valores corretos, com uma margem de tolerância para montantes e horas. Nas respostas escritas, verifica-se o que devem dizer, o que não podem dizer e o limite de extensão. O mesmo código avalia todos os modelos.
O avaliador por critérios
Os critérios são avaliados por gpt-5-6-sol com temperatura zero, cada um com uma justificação. Cada resposta é avaliada duas vezes, e uma terceira avaliação resolve qualquer divergência entre as duas. O veredito do próprio modelo é ignorado: o código aplica a regra de aprovação aos critérios que ele avaliou. Antes das execuções, o avaliador foi testado duas vezes com respostas cujo resultado já era conhecido.
Um único protocolo
Cada execução inclui uma mensagem de instruções e outra com o material: sem ferramentas, sem pesquisa na web, sem modo JSON, com as definições de amostragem padrão de cada modelo e até 4,000 tokens de saída, incluindo o raciocínio. Se uma resposta for interrompida nesse limite, é avaliada tal como ficou. 1 execuções por modelo em cada tarefa.
Regras auditadas
Antes da publicação de cada edição, todas as reprovações causadas por uma regra decisiva são analisadas. Se uma regra reprovar uma resposta correta por omitir um detalhe que as instruções nunca pediram, é corrigida e essas respostas são avaliadas novamente. Uma regra que detete um erro real permanece, independentemente de quantos modelos reprove.
Custo e tempo
O custo de uma execução é o valor cobrado pelo fornecedor ou, quando este não informa o custo, o valor dos tokens ao preço de tabela do fabricante. O tempo vai do pedido até à última palavra da resposta; as chamadas que falharam não entram no cálculo.
Intervalos
Cada taxa de aprovação inclui um intervalo de Wilson de 95%. Com algumas dezenas de execuções por modelo, uma diferença de vários pontos entre dois modelos pode dever-se ao acaso, e as barras mostram essa incerteza.
Os dados
As tarefas, verificações e resultados são publicados sob a licença CC BY 4.0: cite a AIGROW e inclua um link para esta página. Cada página de tarefa contém a string canário da edição, para ajudar a manter as tarefas fora dos conjuntos de treino.

Ponha os modelos aprovados a trabalhar

Um agente da AIGROW faz este tipo de trabalho nas suas próprias ferramentas, seguindo regras que você aprova por escrito. Se quiser executar os modelos diretamente, o crédito de API custa um quarto do preço de tabela.

Edição de outubro de 2026, piloto