36 modelos de IA ante 20 tareas reales de pequeñas empresas
Facturas, presupuestos, turnos, respuestas a reseñas y clasificación de correos, cada tarea con una trampa en la que cae una respuesta descuidada. Cada respuesta se aprueba o se suspende en su conjunto, y se calcula el coste de cada respuesta aprobada.
Una prueba piloto: 20 de las 40 tareas de la edición, 1 ejecución por modelo.
- Modelos
- 36
- Tareas
- 20 de 40
- Rondas
- 720
- Evaluador de la rúbrica
- Calibrado
Ejecutado en octubre de 2026. Datos bajo la licencia CC BY 4.0.
La evaluación de AIGROW para pequeñas empresas plantea 20 tareas administrativas cotidianas a 36 modelos de IA y decide si cada respuesta aprueba o suspende según comprobaciones documentadas. En la edición de octubre de 2026, 3 modelos empataron en el primer puesto con 95%, y gpt-oss-120b ofreció las aprobaciones más baratas, a $0.422 por cada mil. Se publican todas las tareas, comprobaciones y resultados.
Resultados
Qué muestra la edición de octubre de 2026 y qué grado de certeza ofrecen sus resultados.
Qwen3.8 Flash, Kimi K3 y Gemini 3.1 Pro (preview) superaron 95% de sus ejecuciones, la tasa más alta de esta edición.
Los intervalos del 95% de 6 modelos más alcanzan esa tasa. Con 20 ejecuciones por modelo, no se pueden distinguir estadísticamente de el líder; las barras de la clasificación muestran cuánto podría variar cada uno.
Mil aciertos cuestan entre $0.422 y $33.11, una diferencia de 78×.
gpt-oss-120b logró los aciertos más baratos y Claude Fable 5.1, los más caros. Los modelos que fallan a menudo pagan aquí por esos fallos, porque el coste incluye todas sus ejecuciones.
Responde públicamente a una reseña negativa de un restaurante sin revelar datos privados fue la tarea más difícil: se superó el 22% de las ejecuciones.
Una tarea del benchmark (categoría: respuestas a reseñas; idioma: inglés). Su página detalla las trampas y las comprobaciones que la mayoría de los modelos no superó.
Las tareas en italiano se superaron en el 83% de las ejecuciones, frente al 65% de las tareas en inglés.
Las tareas en italiano son tareas propias, creadas para empresas italianas conforme a sus normas fiscales y de etiquetado, no traducciones de las tareas en inglés. La diferencia refleja tanto el idioma como la dificultad.
La mediana del tiempo de respuesta fue de 1.2 s para Gemini 3.5 Flash-Lite a 43 s para Qwen3.8 Max.
Se mide desde la solicitud hasta la última palabra de la respuesta, excluidas las llamadas fallidas. La columna p90 muestra cuánto podría tardar una respuesta de las más lentas que tendría que esperar un cliente.
La clasificación
Todos los modelos en todas las tareas, ordenados según la frecuencia con la que aprobaron sus respuestas. Ordena por coste para ver cuánto cuesta una respuesta aprobada, o por velocidad para ver cuál responde primero.
Primero, la tasa de éxito más alta.
| # | Modelo | Tasa de éxito | Por 1,000 aciertos | Mediana | p90 | Inglés | Italiano |
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.8 FlashAlibaba (Qwen) | Intervalo del 95%: 76 a 99% | $1.09 | 29 s | 44 s | 92% | 100% |
| 1 | Kimi K3Moonshot AI · pesos abiertos | Intervalo del 95%: 76 a 99% | $18.44 | 15 s | 78 s | 100% | 86% |
| 1 | Gemini 3.1 Pro (preview)Google | Intervalo del 95%: 76 a 99% | $29.67 | 17 s | 21 s | 92% | 100% |
| 4 | GLM-5.3-FlashZ.ai · pesos abiertos | Intervalo del 95%: 70 a 97% | $0.831 | 15 s | 31 s | 92% | 86% |
| 4 | DeepSeek V4.1 FlashDeepSeek · pesos abiertos | Intervalo del 95%: 70 a 97% | $1.05 | 14 s | 127 s | 85% | 100% |
| 4 | DeepSeek V4 ProDeepSeek · pesos abiertos | Intervalo del 95%: 70 a 97% | $5.14 | 21 s | 49 s | 85% | 100% |
| 4 | GLM-5.3Z.ai · pesos abiertos | Intervalo del 95%: 70 a 97% | $7.02 | 9.2 s | 31 s | 92% | 86% |
| 4 | Gemini 3.8 FlashGoogle | Intervalo del 95%: 70 a 97% | $7.17 | 11 s | 16 s | 85% | 100% |
| 4 | Grok 4.7xAI | Intervalo del 95%: 70 a 97% | $9.41 | 17 s | 27 s | 92% | 86% |
| 10 | Qwen3.7 PlusAlibaba (Qwen) | Intervalo del 95%: 64 a 95% | $3.58 | 29 s | 41 s | 77% | 100% |
| 10 | Claude Sonnet 5Anthropic | Intervalo del 95%: 64 a 95% | $6.70* | 25 s | 51 s | 77% | 100% |
| 10 | GPT-5.6 SolOpenAI | Intervalo del 95%: 64 a 95% | $11.33* | 27 s | 37 s | 77% | 100% |
| 10 | Qwen3.8 MaxAlibaba (Qwen) | Intervalo del 95%: 64 a 95% | $16.32 | 43 s | 82 s | 77% | 100% |
| 10 | Claude Opus 5Anthropic | Intervalo del 95%: 64 a 95% | $16.89* | 27 s | 83 s | 77% | 100% |
| 10 | GPT-5.5OpenAI | Intervalo del 95%: 64 a 95% | $17.02* | 22 s | 34 s | 77% | 100% |
| 10 | GPT-6 AstraOpenAI | Intervalo del 95%: 64 a 95% | $27.91* | 11 s | 38 s | 77% | 100% |
| 10 | Claude Fable 5.1Anthropic | Intervalo del 95%: 64 a 95% | $33.11* | 26 s | 51 s | 77% | 100% |
| 18 | GPT-5.6 LunaOpenAI | Intervalo del 95%: 58 a 92% | $0.677* | 28 s | 34 s | 69% | 100% |
| 18 | Muse Glimmer 30BMeta · pesos abiertos | Intervalo del 95%: 58 a 92% | $3.10 | 13 s | 27 s | 69% | 100% |
| 18 | Grok 4.3xAI | Intervalo del 95%: 58 a 92% | $4.10 | 7.4 s | 9.7 s | 77% | 86% |
| 18 | GPT-5.6 TerraOpenAI | Intervalo del 95%: 58 a 92% | $6.68* | 29 s | 36 s | 69% | 100% |
| 18 | Qwen3.8 27BAlibaba (Qwen) · pesos abiertos | Intervalo del 95%: 58 a 92% | $7.30 | 43 s | 89 s | 77% | 86% |
| 23 | gpt-oss-120bOpenAI · pesos abiertos | Intervalo del 95%: 53 a 89% | $0.422 | 33 s | 69 s | 77% | 71% |
| 23 | MiniMax M3MiniMax · pesos abiertos | Intervalo del 95%: 53 a 89% | $1.82 | 6.4 s | 45 s | 77% | 71% |
| 23 | Claude Sonnet 4.6Anthropic | Intervalo del 95%: 53 a 89% | $11.24* | 28 s | 54 s | 62% | 100% |
| 23 | Kimi K2.6Moonshot AI · pesos abiertos | Intervalo del 95%: 53 a 89% | $11.68 | 28 s | 73 s | 69% | 86% |
| 27 | Gemma 4 31BGoogle · pesos abiertos | Intervalo del 95%: 39 a 78% | $0.558 | 11 s | 36 s | 46% | 86% |
| 28 | Llama 4 MaverickMeta · pesos abiertos | Intervalo del 95%: 26 a 66% | $0.665 | 14 s | 21 s | 38% | 57% |
| 28 | Gemini 3.1 Flash-LiteGoogle | Intervalo del 95%: 26 a 66% | $1.41 | 1.7 s | 3.2 s | 38% | 57% |
| 30 | GPT-5.4 miniOpenAI | Intervalo del 95%: 22 a 61% | $3.35 | 1.7 s | 2.3 s | 23% | 71% |
| 30 | Mistral Medium 3.5Mistral · pesos abiertos | Intervalo del 95%: 22 a 61% | $7.40 | 1.6 s | 2.3 s | 38% | 43% |
| 32 | Gemini 3.5 Flash-LiteGoogle | Intervalo del 95%: 18 a 57% | $2.47 | 1.2 s | 1.5 s | 23% | 57% |
| 32 | Claude Haiku 4.5Anthropic | Intervalo del 95%: 18 a 57% | $6.62 | 2.5 s | 3.4 s | 23% | 57% |
| 34 | GPT-5.4 nanoOpenAI | Intervalo del 95%: 15 a 52% | $1.51 | 2.7 s | 3.8 s | 23% | 43% |
| 35 | Ministral 3 14BMistral · pesos abiertos | Intervalo del 95%: 8 a 42% | $1.07 | 3.9 s | 5.4 s | 8% | 43% |
| 35 | Mistral Small 4Mistral · pesos abiertos | Intervalo del 95%: 8 a 42% | $1.33 | 2.0 s | 20 s | 15% | 29% |
La tasa de éxito es la proporción de ejecuciones superadas. Debajo se muestra su intervalo del 95%: la tasa real de un modelo podría estar en cualquier punto de esa barra. El coste por acierto se calcula dividiendo el coste de todas las ejecuciones, incluidas las fallidas, entre las que se superaron. Un asterisco indica que el coste se calculó según el precio de lista del fabricante cuando el proveedor no comunicó ninguno.
Por tipo de trabajo
El porcentaje de ejecuciones aprobadas en cada tipo de tarea, entre todos los modelos, y los modelos que la aprobaron con más frecuencia.
| Tipo de tarea | Tareas | Ejecuciones aprobadas | Quienes más aprobaron |
|---|---|---|---|
| Enrutamiento de solicitudes | 2 | 96% | 33 modelos con un 100% |
| Extracción de datos de facturas | 2 | 90% | 29 modelos con un 100% |
| Clasificación de correos electrónicos | 1 | 83% | 30 modelos con un 100% |
| Resúmenes de reuniones | 1 | 83% | 30 modelos con un 100% |
| Cálculos empresariales | 2 | 76% | 19 modelos con un 100% |
| Cualificación de leads | 1 | 72% | 26 modelos con un 100% |
| Contabilidad | 2 | 71% | 24 modelos con un 100% |
| Programación de citas | 2 | 69% | 21 modelos con un 100% |
| Consultas sobre políticas | 1 | 69% | 25 modelos con un 100% |
| Atención al cliente | 2 | 67% | 17 modelos con un 100% |
| Descripciones de productos | 1 | 58% | 21 modelos con un 100% |
| Presupuestos | 2 | 51% | 9 modelos con un 100% |
| Respuestas a reseñas | 1 | 22% | 8 modelos con un 100% |
Las tareas
Primero, las más difíciles. Cada página muestra la tarea tal como la recibieron los modelos, sus trampas, todas las comprobaciones explicadas y los errores de cada modelo.
Por tipo de negocio
Las tareas que un tipo de negocio encargaría a la IA, una junto a otra, con el resultado de cada modelo en cada tarea.
- Mejor modelo de IA para despachos contables
- 6 tareas: clasificar un extracto bancario italiano, clasificar movimientos bancarios, extraer datos de facturas, extraer datos de facturas de proveedores italianos, calcular facturas de profesionales italianos y calcular el pago de horas extra.
- Mejor modelo de IA para restaurantes y bares
- 4 tareas: responder a reseñas negativas, clasificar los correos de una empresa, clasificar movimientos bancarios y clasificar un extracto bancario italiano.
- Mejor modelo de IA para tiendas
- 4 tareas: responder a solicitudes de reembolso, responder a reclamaciones de garantía en italiano, redactar descripciones de productos en italiano y redactar actas de reuniones.
- Mejor modelo de IA para empresas de oficios y servicios
- 6 tareas: calcular el precio de un trabajo a partir de una lista de precios, redactar correos de presupuestos, puntuar leads de ventas, derivar mensajes de clientes, calcular el pago de horas extra y responder preguntas sobre el manual del personal.
Cómo se evalúa
Las mismas instrucciones y el mismo material para todos los modelos, una respuesta por ejecución y un veredicto que no depende de cómo suene la respuesta.
- Aprobado o suspenso
- Una respuesta solo aprueba si supera todas las comprobaciones fijas. En las tareas que también tienen rúbrica, debe cumplir además la mayoría de sus criterios, incluidos obligatoriamente los más importantes. No hay puntuación parcial.
- Comprobaciones fijas
- Las respuestas estructuradas se comprueban campo por campo frente a los valores correctos, con un margen de tolerancia para importes y horas. En las respuestas escritas se comprueba qué deben decir, qué no deben decir y su longitud máxima. El mismo código evalúa todos los modelos.
- El evaluador de la rúbrica
- gpt-5-6-sol evalúa cada criterio de la rúbrica con temperatura cero y explica el motivo. Cada respuesta se evalúa dos veces; si hay discrepancias sobre algún criterio, una tercera evaluación las resuelve. Se ignora el veredicto del propio evaluador: el código aplica la regla de aprobado a los criterios evaluados. Antes de la ejecución, el evaluador se probó dos veces con respuestas cuyo veredicto ya se conocía.
- Un único protocolo
- Cada ejecución consta de un mensaje de instrucciones y otro con el material: sin herramientas, sin búsquedas web, sin modo JSON, con la configuración de muestreo predeterminada de cada modelo y un máximo de 4,000 tokens de salida, incluido el razonamiento. Si una respuesta se corta al alcanzar ese límite, se evalúa tal como queda. 1 ejecución por modelo en cada tarea.
- Reglas auditadas
- Antes de publicar una edición, se revisan todos los fallos causados por una regla decisiva. Si una regla suspende una respuesta correcta por omitir un detalle que las instrucciones nunca pidieron, se corrige y se vuelven a evaluar esas respuestas. Si detecta un error real, se mantiene, por muchos modelos que suspenda.
- Coste y tiempo
- El coste de una ejecución es el importe facturado por el proveedor o, si no informa del coste, el de sus tokens según el precio de catálogo del creador del modelo. El tiempo se mide desde la solicitud hasta la última palabra de la respuesta; las llamadas fallidas no se incluyen.
- Intervalos
- Cada tasa de aciertos incluye un intervalo de Wilson del 95%. Con unas pocas decenas de ejecuciones por modelo, una diferencia de varios puntos entre dos modelos puede deberse al azar, y las barras lo reflejan.
- Los datos
- Las tareas, comprobaciones y resultados se publican bajo la licencia CC BY 4.0: cita a AIGROW y enlaza esta página. Cada página de tarea incluye la cadena señuelo de la edición para que las tareas puedan excluirse de los conjuntos de entrenamiento.
Pon a trabajar a los modelos que aprueban
Un agente de AIGROW hace este tipo de trabajo dentro de tus propias herramientas y siguiendo reglas que apruebas por escrito. Si prefieres ejecutar los modelos por tu cuenta, el crédito de API cuesta una cuarta parte del precio de catálogo.
Edición de octubre de 2026, piloto