Respuestas rápidas

AIGrow ofrece monitorización de visibilidad en IA, un asistente empresarial, publicación de artículos y servicios de automatización con alcance definido. Empieza con el análisis gratuito para revisar el resultado antes de pagar.

Haz el análisis gratuito

El análisis es gratuito y los planes de monitorización empiezan en $29 al mes. La auditoría de operaciones cuesta $290, la auditoría de visibilidad cuesta $490 y los desarrollos a medida reciben un precio por escrito antes de empezar el trabajo.

Ver los planes

Haz el análisis gratuito. Lee tu sitio, pregunta a varios asistentes de IA qué preguntan tus clientes y te señala una cosa concreta. No necesitas registrarte y te dirá si no nos necesitas.

Empieza ahora

Sí. Usa el formulario de contacto para preguntas sobre el producto, la facturación, el soporte o un proyecto. Describe el objetivo y el sistema implicado para que la primera respuesta sea concreta.

Contacta con AIGrow
Benchmark · edición de octubre de 2026 · piloto

36 modelos de IA ante 20 tareas reales de pequeñas empresas

Facturas, presupuestos, turnos, respuestas a reseñas y clasificación de correos, cada tarea con una trampa en la que cae una respuesta descuidada. Cada respuesta se aprueba o se suspende en su conjunto, y se calcula el coste de cada respuesta aprobada.

Una prueba piloto: 20 de las 40 tareas de la edición, 1 ejecución por modelo.

Mayor tasa de aciertos
95%Empate entre 3 modelos, con 19 de 20 ejecuciones aprobadas cada uno
Modelos
36
Tareas
20 de 40
Rondas
720
Evaluador de la rúbrica
Calibrado

Ejecutado en octubre de 2026. Datos bajo la licencia CC BY 4.0.

La evaluación de AIGROW para pequeñas empresas plantea 20 tareas administrativas cotidianas a 36 modelos de IA y decide si cada respuesta aprueba o suspende según comprobaciones documentadas. En la edición de octubre de 2026, 3 modelos empataron en el primer puesto con 95%, y gpt-oss-120b ofreció las aprobaciones más baratas, a $0.422 por cada mil. Se publican todas las tareas, comprobaciones y resultados.

Resultados

Qué muestra la edición de octubre de 2026 y qué grado de certeza ofrecen sus resultados.

  1. Qwen3.8 Flash, Kimi K3 y Gemini 3.1 Pro (preview) superaron 95% de sus ejecuciones, la tasa más alta de esta edición.

    Los intervalos del 95% de 6 modelos más alcanzan esa tasa. Con 20 ejecuciones por modelo, no se pueden distinguir estadísticamente de el líder; las barras de la clasificación muestran cuánto podría variar cada uno.

  2. Mil aciertos cuestan entre $0.422 y $33.11, una diferencia de 78×.

    gpt-oss-120b logró los aciertos más baratos y Claude Fable 5.1, los más caros. Los modelos que fallan a menudo pagan aquí por esos fallos, porque el coste incluye todas sus ejecuciones.

  3. Responde públicamente a una reseña negativa de un restaurante sin revelar datos privados fue la tarea más difícil: se superó el 22% de las ejecuciones.

    Una tarea del benchmark (categoría: respuestas a reseñas; idioma: inglés). Su página detalla las trampas y las comprobaciones que la mayoría de los modelos no superó.

  4. Las tareas en italiano se superaron en el 83% de las ejecuciones, frente al 65% de las tareas en inglés.

    Las tareas en italiano son tareas propias, creadas para empresas italianas conforme a sus normas fiscales y de etiquetado, no traducciones de las tareas en inglés. La diferencia refleja tanto el idioma como la dificultad.

  5. La mediana del tiempo de respuesta fue de 1.2 s para Gemini 3.5 Flash-Lite a 43 s para Qwen3.8 Max.

    Se mide desde la solicitud hasta la última palabra de la respuesta, excluidas las llamadas fallidas. La columna p90 muestra cuánto podría tardar una respuesta de las más lentas que tendría que esperar un cliente.

La clasificación

Todos los modelos en todas las tareas, ordenados según la frecuencia con la que aprobaron sus respuestas. Ordena por coste para ver cuánto cuesta una respuesta aprobada, o por velocidad para ver cuál responde primero.

Primero, la tasa de éxito más alta.

Tasa de éxito, coste por cada mil tareas superadas y tiempo de respuesta de 36 modelos de IA
#ModeloTasa de éxitoPor 1,000 aciertosMedianap90InglésItaliano
1Qwen3.8 FlashAlibaba (Qwen)95%Intervalo del 95%: 76 a 99%$1.0929 s44 s92%100%
1Kimi K3Moonshot AI · pesos abiertos95%Intervalo del 95%: 76 a 99%$18.4415 s78 s100%86%
1Gemini 3.1 Pro (preview)Google95%Intervalo del 95%: 76 a 99%$29.6717 s21 s92%100%
4GLM-5.3-FlashZ.ai · pesos abiertos90%Intervalo del 95%: 70 a 97%$0.83115 s31 s92%86%
4DeepSeek V4.1 FlashDeepSeek · pesos abiertos90%Intervalo del 95%: 70 a 97%$1.0514 s127 s85%100%
4DeepSeek V4 ProDeepSeek · pesos abiertos90%Intervalo del 95%: 70 a 97%$5.1421 s49 s85%100%
4GLM-5.3Z.ai · pesos abiertos90%Intervalo del 95%: 70 a 97%$7.029.2 s31 s92%86%
4Gemini 3.8 FlashGoogle90%Intervalo del 95%: 70 a 97%$7.1711 s16 s85%100%
4Grok 4.7xAI90%Intervalo del 95%: 70 a 97%$9.4117 s27 s92%86%
10Qwen3.7 PlusAlibaba (Qwen)85%Intervalo del 95%: 64 a 95%$3.5829 s41 s77%100%
10Claude Sonnet 5Anthropic85%Intervalo del 95%: 64 a 95%$6.70*25 s51 s77%100%
10GPT-5.6 SolOpenAI85%Intervalo del 95%: 64 a 95%$11.33*27 s37 s77%100%
10Qwen3.8 MaxAlibaba (Qwen)85%Intervalo del 95%: 64 a 95%$16.3243 s82 s77%100%
10Claude Opus 5Anthropic85%Intervalo del 95%: 64 a 95%$16.89*27 s83 s77%100%
10GPT-5.5OpenAI85%Intervalo del 95%: 64 a 95%$17.02*22 s34 s77%100%
10GPT-6 AstraOpenAI85%Intervalo del 95%: 64 a 95%$27.91*11 s38 s77%100%
10Claude Fable 5.1Anthropic85%Intervalo del 95%: 64 a 95%$33.11*26 s51 s77%100%
18GPT-5.6 LunaOpenAI80%Intervalo del 95%: 58 a 92%$0.677*28 s34 s69%100%
18Muse Glimmer 30BMeta · pesos abiertos80%Intervalo del 95%: 58 a 92%$3.1013 s27 s69%100%
18Grok 4.3xAI80%Intervalo del 95%: 58 a 92%$4.107.4 s9.7 s77%86%
18GPT-5.6 TerraOpenAI80%Intervalo del 95%: 58 a 92%$6.68*29 s36 s69%100%
18Qwen3.8 27BAlibaba (Qwen) · pesos abiertos80%Intervalo del 95%: 58 a 92%$7.3043 s89 s77%86%
23gpt-oss-120bOpenAI · pesos abiertos75%Intervalo del 95%: 53 a 89%$0.42233 s69 s77%71%
23MiniMax M3MiniMax · pesos abiertos75%Intervalo del 95%: 53 a 89%$1.826.4 s45 s77%71%
23Claude Sonnet 4.6Anthropic75%Intervalo del 95%: 53 a 89%$11.24*28 s54 s62%100%
23Kimi K2.6Moonshot AI · pesos abiertos75%Intervalo del 95%: 53 a 89%$11.6828 s73 s69%86%
27Gemma 4 31BGoogle · pesos abiertos60%Intervalo del 95%: 39 a 78%$0.55811 s36 s46%86%
28Llama 4 MaverickMeta · pesos abiertos45%Intervalo del 95%: 26 a 66%$0.66514 s21 s38%57%
28Gemini 3.1 Flash-LiteGoogle45%Intervalo del 95%: 26 a 66%$1.411.7 s3.2 s38%57%
30GPT-5.4 miniOpenAI40%Intervalo del 95%: 22 a 61%$3.351.7 s2.3 s23%71%
30Mistral Medium 3.5Mistral · pesos abiertos40%Intervalo del 95%: 22 a 61%$7.401.6 s2.3 s38%43%
32Gemini 3.5 Flash-LiteGoogle35%Intervalo del 95%: 18 a 57%$2.471.2 s1.5 s23%57%
32Claude Haiku 4.5Anthropic35%Intervalo del 95%: 18 a 57%$6.622.5 s3.4 s23%57%
34GPT-5.4 nanoOpenAI30%Intervalo del 95%: 15 a 52%$1.512.7 s3.8 s23%43%
35Ministral 3 14BMistral · pesos abiertos20%Intervalo del 95%: 8 a 42%$1.073.9 s5.4 s8%43%
35Mistral Small 4Mistral · pesos abiertos20%Intervalo del 95%: 8 a 42%$1.332.0 s20 s15%29%

La tasa de éxito es la proporción de ejecuciones superadas. Debajo se muestra su intervalo del 95%: la tasa real de un modelo podría estar en cualquier punto de esa barra. El coste por acierto se calcula dividiendo el coste de todas las ejecuciones, incluidas las fallidas, entre las que se superaron. Un asterisco indica que el coste se calculó según el precio de lista del fabricante cuando el proveedor no comunicó ninguno.

Por tipo de trabajo

El porcentaje de ejecuciones aprobadas en cada tipo de tarea, entre todos los modelos, y los modelos que la aprobaron con más frecuencia.

Tasa de aciertos por tipo de tarea
Tipo de tareaTareasEjecuciones aprobadasQuienes más aprobaron
Enrutamiento de solicitudes296%33 modelos con un 100%
Extracción de datos de facturas290%29 modelos con un 100%
Clasificación de correos electrónicos183%30 modelos con un 100%
Resúmenes de reuniones183%30 modelos con un 100%
Cálculos empresariales276%19 modelos con un 100%
Cualificación de leads172%26 modelos con un 100%
Contabilidad271%24 modelos con un 100%
Programación de citas269%21 modelos con un 100%
Consultas sobre políticas169%25 modelos con un 100%
Atención al cliente267%17 modelos con un 100%
Descripciones de productos158%21 modelos con un 100%
Presupuestos251%9 modelos con un 100%
Respuestas a reseñas122%8 modelos con un 100%

Las tareas

Primero, las más difíciles. Cada página muestra la tarea tal como la recibieron los modelos, sus trampas, todas las comprobaciones explicadas y los errores de cada modelo.

Las tareas, de la más difícil a la más fácil
TareaTipoIdiomaEjecuciones aprobadas
Responde públicamente a una reseña negativa de un restaurante sin revelar datos privadosRespuestas a reseñasInglés8 de 36
Redacta un correo con un presupuesto de jardinería que atienda una petición sobre el IVA y tenga en cuenta un árbol protegidoPresupuestosInglés16 de 36
Responde a una clienta que solicita un reembolso fuera del plazo previstoAtención al clienteInglés17 de 36
Calcula el salario bruto semanal de un trabajador de limpieza, teniendo en cuenta las pausas, las horas extra y la tarifa del domingoCálculos empresarialesInglés19 de 36
Redacta en italiano la descripción comercial de un aceite de oliva que cumpla las normas de etiquetadoDescripciones de productosItaliano21 de 36
Calcula el presupuesto de un trabajo de pintura y decoración a partir de las medidas tomadas en la visita y la lista de preciosPresupuestosInglés21 de 36
Programa una llamada entre Londres y Nueva York en la semana en que cambia la diferencia horariaProgramación de citasInglés23 de 36
Clasificar los movimientos bancarios mensuales de una cafetería y calcular sus costes operativosContabilidadInglés24 de 36
Responde a las preguntas de una persona empleada a tiempo parcial sobre permisos y vacaciones según el manual del personalConsultas sobre políticasInglés25 de 36
Puntúa cinco posibles clientes entrantes de servicios de limpieza según las reglas del equipo comercialCualificación de leadsInglés26 de 36
Clasificar los movimientos bancarios de un bar italiano y calcular sus totalesContabilidadItaliano27 de 36
Busca una cita de higiene dental cerca de un festivo, en italianoProgramación de citasItaliano27 de 36
Convierte una reunión del equipo de una panadería en decisiones, responsables y fechas límiteResúmenes de reunionesInglés30 de 36
Clasifica los correos del lunes de una empresa de catering, incluido un intento de phishing y una solicitud de cambio de cuenta bancariaClasificación de correos electrónicosInglés30 de 36
Extrae los datos de una factura de un proveedor italiano con una línea de gastos excluida del IVAExtracción de datos de facturasItaliano31 de 36
Responde en italiano a una clienta que cree erróneamente que su garantía ha caducadoAtención al clienteItaliano31 de 36
Clasifica diez mensajes de inquilinos y asígnalos al equipo adecuado con la prioridad correctaEnrutamiento de solicitudesInglés33 de 36
Extrae los datos de una factura de proveedor de dos páginas para cuentas por pagarExtracción de datos de facturasInglés34 de 36
Calcular dos facturas de profesionales italianos con aportación a la caja de previsión, IVA y retención fiscalCálculos empresarialesItaliano36 de 36
Asigna los mensajes de los huéspedes de un hotel al departamento adecuado, en italianoEnrutamiento de solicitudesItaliano36 de 36

Por tipo de negocio

Las tareas que un tipo de negocio encargaría a la IA, una junto a otra, con el resultado de cada modelo en cada tarea.

Mejor modelo de IA para despachos contables
6 tareas: clasificar un extracto bancario italiano, clasificar movimientos bancarios, extraer datos de facturas, extraer datos de facturas de proveedores italianos, calcular facturas de profesionales italianos y calcular el pago de horas extra.
Mejor modelo de IA para restaurantes y bares
4 tareas: responder a reseñas negativas, clasificar los correos de una empresa, clasificar movimientos bancarios y clasificar un extracto bancario italiano.
Mejor modelo de IA para tiendas
4 tareas: responder a solicitudes de reembolso, responder a reclamaciones de garantía en italiano, redactar descripciones de productos en italiano y redactar actas de reuniones.
Mejor modelo de IA para empresas de oficios y servicios
6 tareas: calcular el precio de un trabajo a partir de una lista de precios, redactar correos de presupuestos, puntuar leads de ventas, derivar mensajes de clientes, calcular el pago de horas extra y responder preguntas sobre el manual del personal.

Cómo se evalúa

Las mismas instrucciones y el mismo material para todos los modelos, una respuesta por ejecución y un veredicto que no depende de cómo suene la respuesta.

Aprobado o suspenso
Una respuesta solo aprueba si supera todas las comprobaciones fijas. En las tareas que también tienen rúbrica, debe cumplir además la mayoría de sus criterios, incluidos obligatoriamente los más importantes. No hay puntuación parcial.
Comprobaciones fijas
Las respuestas estructuradas se comprueban campo por campo frente a los valores correctos, con un margen de tolerancia para importes y horas. En las respuestas escritas se comprueba qué deben decir, qué no deben decir y su longitud máxima. El mismo código evalúa todos los modelos.
El evaluador de la rúbrica
gpt-5-6-sol evalúa cada criterio de la rúbrica con temperatura cero y explica el motivo. Cada respuesta se evalúa dos veces; si hay discrepancias sobre algún criterio, una tercera evaluación las resuelve. Se ignora el veredicto del propio evaluador: el código aplica la regla de aprobado a los criterios evaluados. Antes de la ejecución, el evaluador se probó dos veces con respuestas cuyo veredicto ya se conocía.
Un único protocolo
Cada ejecución consta de un mensaje de instrucciones y otro con el material: sin herramientas, sin búsquedas web, sin modo JSON, con la configuración de muestreo predeterminada de cada modelo y un máximo de 4,000 tokens de salida, incluido el razonamiento. Si una respuesta se corta al alcanzar ese límite, se evalúa tal como queda. 1 ejecución por modelo en cada tarea.
Reglas auditadas
Antes de publicar una edición, se revisan todos los fallos causados por una regla decisiva. Si una regla suspende una respuesta correcta por omitir un detalle que las instrucciones nunca pidieron, se corrige y se vuelven a evaluar esas respuestas. Si detecta un error real, se mantiene, por muchos modelos que suspenda.
Coste y tiempo
El coste de una ejecución es el importe facturado por el proveedor o, si no informa del coste, el de sus tokens según el precio de catálogo del creador del modelo. El tiempo se mide desde la solicitud hasta la última palabra de la respuesta; las llamadas fallidas no se incluyen.
Intervalos
Cada tasa de aciertos incluye un intervalo de Wilson del 95%. Con unas pocas decenas de ejecuciones por modelo, una diferencia de varios puntos entre dos modelos puede deberse al azar, y las barras lo reflejan.
Los datos
Las tareas, comprobaciones y resultados se publican bajo la licencia CC BY 4.0: cita a AIGROW y enlaza esta página. Cada página de tarea incluye la cadena señuelo de la edición para que las tareas puedan excluirse de los conjuntos de entrenamiento.

Pon a trabajar a los modelos que aprueban

Un agente de AIGROW hace este tipo de trabajo dentro de tus propias herramientas y siguiendo reglas que apruebas por escrito. Si prefieres ejecutar los modelos por tu cuenta, el crédito de API cuesta una cuarta parte del precio de catálogo.

Edición de octubre de 2026, piloto