36 modèles d’IA face à 20 tâches réelles de petites entreprises
Factures, devis, plannings, réponses aux avis et tri des e-mails : chaque tâche comporte un piège dans lequel une réponse trop rapide peut tomber. Chaque réponse est acceptée ou rejetée dans son ensemble, et le coût de chaque réussite est calculé.
Une édition pilote : 20 tâches sur les 40 de l’édition, avec 1 essais par modèle.
- Modèles
- 36
- Tâches
- 20 sur 40
- Exécutions
- 720
- Évaluateur selon la grille
- Calibré
Édition réalisée en octobre 2026. Données sous licence CC BY 4.0.
Le benchmark AIGROW pour les petites entreprises soumet 20 tâches administratives courantes à 36 modèles d’IA et évalue chaque réponse selon des critères écrits : réussite ou échec. Dans l’édition d’octobre 2026, 3 modèles sont arrivés à égalité en tête avec 95%, et gpt-oss-120b a obtenu les réussites les moins chères, à $0.422 pour mille. Chaque tâche, chaque vérification et chaque résultat sont publiés.
Résultats
Ce que montre l’édition d’octobre 2026, et avec quel degré de certitude.
Qwen3.8 Flash, Kimi K3 et Gemini 3.1 Pro (preview) ont chacun réussi 95% de leurs exécutions, le meilleur taux de cette édition.
Les intervalles à 95 % de 6 de plus modèles atteignent ce taux. Avec 20 exécutions par modèle, il est impossible de les distinguer de le premier. Les barres du classement montrent l’amplitude possible de chaque taux.
Le coût de mille réussites va de $0.422 à $33.11, soit un écart de 78×.
gpt-oss-120b affiche les réussites les moins chères, Claude Fable 5.1 les plus chères. Les échecs pénalisent les modèles qui échouent souvent, car le coût inclut toutes leurs exécutions.
Répondez publiquement à un avis négatif sur un restaurant sans révéler d’informations privées était la tâche la plus difficile : 22% des exécutions ont réussi.
Une tâche en anglais, catégorie : réponses aux avis. Sa page détaille les pièges et les critères de vérification auxquels la plupart des modèles ont échoué.
Les tâches en italien ont été réussies dans 83% des exécutions, contre 65% pour les tâches en anglais.
Les tâches en italien ont été conçues pour les entreprises italiennes, avec leurs règles fiscales et d’étiquetage. Ce ne sont pas des traductions des tâches en anglais. L’écart reflète à la fois la langue et la difficulté.
Le temps de réponse médian allait de 1.2 s pour Gemini 3.5 Flash-Lite à 43 s pour Qwen3.8 Max.
Mesuré entre l’envoi de la requête et le dernier mot de la réponse, sans les appels échoués. La colonne p90 montre les réponses les plus lentes qu’un client pourrait attendre.
Le classement
Tous les modèles sur toutes les tâches, classés selon la fréquence à laquelle leurs réponses ont été acceptées. Triez par coût pour connaître le prix d’une réussite, ou par vitesse pour voir qui répond le plus vite.
Taux de réussite le plus élevé en premier.
| # | Modèle | Taux de réussite | Pour 1 000 réussites | Médiane | p90 | Anglais | Italien |
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.8 FlashAlibaba (Qwen) | Intervalle à 95 % : de 76 à 99 % | $1.09 | 29 s | 44 s | 92% | 100% |
| 1 | Kimi K3Moonshot AI · poids ouverts | Intervalle à 95 % : de 76 à 99 % | $18.44 | 15 s | 78 s | 100% | 86% |
| 1 | Gemini 3.1 Pro (preview)Google | Intervalle à 95 % : de 76 à 99 % | $29.67 | 17 s | 21 s | 92% | 100% |
| 4 | GLM-5.3-FlashZ.ai · poids ouverts | Intervalle à 95 % : de 70 à 97 % | $0.831 | 15 s | 31 s | 92% | 86% |
| 4 | DeepSeek V4.1 FlashDeepSeek · poids ouverts | Intervalle à 95 % : de 70 à 97 % | $1.05 | 14 s | 127 s | 85% | 100% |
| 4 | DeepSeek V4 ProDeepSeek · poids ouverts | Intervalle à 95 % : de 70 à 97 % | $5.14 | 21 s | 49 s | 85% | 100% |
| 4 | GLM-5.3Z.ai · poids ouverts | Intervalle à 95 % : de 70 à 97 % | $7.02 | 9.2 s | 31 s | 92% | 86% |
| 4 | Gemini 3.8 FlashGoogle | Intervalle à 95 % : de 70 à 97 % | $7.17 | 11 s | 16 s | 85% | 100% |
| 4 | Grok 4.7xAI | Intervalle à 95 % : de 70 à 97 % | $9.41 | 17 s | 27 s | 92% | 86% |
| 10 | Qwen3.7 PlusAlibaba (Qwen) | Intervalle à 95 % : de 64 à 95 % | $3.58 | 29 s | 41 s | 77% | 100% |
| 10 | Claude Sonnet 5Anthropic | Intervalle à 95 % : de 64 à 95 % | $6.70* | 25 s | 51 s | 77% | 100% |
| 10 | GPT-5.6 SolOpenAI | Intervalle à 95 % : de 64 à 95 % | $11.33* | 27 s | 37 s | 77% | 100% |
| 10 | Qwen3.8 MaxAlibaba (Qwen) | Intervalle à 95 % : de 64 à 95 % | $16.32 | 43 s | 82 s | 77% | 100% |
| 10 | Claude Opus 5Anthropic | Intervalle à 95 % : de 64 à 95 % | $16.89* | 27 s | 83 s | 77% | 100% |
| 10 | GPT-5.5OpenAI | Intervalle à 95 % : de 64 à 95 % | $17.02* | 22 s | 34 s | 77% | 100% |
| 10 | GPT-6 AstraOpenAI | Intervalle à 95 % : de 64 à 95 % | $27.91* | 11 s | 38 s | 77% | 100% |
| 10 | Claude Fable 5.1Anthropic | Intervalle à 95 % : de 64 à 95 % | $33.11* | 26 s | 51 s | 77% | 100% |
| 18 | GPT-5.6 LunaOpenAI | Intervalle à 95 % : de 58 à 92 % | $0.677* | 28 s | 34 s | 69% | 100% |
| 18 | Muse Glimmer 30BMeta · poids ouverts | Intervalle à 95 % : de 58 à 92 % | $3.10 | 13 s | 27 s | 69% | 100% |
| 18 | Grok 4.3xAI | Intervalle à 95 % : de 58 à 92 % | $4.10 | 7.4 s | 9.7 s | 77% | 86% |
| 18 | GPT-5.6 TerraOpenAI | Intervalle à 95 % : de 58 à 92 % | $6.68* | 29 s | 36 s | 69% | 100% |
| 18 | Qwen3.8 27BAlibaba (Qwen) · poids ouverts | Intervalle à 95 % : de 58 à 92 % | $7.30 | 43 s | 89 s | 77% | 86% |
| 23 | gpt-oss-120bOpenAI · poids ouverts | Intervalle à 95 % : de 53 à 89 % | $0.422 | 33 s | 69 s | 77% | 71% |
| 23 | MiniMax M3MiniMax · poids ouverts | Intervalle à 95 % : de 53 à 89 % | $1.82 | 6.4 s | 45 s | 77% | 71% |
| 23 | Claude Sonnet 4.6Anthropic | Intervalle à 95 % : de 53 à 89 % | $11.24* | 28 s | 54 s | 62% | 100% |
| 23 | Kimi K2.6Moonshot AI · poids ouverts | Intervalle à 95 % : de 53 à 89 % | $11.68 | 28 s | 73 s | 69% | 86% |
| 27 | Gemma 4 31BGoogle · poids ouverts | Intervalle à 95 % : de 39 à 78 % | $0.558 | 11 s | 36 s | 46% | 86% |
| 28 | Llama 4 MaverickMeta · poids ouverts | Intervalle à 95 % : de 26 à 66 % | $0.665 | 14 s | 21 s | 38% | 57% |
| 28 | Gemini 3.1 Flash-LiteGoogle | Intervalle à 95 % : de 26 à 66 % | $1.41 | 1.7 s | 3.2 s | 38% | 57% |
| 30 | GPT-5.4 miniOpenAI | Intervalle à 95 % : de 22 à 61 % | $3.35 | 1.7 s | 2.3 s | 23% | 71% |
| 30 | Mistral Medium 3.5Mistral · poids ouverts | Intervalle à 95 % : de 22 à 61 % | $7.40 | 1.6 s | 2.3 s | 38% | 43% |
| 32 | Gemini 3.5 Flash-LiteGoogle | Intervalle à 95 % : de 18 à 57 % | $2.47 | 1.2 s | 1.5 s | 23% | 57% |
| 32 | Claude Haiku 4.5Anthropic | Intervalle à 95 % : de 18 à 57 % | $6.62 | 2.5 s | 3.4 s | 23% | 57% |
| 34 | GPT-5.4 nanoOpenAI | Intervalle à 95 % : de 15 à 52 % | $1.51 | 2.7 s | 3.8 s | 23% | 43% |
| 35 | Ministral 3 14BMistral · poids ouverts | Intervalle à 95 % : de 8 à 42 % | $1.07 | 3.9 s | 5.4 s | 8% | 43% |
| 35 | Mistral Small 4Mistral · poids ouverts | Intervalle à 95 % : de 8 à 42 % | $1.33 | 2.0 s | 20 s | 15% | 29% |
Le taux de réussite correspond à la part des exécutions réussies. Son intervalle à 95 % est représenté en dessous : le taux réel du modèle pourrait se situer n’importe où sur la barre. Le coût par réussite divise le coût de toutes les exécutions, échecs compris, par le nombre de réussites. Un astérisque indique un coût calculé à partir du tarif public du fabricant lorsque le fournisseur n’a communiqué aucun coût.
Par type de travail
La part des essais réussis pour chaque type de tâche, tous modèles confondus, et les modèles qui réussissent le plus souvent.
| Type de tâche | Tâches | Essais réussis | Meilleur taux de réussite |
|---|---|---|---|
| Orientation des demandes | 2 | 96% | 33 modèles à 100% |
| Extraction des données de factures | 2 | 90% | 29 modèles à 100% |
| Tri des e-mails | 1 | 83% | 30 modèles à 100% |
| Comptes rendus de réunion | 1 | 83% | 30 modèles à 100% |
| Calculs pour l’entreprise | 2 | 76% | 19 modèles à 100% |
| Qualification des prospects | 1 | 72% | 26 modèles à 100% |
| Comptabilité | 2 | 71% | 24 modèles à 100% |
| Prise de rendez-vous | 2 | 69% | 21 modèles à 100% |
| Questions sur les politiques internes | 1 | 69% | 25 modèles à 100% |
| Support client | 2 | 67% | 17 modèles à 100% |
| Descriptions de produits | 1 | 58% | 21 modèles à 100% |
| Devis | 2 | 51% | 9 modèles à 100% |
| Réponses aux avis | 1 | 22% | 8 modèles à 100% |
Les tâches
Les plus difficiles d’abord. Chaque page présente la tâche telle que les modèles l’ont reçue, ses pièges, tous les critères de contrôle expliqués et les erreurs de chaque modèle.
Par type d’entreprise
Les tâches qu’un type d’entreprise confierait à l’IA, côte à côte, avec le résultat de chaque modèle pour chacune.
- Meilleur modèle d’IA pour les cabinets comptables
- 6 tâches : catégoriser un relevé bancaire italien, catégoriser des transactions bancaires, extraire les données de factures, extraire les données de factures de fournisseurs italiens, calculer des factures de professionnels en Italie et calculer la rémunération des heures supplémentaires.
- Meilleur modèle d’IA pour les restaurants et les bars
- 4 tâches : répondre aux avis négatifs, trier les e-mails d’une entreprise, catégoriser des transactions bancaires et catégoriser un relevé bancaire italien.
- Meilleur modèle d’IA pour les commerces
- 4 tâches : répondre aux demandes de remboursement, répondre aux demandes de garantie en italien, rédiger des descriptions de produits en italien et rédiger des comptes rendus de réunion.
- Meilleur modèle d’IA pour les artisans et les entreprises de services
- 6 tâches : chiffrer une prestation à partir d’une grille tarifaire, rédiger des e-mails de devis, évaluer des prospects commerciaux, orienter les messages des clients, calculer la rémunération des heures supplémentaires et répondre aux questions sur le manuel du personnel.
Comment les réponses sont évaluées
Les mêmes consignes et les mêmes éléments pour tous les modèles, une réponse par essai et un verdict qui ne dépend pas du style de la réponse.
- Réussite ou échec
- Une réponse n’est acceptée que si elle satisfait à tous les contrôles fixes. Pour les tâches dotées d’une grille d’évaluation, elle doit aussi remplir la plupart de ses critères, dont tous les critères obligatoires. Aucun crédit partiel n’est accordé.
- Contrôles fixes
- Les réponses structurées sont comparées champ par champ aux valeurs attendues, avec une marge de tolérance pour les montants et les heures. Les réponses rédigées sont vérifiées selon ce qu’elles doivent dire, ce qu’elles ne doivent pas dire et leur longueur maximale. Le même code évalue tous les modèles.
- L’évaluateur selon la grille
- Les critères de la grille sont évalués par gpt-5-6-sol à température zéro, avec une justification pour chacun. Chaque réponse est évaluée deux fois, puis une troisième évaluation tranche tout désaccord sur un critère. Le verdict de l’évaluateur lui-même est ignoré : le code applique la règle de réussite aux critères évalués. Avant les essais, l’évaluateur a été testé deux fois sur des réponses dont le verdict était connu.
- Un protocole unique
- Chaque essai comprend un message de consignes et un message contenant les éléments de la tâche : aucun outil, aucune recherche sur le Web, aucun mode JSON, les paramètres d’échantillonnage par défaut de chaque modèle et jusqu’à 4,000 tokens en sortie, raisonnement compris. Une réponse interrompue à cette limite est évaluée telle quelle. 1 essais par modèle pour chaque tâche.
- Règles auditées
- Avant la publication d’une édition, chaque échec dû à une règle déterminante est examiné. Si une règle rejette une bonne réponse parce qu’elle omet un détail jamais demandé dans les consignes, elle est corrigée et les réponses concernées sont réévaluées. Une règle qui détecte une véritable erreur est conservée, quel que soit le nombre de modèles qu’elle fait échouer.
- Coût et durée
- Le coût d’un essai correspond au montant facturé par le fournisseur ou, si celui-ci ne communique aucun coût, au prix catalogue du créateur appliqué aux tokens utilisés. La durée va de l’envoi de la requête au dernier mot de la réponse. Les appels qui ont échoué en sont exclus.
- Intervalles
- Chaque taux de réussite est accompagné d’un intervalle de Wilson à 95 %. Avec quelques dizaines d’essais par modèle, plusieurs points d’écart entre deux modèles peuvent être dus au hasard. Les barres en tiennent compte.
- Les données
- Les tâches, les contrôles et les résultats sont publiés sous licence CC BY 4.0 : citez AIGROW et ajoutez un lien vers cette page. Chaque page de tâche contient la chaîne canari de l’édition, afin de permettre l’exclusion des tâches des jeux d’entraînement.
Mettez les modèles qui réussissent au travail
Un agent AIGROW réalise ce type de travail dans vos propres outils, selon des règles que vous approuvez par écrit. Pour faire tourner les modèles vous-même, le crédit API coûte un quart du prix catalogue.
Édition d’octobre 2026, pilote