Réponses rapides

AIGrow propose un suivi de la visibilité dans les réponses des IA, un assistant pour les entreprises, la publication d’articles de blog et des services d’automatisation à périmètre défini. Commencez par l’analyse gratuite pour examiner les résultats avant de payer.

Lancer l’analyse gratuite

L’analyse est gratuite et les forfaits de suivi commencent à $29 par mois. L’audit des opérations coûte $290, l’audit de visibilité $490, et les projets sur mesure font l’objet d’un devis écrit avant le début des travaux.

Voir les forfaits

Lancez l’analyse gratuite. Elle lit votre site, demande à plusieurs assistants IA ce que recherchent vos clients et vous indique un point précis. Aucune inscription n’est requise, et elle vous dira si vous n’avez pas besoin de nous.

Commencer

Oui. Utilisez le formulaire de contact pour toute question sur le produit, la facturation, l’assistance ou un projet. Décrivez l’objectif et le système concerné afin que la première réponse soit précise.

Contacter AIGrow
Benchmark · édition octobre 2026 · pilote

36 modèles d’IA face à 20 tâches réelles de petites entreprises

Factures, devis, plannings, réponses aux avis et tri des e-mails : chaque tâche comporte un piège dans lequel une réponse trop rapide peut tomber. Chaque réponse est acceptée ou rejetée dans son ensemble, et le coût de chaque réussite est calculé.

Une édition pilote : 20 tâches sur les 40 de l’édition, avec 1 essais par modèle.

Meilleur taux de réussite
95%À égalité entre 3 modèles, avec 19 essais réussis sur 20 chacun
Modèles
36
Tâches
20 sur 40
Exécutions
720
Évaluateur selon la grille
Calibré

Édition réalisée en octobre 2026. Données sous licence CC BY 4.0.

Le benchmark AIGROW pour les petites entreprises soumet 20 tâches administratives courantes à 36 modèles d’IA et évalue chaque réponse selon des critères écrits : réussite ou échec. Dans l’édition d’octobre 2026, 3 modèles sont arrivés à égalité en tête avec 95%, et gpt-oss-120b a obtenu les réussites les moins chères, à $0.422 pour mille. Chaque tâche, chaque vérification et chaque résultat sont publiés.

Résultats

Ce que montre l’édition d’octobre 2026, et avec quel degré de certitude.

  1. Qwen3.8 Flash, Kimi K3 et Gemini 3.1 Pro (preview) ont chacun réussi 95% de leurs exécutions, le meilleur taux de cette édition.

    Les intervalles à 95 % de 6 de plus modèles atteignent ce taux. Avec 20 exécutions par modèle, il est impossible de les distinguer de le premier. Les barres du classement montrent l’amplitude possible de chaque taux.

  2. Le coût de mille réussites va de $0.422 à $33.11, soit un écart de 78×.

    gpt-oss-120b affiche les réussites les moins chères, Claude Fable 5.1 les plus chères. Les échecs pénalisent les modèles qui échouent souvent, car le coût inclut toutes leurs exécutions.

  3. Répondez publiquement à un avis négatif sur un restaurant sans révéler d’informations privées était la tâche la plus difficile : 22% des exécutions ont réussi.

    Une tâche en anglais, catégorie : réponses aux avis. Sa page détaille les pièges et les critères de vérification auxquels la plupart des modèles ont échoué.

  4. Les tâches en italien ont été réussies dans 83% des exécutions, contre 65% pour les tâches en anglais.

    Les tâches en italien ont été conçues pour les entreprises italiennes, avec leurs règles fiscales et d’étiquetage. Ce ne sont pas des traductions des tâches en anglais. L’écart reflète à la fois la langue et la difficulté.

  5. Le temps de réponse médian allait de 1.2 s pour Gemini 3.5 Flash-Lite à 43 s pour Qwen3.8 Max.

    Mesuré entre l’envoi de la requête et le dernier mot de la réponse, sans les appels échoués. La colonne p90 montre les réponses les plus lentes qu’un client pourrait attendre.

Le classement

Tous les modèles sur toutes les tâches, classés selon la fréquence à laquelle leurs réponses ont été acceptées. Triez par coût pour connaître le prix d’une réussite, ou par vitesse pour voir qui répond le plus vite.

Taux de réussite le plus élevé en premier.

Taux de réussite, coût pour mille réussites et temps de réponse de 36 modèles IA
#ModèleTaux de réussitePour 1 000 réussitesMédianep90AnglaisItalien
1Qwen3.8 FlashAlibaba (Qwen)95%Intervalle à 95 % : de 76 à 99 %$1.0929 s44 s92%100%
1Kimi K3Moonshot AI · poids ouverts95%Intervalle à 95 % : de 76 à 99 %$18.4415 s78 s100%86%
1Gemini 3.1 Pro (preview)Google95%Intervalle à 95 % : de 76 à 99 %$29.6717 s21 s92%100%
4GLM-5.3-FlashZ.ai · poids ouverts90%Intervalle à 95 % : de 70 à 97 %$0.83115 s31 s92%86%
4DeepSeek V4.1 FlashDeepSeek · poids ouverts90%Intervalle à 95 % : de 70 à 97 %$1.0514 s127 s85%100%
4DeepSeek V4 ProDeepSeek · poids ouverts90%Intervalle à 95 % : de 70 à 97 %$5.1421 s49 s85%100%
4GLM-5.3Z.ai · poids ouverts90%Intervalle à 95 % : de 70 à 97 %$7.029.2 s31 s92%86%
4Gemini 3.8 FlashGoogle90%Intervalle à 95 % : de 70 à 97 %$7.1711 s16 s85%100%
4Grok 4.7xAI90%Intervalle à 95 % : de 70 à 97 %$9.4117 s27 s92%86%
10Qwen3.7 PlusAlibaba (Qwen)85%Intervalle à 95 % : de 64 à 95 %$3.5829 s41 s77%100%
10Claude Sonnet 5Anthropic85%Intervalle à 95 % : de 64 à 95 %$6.70*25 s51 s77%100%
10GPT-5.6 SolOpenAI85%Intervalle à 95 % : de 64 à 95 %$11.33*27 s37 s77%100%
10Qwen3.8 MaxAlibaba (Qwen)85%Intervalle à 95 % : de 64 à 95 %$16.3243 s82 s77%100%
10Claude Opus 5Anthropic85%Intervalle à 95 % : de 64 à 95 %$16.89*27 s83 s77%100%
10GPT-5.5OpenAI85%Intervalle à 95 % : de 64 à 95 %$17.02*22 s34 s77%100%
10GPT-6 AstraOpenAI85%Intervalle à 95 % : de 64 à 95 %$27.91*11 s38 s77%100%
10Claude Fable 5.1Anthropic85%Intervalle à 95 % : de 64 à 95 %$33.11*26 s51 s77%100%
18GPT-5.6 LunaOpenAI80%Intervalle à 95 % : de 58 à 92 %$0.677*28 s34 s69%100%
18Muse Glimmer 30BMeta · poids ouverts80%Intervalle à 95 % : de 58 à 92 %$3.1013 s27 s69%100%
18Grok 4.3xAI80%Intervalle à 95 % : de 58 à 92 %$4.107.4 s9.7 s77%86%
18GPT-5.6 TerraOpenAI80%Intervalle à 95 % : de 58 à 92 %$6.68*29 s36 s69%100%
18Qwen3.8 27BAlibaba (Qwen) · poids ouverts80%Intervalle à 95 % : de 58 à 92 %$7.3043 s89 s77%86%
23gpt-oss-120bOpenAI · poids ouverts75%Intervalle à 95 % : de 53 à 89 %$0.42233 s69 s77%71%
23MiniMax M3MiniMax · poids ouverts75%Intervalle à 95 % : de 53 à 89 %$1.826.4 s45 s77%71%
23Claude Sonnet 4.6Anthropic75%Intervalle à 95 % : de 53 à 89 %$11.24*28 s54 s62%100%
23Kimi K2.6Moonshot AI · poids ouverts75%Intervalle à 95 % : de 53 à 89 %$11.6828 s73 s69%86%
27Gemma 4 31BGoogle · poids ouverts60%Intervalle à 95 % : de 39 à 78 %$0.55811 s36 s46%86%
28Llama 4 MaverickMeta · poids ouverts45%Intervalle à 95 % : de 26 à 66 %$0.66514 s21 s38%57%
28Gemini 3.1 Flash-LiteGoogle45%Intervalle à 95 % : de 26 à 66 %$1.411.7 s3.2 s38%57%
30GPT-5.4 miniOpenAI40%Intervalle à 95 % : de 22 à 61 %$3.351.7 s2.3 s23%71%
30Mistral Medium 3.5Mistral · poids ouverts40%Intervalle à 95 % : de 22 à 61 %$7.401.6 s2.3 s38%43%
32Gemini 3.5 Flash-LiteGoogle35%Intervalle à 95 % : de 18 à 57 %$2.471.2 s1.5 s23%57%
32Claude Haiku 4.5Anthropic35%Intervalle à 95 % : de 18 à 57 %$6.622.5 s3.4 s23%57%
34GPT-5.4 nanoOpenAI30%Intervalle à 95 % : de 15 à 52 %$1.512.7 s3.8 s23%43%
35Ministral 3 14BMistral · poids ouverts20%Intervalle à 95 % : de 8 à 42 %$1.073.9 s5.4 s8%43%
35Mistral Small 4Mistral · poids ouverts20%Intervalle à 95 % : de 8 à 42 %$1.332.0 s20 s15%29%

Le taux de réussite correspond à la part des exécutions réussies. Son intervalle à 95 % est représenté en dessous : le taux réel du modèle pourrait se situer n’importe où sur la barre. Le coût par réussite divise le coût de toutes les exécutions, échecs compris, par le nombre de réussites. Un astérisque indique un coût calculé à partir du tarif public du fabricant lorsque le fournisseur n’a communiqué aucun coût.

Par type de travail

La part des essais réussis pour chaque type de tâche, tous modèles confondus, et les modèles qui réussissent le plus souvent.

Taux de réussite par type de tâche
Type de tâcheTâchesEssais réussisMeilleur taux de réussite
Orientation des demandes296%33 modèles à 100%
Extraction des données de factures290%29 modèles à 100%
Tri des e-mails183%30 modèles à 100%
Comptes rendus de réunion183%30 modèles à 100%
Calculs pour l’entreprise276%19 modèles à 100%
Qualification des prospects172%26 modèles à 100%
Comptabilité271%24 modèles à 100%
Prise de rendez-vous269%21 modèles à 100%
Questions sur les politiques internes169%25 modèles à 100%
Support client267%17 modèles à 100%
Descriptions de produits158%21 modèles à 100%
Devis251%9 modèles à 100%
Réponses aux avis122%8 modèles à 100%

Les tâches

Les plus difficiles d’abord. Chaque page présente la tâche telle que les modèles l’ont reçue, ses pièges, tous les critères de contrôle expliqués et les erreurs de chaque modèle.

Les tâches, des plus difficiles aux plus faciles
TâcheTypeLangueEssais réussis
Répondez publiquement à un avis négatif sur un restaurant sans révéler d’informations privéesRéponses aux avisAnglais8 sur 36
Envoyez par e-mail un devis d’aménagement paysager qui tient compte d’une demande relative à la TVA et d’un arbre protégéDevisAnglais16 sur 36
Répondre à une cliente qui demande un remboursement hors du délai prévuSupport clientAnglais17 sur 36
Calculer la rémunération brute hebdomadaire d’un agent d’entretien en tenant compte des pauses, des heures supplémentaires et du tarif du dimancheCalculs pour l’entrepriseAnglais19 sur 36
Rédigez en italien une description commerciale d’une huile d’olive conforme aux règles d’étiquetageDescriptions de produitsItalien21 sur 36
Chiffrez des travaux de peinture et de décoration à partir des mesures relevées et de la grille tarifaireDevisAnglais21 sur 36
Planifier un appel entre Londres et New York pendant la semaine où le décalage horaire changePrise de rendez-vousAnglais23 sur 36
Catégoriser les opérations du relevé bancaire mensuel d’un café et calculer ses charges d’exploitationComptabilitéAnglais24 sur 36
Répondre aux questions d’un salarié à temps partiel sur les congés à partir du manuel du personnelQuestions sur les politiques internesAnglais25 sur 36
Évaluer cinq demandes entrantes de prestations de nettoyage selon les règles de l’équipe commercialeQualification des prospectsAnglais26 sur 36
Catégoriser les opérations du relevé bancaire d’un bar italien et en calculer les totauxComptabilitéItalien27 sur 36
Trouver un rendez-vous pour un détartrage autour d’un jour férié, en italienPrise de rendez-vousItalien27 sur 36
Transformer une réunion d’équipe de boulangerie en décisions, responsables et échéancesComptes rendus de réunionAnglais30 sur 36
Trier les e-mails reçus lundi par un traiteur, dont une tentative de phishing et une demande de changement de coordonnées bancairesTri des e-mailsAnglais30 sur 36
Extraire les données d’une facture fournisseur italienne comportant une ligne de frais hors champ de la TVAExtraction des données de facturesItalien31 sur 36
Répondre en italien à une cliente qui croit à tort que sa garantie a expiréSupport clientItalien31 sur 36
Acheminez dix messages de locataires vers la bonne équipe, avec le bon niveau de prioritéOrientation des demandesAnglais33 sur 36
Extraire les données d’une facture fournisseur de deux pages pour le traitement des comptes fournisseursExtraction des données de facturesAnglais34 sur 36
Calculer deux factures émises par un professionnel italien, avec cotisation à la caisse de retraite, IVA et retenue à la sourceCalculs pour l’entrepriseItalien36 sur 36
Orientez en italien les messages des clients d’un hôtel vers le bon serviceOrientation des demandesItalien36 sur 36

Par type d’entreprise

Les tâches qu’un type d’entreprise confierait à l’IA, côte à côte, avec le résultat de chaque modèle pour chacune.

Meilleur modèle d’IA pour les cabinets comptables
6 tâches : catégoriser un relevé bancaire italien, catégoriser des transactions bancaires, extraire les données de factures, extraire les données de factures de fournisseurs italiens, calculer des factures de professionnels en Italie et calculer la rémunération des heures supplémentaires.
Meilleur modèle d’IA pour les restaurants et les bars
4 tâches : répondre aux avis négatifs, trier les e-mails d’une entreprise, catégoriser des transactions bancaires et catégoriser un relevé bancaire italien.
Meilleur modèle d’IA pour les commerces
4 tâches : répondre aux demandes de remboursement, répondre aux demandes de garantie en italien, rédiger des descriptions de produits en italien et rédiger des comptes rendus de réunion.
Meilleur modèle d’IA pour les artisans et les entreprises de services
6 tâches : chiffrer une prestation à partir d’une grille tarifaire, rédiger des e-mails de devis, évaluer des prospects commerciaux, orienter les messages des clients, calculer la rémunération des heures supplémentaires et répondre aux questions sur le manuel du personnel.

Comment les réponses sont évaluées

Les mêmes consignes et les mêmes éléments pour tous les modèles, une réponse par essai et un verdict qui ne dépend pas du style de la réponse.

Réussite ou échec
Une réponse n’est acceptée que si elle satisfait à tous les contrôles fixes. Pour les tâches dotées d’une grille d’évaluation, elle doit aussi remplir la plupart de ses critères, dont tous les critères obligatoires. Aucun crédit partiel n’est accordé.
Contrôles fixes
Les réponses structurées sont comparées champ par champ aux valeurs attendues, avec une marge de tolérance pour les montants et les heures. Les réponses rédigées sont vérifiées selon ce qu’elles doivent dire, ce qu’elles ne doivent pas dire et leur longueur maximale. Le même code évalue tous les modèles.
L’évaluateur selon la grille
Les critères de la grille sont évalués par gpt-5-6-sol à température zéro, avec une justification pour chacun. Chaque réponse est évaluée deux fois, puis une troisième évaluation tranche tout désaccord sur un critère. Le verdict de l’évaluateur lui-même est ignoré : le code applique la règle de réussite aux critères évalués. Avant les essais, l’évaluateur a été testé deux fois sur des réponses dont le verdict était connu.
Un protocole unique
Chaque essai comprend un message de consignes et un message contenant les éléments de la tâche : aucun outil, aucune recherche sur le Web, aucun mode JSON, les paramètres d’échantillonnage par défaut de chaque modèle et jusqu’à 4,000 tokens en sortie, raisonnement compris. Une réponse interrompue à cette limite est évaluée telle quelle. 1 essais par modèle pour chaque tâche.
Règles auditées
Avant la publication d’une édition, chaque échec dû à une règle déterminante est examiné. Si une règle rejette une bonne réponse parce qu’elle omet un détail jamais demandé dans les consignes, elle est corrigée et les réponses concernées sont réévaluées. Une règle qui détecte une véritable erreur est conservée, quel que soit le nombre de modèles qu’elle fait échouer.
Coût et durée
Le coût d’un essai correspond au montant facturé par le fournisseur ou, si celui-ci ne communique aucun coût, au prix catalogue du créateur appliqué aux tokens utilisés. La durée va de l’envoi de la requête au dernier mot de la réponse. Les appels qui ont échoué en sont exclus.
Intervalles
Chaque taux de réussite est accompagné d’un intervalle de Wilson à 95 %. Avec quelques dizaines d’essais par modèle, plusieurs points d’écart entre deux modèles peuvent être dus au hasard. Les barres en tiennent compte.
Les données
Les tâches, les contrôles et les résultats sont publiés sous licence CC BY 4.0 : citez AIGROW et ajoutez un lien vers cette page. Chaque page de tâche contient la chaîne canari de l’édition, afin de permettre l’exclusion des tâches des jeux d’entraînement.

Mettez les modèles qui réussissent au travail

Un agent AIGROW réalise ce type de travail dans vos propres outils, selon des règles que vous approuvez par écrit. Pour faire tourner les modèles vous-même, le crédit API coûte un quart du prix catalogue.

Édition d’octobre 2026, pilote