Page détaillée pour les équipes techniques et les acheteurs d'IA. Retour à l'accueil.
Votre IA est-elle vraiment meilleure, ou seulement mieux classée ?
Sur 10 des 13 grands benchmarks publiés par Epoch AI, le modèle classé premier n'est pas séparable du cinquième, avec les barres d'erreur publiées par Epoch AI elle-même. Choisir une IA sur un classement, c'est souvent payer plus cher pour un écart qui n'est pas démontré.
experiments/LEADERBOARD-REALITY-2026-10/RESULT.md — données : Epoch AI, CC BY 4.0 ; l'analyse est la nôtreVous êtes…
Testez vos propres chiffres, gratuitement. Deux scores et un nombre de questions suffisent pour savoir si un écart dépasse le bruit. Le calcul se fait dans votre navigateur : L'écart est-il réel ?
Ce que nous faisons
| Offre | Prix | Délai |
|---|---|---|
| Choix de modèle vérifié — jusqu'à 5 modèles d'IA comparés sur vos propres tâches, réponse par réponse ; nous disons quels écarts sont réels et lesquels sont du bruit | 4 900 € | 3 semaines |
| Vérification d'un écart — un écart annoncé entre deux modèles tient-il sur vos résultats question par question ? (test apparié exact) | 1 500 € | 48 h |
| Audit d'un test — les questions de votre benchmark qui mesurent mal, classées pour être relues en premier, avec leur défaut probable | 1 900 € | 5 jours |
| Votre suite de tests, jusqu'à 10 benchmarks | 7 500 € | 3 semaines |
| Benchmark raccourci — nous choisissons les questions qui décident vraiment, pour lancer vos évaluations sur une fraction des questions avec les mêmes conclusions ; la sélection est vérifiée sur des modèles qu'elle n'a jamais vus | 4 900 € | 3 semaines |
| Veille modèles — à chaque sortie d'une nouvelle IA, en 48 h : est-elle vraiment meilleure sur vos tâches, et que changer vous ferait-il gagner ? Sélection de questions rafraîchie chaque trimestre | 1 200 €/mois | en continu |
Voir un exemple de livrable : cinq IA de programmation comparées sur 454 tâches publiques — laquelle est démontrée meilleure, lesquelles ne se départagent pas, et ce que cela change pour le budget.
Nos cinq premiers clients paient moitié prix, en échange d'un court témoignage public. Conclure qu'aucun écart n'est établi est un résultat livré, et souvent le plus utile : il évite de payer plus cher pour rien.
Pourquoi nous croire : tout est mesuré, publié, et pré-inscrit
Nos signaux trouvent les vraies erreurs. Sur 5 005 questions du benchmark MMLU relues par des experts (MMLU-Redux), relire les 7 % de questions que nous signalons suffit à trouver 54 % des clés de correction fausses. Une question signalée a 14,6 fois plus de chances d'avoir une clé fausse qu'une question non signalée. Les quatre prédictions avaient été écrites avant de regarder les données.
experiments/VALIDATION-REDUX-2026-10/RESULT.mdNous disons ce qui cloche, pas seulement où regarder. Un modèle d'IA peu coûteux relit chaque question signalée. Quand il la juge mal corrigée, les experts lui donnent raison dans 43 % des cas, contre 11 % pour le signal seul. Refait sur 300 questions inédites où nous avions nous-mêmes glissé 60 erreurs, il en trouve 59, sans aucune fausse alerte : son jugement ne vient pas d'une mémoire des questions publiques. Les erreurs glissées sont plus faciles à voir que les vraies ; ce sont les chiffres sur les vraies erreurs (43 %) qu'il faut retenir.
experiments/DIAGNOSIS-REDUX-2026-10/RESULT.md · experiments/DIAGNOSIS-UNSEEN-2026-10/RESULT.mdMoins de questions, mêmes décisions. Sur SWE-bench Verified, 40 % des problèmes, choisis en regardant seulement les 20 modèles les plus anciens, classent les 10 modèles sortis ensuite comme le test complet (corrélation de rang 0,988), et les 20 écarts établis gardent tous leur sens. Un tirage au hasard de la même taille fait nettement moins bien (médiane 0,878). Refait sur un second test de nature différente (MedQA, 1 000 questions médicales) : la moitié des questions classe aussi les 10 modèles suivants comme le test complet (0,985), mais là, un tirage au hasard fait presque aussi bien. Une sélection vieillit avec les modèles : elle se rafraîchit.
experiments/COMPRESSION-SWEBENCH-2026-10/RESULT.md · experiments/COMPRESSION-MEDQA-2026-10/RESULT.mdUn exemple le jour d'une sortie. GPT-6.1 Sol, sorti le 29 septembre 2026, est seul premier sur 1 des 9 benchmarks comparables des données d'Epoch AI, et cette avance reste dans les barres d'erreur. Un modèle du groupe de tête, pas un modèle démontré premier.
experiments/LAUNCH-CHECK-2026-10/RESULT.mdCe qu'il faut savoir avant d'acheter
Un signal dit quoi relire en premier, pas où est l'erreur. Parmi les questions signalées, la majorité sont saines ; c'est pour cela que nous publions la précision, et que le diagnostic par l'IA est présenté comme un tri, pas comme un verdict.
L'audit d'un test demande au moins 30 modèles répondants (50 pour la liste stricte). Pour comparer vos 5 modèles, nous vérifions les questions sur un panel séparé d'au moins 30 modèles.
La vérification d'un écart demande vos résultats question par question. Votre outil d'évaluation les produit déjà ; nous lisons directement plusieurs formats courants.
Ce n'est pas une certification. C'est une mesure, avec son incertitude, sur vos données.
Vous faites passer des QCM à des humains ?
Enseignants, formateurs, recruteurs : vérifiez gratuitement votre QCM, ou voyez nos formules pour les établissements. Collez les réponses de vos élèves ou candidats et repérez les questions mal faites et les corrigés suspects. Rapport détaillé relu par un spécialiste : 29 €.
À lire
- Choisir une IA pour son entreprise sans payer trop cher
- Comment savoir si le corrigé de votre QCM est faux
- Comprendre l'indice de discrimination de Moodle
Contact
Item Audit — contact@itemaudit.fr
Décrivez votre cas en deux lignes : nous répondons si nos méthodes s'y appliquent, et ce qu'elles ne peuvent pas dire.
Chaque chiffre de ce site, avec le fichier dont il vient (en anglais) →