Item Audit

Page détaillée pour les équipes techniques et les acheteurs d'IA. Retour à l'accueil.

Votre IA est-elle vraiment meilleure, ou seulement mieux classée ?

Sur 10 des 13 grands benchmarks publiés par Epoch AI, le modèle classé premier n'est pas séparable du cinquième, avec les barres d'erreur publiées par Epoch AI elle-même. Choisir une IA sur un classement, c'est souvent payer plus cher pour un écart qui n'est pas démontré.

experiments/LEADERBOARD-REALITY-2026-10/RESULT.md — données : Epoch AI, CC BY 4.0 ; l'analyse est la nôtre
Voir un exemple de rapportNos outils gratuits

Vous êtes…

Une entreprise qui choisit une IAQuels écarts entre modèles sont réels sur vos tâches, et ce que cela change pour votre budget.Choisir sans payer trop → Un organisme de formationVos QCM relus par une IA avant la mise en ligne, puis vérifiés sur les vraies réponses.Vérifier vos QCM → Une école ou une universitéLes corrigés suspects repérés et les notes recalculées avant publication.Des examens justes → Une équipe techniqueTrois outils gratuits, calcul en local, rien n'est envoyé.Outils gratuits →

Testez vos propres chiffres, gratuitement. Deux scores et un nombre de questions suffisent pour savoir si un écart dépasse le bruit. Le calcul se fait dans votre navigateur : L'écart est-il réel ?

Ce que nous faisons

OffrePrixDélai
Choix de modèle vérifié — jusqu'à 5 modèles d'IA comparés sur vos propres tâches, réponse par réponse ; nous disons quels écarts sont réels et lesquels sont du bruit4 900 €3 semaines
Vérification d'un écart — un écart annoncé entre deux modèles tient-il sur vos résultats question par question ? (test apparié exact)1 500 €48 h
Audit d'un test — les questions de votre benchmark qui mesurent mal, classées pour être relues en premier, avec leur défaut probable1 900 €5 jours
Votre suite de tests, jusqu'à 10 benchmarks7 500 €3 semaines
Benchmark raccourci — nous choisissons les questions qui décident vraiment, pour lancer vos évaluations sur une fraction des questions avec les mêmes conclusions ; la sélection est vérifiée sur des modèles qu'elle n'a jamais vus4 900 €3 semaines
Veille modèles — à chaque sortie d'une nouvelle IA, en 48 h : est-elle vraiment meilleure sur vos tâches, et que changer vous ferait-il gagner ? Sélection de questions rafraîchie chaque trimestre1 200 €/moisen continu

Voir un exemple de livrable : cinq IA de programmation comparées sur 454 tâches publiques — laquelle est démontrée meilleure, lesquelles ne se départagent pas, et ce que cela change pour le budget.

Nos cinq premiers clients paient moitié prix, en échange d'un court témoignage public. Conclure qu'aucun écart n'est établi est un résultat livré, et souvent le plus utile : il évite de payer plus cher pour rien.

Pourquoi nous croire : tout est mesuré, publié, et pré-inscrit

Nos signaux trouvent les vraies erreurs. Sur 5 005 questions du benchmark MMLU relues par des experts (MMLU-Redux), relire les 7 % de questions que nous signalons suffit à trouver 54 % des clés de correction fausses. Une question signalée a 14,6 fois plus de chances d'avoir une clé fausse qu'une question non signalée. Les quatre prédictions avaient été écrites avant de regarder les données.

experiments/VALIDATION-REDUX-2026-10/RESULT.md

Nous disons ce qui cloche, pas seulement où regarder. Un modèle d'IA peu coûteux relit chaque question signalée. Quand il la juge mal corrigée, les experts lui donnent raison dans 43 % des cas, contre 11 % pour le signal seul. Refait sur 300 questions inédites où nous avions nous-mêmes glissé 60 erreurs, il en trouve 59, sans aucune fausse alerte : son jugement ne vient pas d'une mémoire des questions publiques. Les erreurs glissées sont plus faciles à voir que les vraies ; ce sont les chiffres sur les vraies erreurs (43 %) qu'il faut retenir.

experiments/DIAGNOSIS-REDUX-2026-10/RESULT.md · experiments/DIAGNOSIS-UNSEEN-2026-10/RESULT.md

Moins de questions, mêmes décisions. Sur SWE-bench Verified, 40 % des problèmes, choisis en regardant seulement les 20 modèles les plus anciens, classent les 10 modèles sortis ensuite comme le test complet (corrélation de rang 0,988), et les 20 écarts établis gardent tous leur sens. Un tirage au hasard de la même taille fait nettement moins bien (médiane 0,878). Refait sur un second test de nature différente (MedQA, 1 000 questions médicales) : la moitié des questions classe aussi les 10 modèles suivants comme le test complet (0,985), mais là, un tirage au hasard fait presque aussi bien. Une sélection vieillit avec les modèles : elle se rafraîchit.

experiments/COMPRESSION-SWEBENCH-2026-10/RESULT.md · experiments/COMPRESSION-MEDQA-2026-10/RESULT.md

Un exemple le jour d'une sortie. GPT-6.1 Sol, sorti le 29 septembre 2026, est seul premier sur 1 des 9 benchmarks comparables des données d'Epoch AI, et cette avance reste dans les barres d'erreur. Un modèle du groupe de tête, pas un modèle démontré premier.

experiments/LAUNCH-CHECK-2026-10/RESULT.md

Ce qu'il faut savoir avant d'acheter

Un signal dit quoi relire en premier, pas où est l'erreur. Parmi les questions signalées, la majorité sont saines ; c'est pour cela que nous publions la précision, et que le diagnostic par l'IA est présenté comme un tri, pas comme un verdict.

L'audit d'un test demande au moins 30 modèles répondants (50 pour la liste stricte). Pour comparer vos 5 modèles, nous vérifions les questions sur un panel séparé d'au moins 30 modèles.

La vérification d'un écart demande vos résultats question par question. Votre outil d'évaluation les produit déjà ; nous lisons directement plusieurs formats courants.

Ce n'est pas une certification. C'est une mesure, avec son incertitude, sur vos données.

Vous faites passer des QCM à des humains ?

Enseignants, formateurs, recruteurs : vérifiez gratuitement votre QCM, ou voyez nos formules pour les établissements. Collez les réponses de vos élèves ou candidats et repérez les questions mal faites et les corrigés suspects. Rapport détaillé relu par un spécialiste : 29 €.

À lire

Contact

Item Audit — contact@itemaudit.fr

Décrivez votre cas en deux lignes : nous répondons si nos méthodes s'y appliquent, et ce qu'elles ne peuvent pas dire.

Chaque chiffre de ce site, avec le fichier dont il vient (en anglais) →