Quel modèle d'IA, à quel prix, sur vos tâches à vous.
Nous comparons jusqu'à 5 modèles sur vos propres tâches, réponse par réponse. Vous savez quels écarts sont réels, lesquels ne sont que du bruit, et ce que chaque choix coûte au prix catalogue.
Un résultat récent
6 modèles sur 300 tâches de bureau en français dont la réponse est calculée (factures, congés RH, délais juridiques, service client, dosages). Protocole fixé et publié avant de lancer les modèles.
| Modèle | Réussite | Prix | Prix catalogue (entrée / sortie, $ par million de jetons) | nbsp;$/M jetons (entrée / sortie)
|---|---|---|---|
| openai/gpt-6.1-sol | 99,7 % | 2,00 / 10,00 | |
| anthropic/claude-sonnet-5.5 | 99,0 % | 2,00 / 10,00 | |
| openai/gpt-6-luna | 99,0 % | 0,10 / 0,50 | |
| google/gemini-3.5-flash | 97,0 % | 1,50 / 9,00 | |
| deepseek/deepseek-v4-pro | 94,3 % | 0,21 / 0,42 | |
| mistralai/mistral-medium-3.1 | 93,3 % | 0,40 / 2,00 |
- Le modèle d'entrée de gamme (gpt-6-luna) n'est pas démontré derrière les deux modèles phares, pour un prix catalogue 20 fois plus bas. Ne pas être démontré derrière ne veut pas dire être aussi bon : il faudrait environ 1 200 tâches pour détecter un écart de cette taille.
- Deux modèles sont démontrés derrière les trois premiers (écarts de 4,7 à 6,3 points, test de McNemar exact).
- 261 tâches sur 300 donnent le même résultat à tous : le classement se joue sur 39 tâches.
Ce résultat vaut pour ces tâches et ces réglages (effort de raisonnement faible, 2 000 jetons de sortie, une réponse manquante compte comme fausse). Sur vos tâches, l'ordre peut être différent : c'est exactement ce que nous mesurons.
Plus largement, les classements publics tranchent rarement : sur 10 des 13 benchmarks publiés par Epoch AI, le premier modèle n'est pas séparable du cinquième avec les barres d'erreur publiées.
Méthode
- Vos tâches. 100 à 300 cas représentatifs de votre usage, avec la réponse attendue ou une grille de correction. Nous pouvons les construire avec vous.
- Les mêmes conditions pour tous. Même prompt, mêmes réglages, mêmes cas ; chaque réponse est conservée.
- Des comparaisons appariées. Chaque paire de modèles est comparée cas par cas (test exact), avec l'écart et son intervalle de confiance.
- Un rapport lisible par un décideur. Les écarts établis, ceux qui ne le sont pas, le coût par cas, et ce qu'il faudrait mesurer pour trancher.
Nous ne transformons jamais « pas d'écart démontré » en « équivalent ». Conclure qu'aucun écart n'est établi est un résultat livré, et souvent le plus utile : il évite de payer plus cher sans raison.
Offres
| Offre | Prix HT | Délai |
|---|---|---|
| Choix de modèle vérifié : jusqu'à 5 modèles sur vos tâches, rapport et restitution | 4 900 € | 3 semaines |
| Vérification d'un écart : un écart annoncé entre deux modèles tient-il sur vos résultats cas par cas ? | 1 500 € | 48 h |
| Veille modèles : à chaque nouvelle sortie, le nouveau modèle testé sur vos tâches en 48 h | 1 200 €/mois | en continu |
Nos cinq premiers clients paient moitié prix, en échange d'un court témoignage.
Vos données
- Elles peuvent rester chez vous. Nos scripts peuvent tourner sur votre infrastructure, avec vos clés d'API ; nous n'avons alors besoin que des résultats cas par cas.
- Sinon, nous utilisons uniquement les données que vous choisissez de nous confier, sous accord de confidentialité, et nous les supprimons après la mission.
- Aucun résultat client n'est publié sans accord écrit.
Décrivez votre usage en deux lignes (tâche, modèles envisagés, volume) : nous vous disons si une comparaison
peut trancher, et ce qu'elle ne pourra pas dire. contact@itemaudit.fr
Item Audit audite aussi des questionnaires et des tests : itemaudit.fr.