Item Audit — rapport « choix de modèle vérifié » — exemple sur données publiques — 2026-10-03
Quelle IA pour corriger du code ? Cinq candidates sur SWE-bench Verified
Données : résultats par tâche publiés par Epoch AI (CC BY 4.0), 454 tâches de SWE-bench Verified. Prix : catalogue OpenRouter relevé le 3 octobre 2026. L'analyse est la nôtre.
En bref
- Claude Opus 4.7 (max) a le meilleur score sur ces 454 tâches (83,5 %).
- Démontrés en dessous du meilleur : Gemini 3.5 Flash (high), GLM-5.2 (max), Qwen 3.7 Max, DeepSeek V4 Pro (max).
- Entre eux, Gemini 3.5 Flash (high), GLM-5.2 (max), Qwen 3.7 Max, DeepSeek V4 Pro (max) : aucun écart établi. Ces tâches ne montrent aucune raison de payer plus pour l'un que pour l'autre.
- Le point qui compte pour le budget : dans ce groupe, DeepSeek V4 Pro (max) coûte environ 22 fois moins cher en jetons de sortie (prix catalogue) que Gemini 3.5 Flash (high), sans être démontré moins bon sur ces tâches. Ce n'est pas la preuve qu'il est aussi bon : c'est ce que le test sur vos tâches doit trancher.
- La vraie question devient : les 4,4 points d'avance établis de Claude Opus 4.7 (max) valent-ils un prix de sortie 2,8 fois plus élevé que celui de Gemini 3.5 Flash (high) ?
- 348 tâches sur 454 donnent le même résultat aux 5 modèles (302 réussies par tous, 46 ratées par tous) : elles coûtent à chaque évaluation sans jamais départager.
1. Les scores, avec leur incertitude
| Modèle | Score | Intervalle à 95 % | Prix catalogue (entrée / sortie, $ par million de jetons) |
|---|---|---|---|
| Claude Opus 4.7 (max) | 83,5 % | 79,8 – 86,6 % | 5,00 $ / 25,00 $ |
| Gemini 3.5 Flash (high) | 79,1 % | 75,1 – 82,6 % | 1,50 $ / 9,00 $ |
| GLM-5.2 (max) | 78,0 % | 73,9 – 81,5 % | 0,41 $ / 3,99 $ |
| Qwen 3.7 Max | 77,5 % | 73,5 – 81,1 % | 1,48 $ / 4,42 $ |
| DeepSeek V4 Pro (max) | 76,9 % | 72,8 – 80,5 % | 0,21 $ / 0,42 $ |
Un score seul ne dit rien de l'écart avec un autre modèle : la comparaison se fait par paires, ci-dessous.
2. Chaque paire, sur les mêmes 454 tâches
| Modèle A | Modèle B | Écart A − B (points) | Intervalle à 95 % | p (McNemar exact) | Seul A réussit / seul B réussit | Lecture |
|---|---|---|---|---|---|---|
| Claude Opus 4.7 (max) | Gemini 3.5 Flash (high) | +4,4 | [+1,2 ; +7,6] | 0,010 | 38 / 18 | écart établi |
| Claude Opus 4.7 (max) | GLM-5.2 (max) | +5,5 | [+2,5 ; +8,5] | < 0,001 | 37 / 12 | écart établi |
| Claude Opus 4.7 (max) | Qwen 3.7 Max | +6,0 | [+2,8 ; +9,1] | < 0,001 | 41 / 14 | écart établi |
| Claude Opus 4.7 (max) | DeepSeek V4 Pro (max) | +6,6 | [+3,4 ; +9,8] | < 0,001 | 43 / 13 | écart établi |
| Gemini 3.5 Flash (high) | GLM-5.2 (max) | +1,1 | [-2,1 ; +4,3] | 0,590 | 30 / 25 | écart non établi |
| Gemini 3.5 Flash (high) | Qwen 3.7 Max | +1,5 | [-1,4 ; +4,4] | 0,371 | 26 / 19 | écart non établi |
| Gemini 3.5 Flash (high) | DeepSeek V4 Pro (max) | +2,2 | [-0,8 ; +5,2] | 0,193 | 29 / 19 | écart non établi |
| GLM-5.2 (max) | Qwen 3.7 Max | +0,4 | [-2,5 ; +3,4] | 0,883 | 24 / 22 | écart non établi |
| GLM-5.2 (max) | DeepSeek V4 Pro (max) | +1,1 | [-2,0 ; +4,2] | 0,583 | 29 / 24 | écart non établi |
| Qwen 3.7 Max | DeepSeek V4 Pro (max) | +0,7 | [-2,2 ; +3,5] | 0,761 | 23 / 20 | écart non établi |
Seules les tâches où les deux modèles divergent disent lequel est meilleur ; c'est ce que compte le test apparié. Aucune correction pour comparaisons multiples : elle ne ferait qu'élargir le groupe de tête.
3. Comment lire ce rapport
- « Écart établi » : la différence dépasse ce que le hasard des tâches explique, au seuil de 95 %.
- « Écart non établi » : pas démontré avec ces tâches. Cela ne veut pas dire que les deux modèles se valent ; il faudrait plus de tâches, ou vos propres tâches, pour trancher.
- Sur vos tâches, le classement peut changer : c'est l'objet du service — les mêmes calculs, sur votre travail réel, avec un panel séparé d'au moins 30 modèles pour vérifier que vos tâches mesurent bien.
4. Limites
- Données publiques, réglages de chaque modèle tels qu'évalués par la source ; un fournisseur peut annoncer d'autres chiffres avec d'autres réglages.
- Les prix sont des prix catalogue par jeton ; le coût réel d'une tâche dépend du nombre de jetons qu'elle consomme, qui varie d'un modèle à l'autre.
- Un exemple public n'est pas un audit de vos usages.
Méthode et code publics : dépôt GitHub · Contact : contact@itemaudit.fr