Item Audit — rapport « choix de modèle vérifié » — exemple sur données publiques — 2026-10-03

Quelle IA pour corriger du code ? Cinq candidates sur SWE-bench Verified

Données : résultats par tâche publiés par Epoch AI (CC BY 4.0), 454 tâches de SWE-bench Verified. Prix : catalogue OpenRouter relevé le 3 octobre 2026. L'analyse est la nôtre.

En bref

1. Les scores, avec leur incertitude

ModèleScoreIntervalle à 95 %Prix catalogue (entrée / sortie, $ par million de jetons)
Claude Opus 4.7 (max)83,5 %79,8 – 86,6 %5,00 $ / 25,00 $
Gemini 3.5 Flash (high)79,1 %75,1 – 82,6 %1,50 $ / 9,00 $
GLM-5.2 (max)78,0 %73,9 – 81,5 %0,41 $ / 3,99 $
Qwen 3.7 Max77,5 %73,5 – 81,1 %1,48 $ / 4,42 $
DeepSeek V4 Pro (max)76,9 %72,8 – 80,5 %0,21 $ / 0,42 $

Un score seul ne dit rien de l'écart avec un autre modèle : la comparaison se fait par paires, ci-dessous.

2. Chaque paire, sur les mêmes 454 tâches

Modèle AModèle BÉcart A − B (points)Intervalle à 95 %p (McNemar exact)Seul A réussit / seul B réussitLecture
Claude Opus 4.7 (max)Gemini 3.5 Flash (high)+4,4[+1,2 ; +7,6]0,01038 / 18écart établi
Claude Opus 4.7 (max)GLM-5.2 (max)+5,5[+2,5 ; +8,5]< 0,00137 / 12écart établi
Claude Opus 4.7 (max)Qwen 3.7 Max+6,0[+2,8 ; +9,1]< 0,00141 / 14écart établi
Claude Opus 4.7 (max)DeepSeek V4 Pro (max)+6,6[+3,4 ; +9,8]< 0,00143 / 13écart établi
Gemini 3.5 Flash (high)GLM-5.2 (max)+1,1[-2,1 ; +4,3]0,59030 / 25écart non établi
Gemini 3.5 Flash (high)Qwen 3.7 Max+1,5[-1,4 ; +4,4]0,37126 / 19écart non établi
Gemini 3.5 Flash (high)DeepSeek V4 Pro (max)+2,2[-0,8 ; +5,2]0,19329 / 19écart non établi
GLM-5.2 (max)Qwen 3.7 Max+0,4[-2,5 ; +3,4]0,88324 / 22écart non établi
GLM-5.2 (max)DeepSeek V4 Pro (max)+1,1[-2,0 ; +4,2]0,58329 / 24écart non établi
Qwen 3.7 MaxDeepSeek V4 Pro (max)+0,7[-2,2 ; +3,5]0,76123 / 20écart non établi

Seules les tâches où les deux modèles divergent disent lequel est meilleur ; c'est ce que compte le test apparié. Aucune correction pour comparaisons multiples : elle ne ferait qu'élargir le groupe de tête.

3. Comment lire ce rapport

4. Limites

Méthode et code publics : dépôt GitHub · Contact : contact@itemaudit.fr