5 modèles IA au banc d’essai : lire les scores sans se faire avoir
Claude Opus 5, GPT-5.6 Sol, Gemini 3.1 Pro, Grok 4.6 et DeepSeek V4 Pro : scores publics cités, graphique original, limites des benches pour une PME.

Dans cet article
- Les 5 modèles retenus
- D’où viennent les chiffres
- Graphique : Arena Elo (5 modèles)
- Tableau : Elo, code, AAII, MMLU-Pro
- Ce que le graphique dit vraiment
- 1. Le sommet est un plateau
- 2. Le coding n’est pas l’Elo général
- 3. Open weights dans le peloton
- 4. Un score ne voit pas votre métier
- Comment s’en servir en entreprise (méthode Kervia)
- Limites de cet article
- Sources
Les classements de modèles bougent chaque semaine. Pour une PME ou un indépendant, la question n’est pas « qui est n°1 sur Twitter », mais : quel signal lire, quelle source citer, et quoi ignorer avant de brancher un outil sur un process réel.
Voici une lecture sourcée de cinq modèles phares, avec un graphique original (pas une capture d’un leaderboard tiers). Les scores ne sont pas mesurés par Kervia : ils viennent de sources publiques, consultées le 18 août 2026.
Les 5 modèles retenus
| Modèle | Éditeur | Pourquoi dans le panel |
|---|---|---|
| Claude Opus 5 | Anthropic | Référence « frontier » très présente en tête des classements publics |
| GPT-5.6 Sol | OpenAI | Variante phare côté OpenAI sur les agrégats récents |
| Gemini 3.1 Pro | Concurrent direct multi-produit (Search, Workspace, API) | |
| Grok 4.6 | xAI | Entrée « frontier » hors du trio historique |
| DeepSeek V4 Pro | DeepSeek | Poids ouvert (licence MIT sur le classement consulté) : utile pour comparer open vs fermé |
Ce n’est pas un top 5 marketing : c’est un échantillon pour expliquer comment lire un bench.
D’où viennent les chiffres
Deux familles de signaux, souvent mélangées à tort :
- Arena Elo (préférence humaine en duel) : logique type LMSYS Chatbot Arena / LMArena.
- AAII (Artificial Analysis Intelligence Index) : indice agrégé multi-épreuves présenté notamment via Artificial Analysis et des tableaux qui le reprennent.
Pour ce billet, les valeurs chiffrées du graphique et du tableau principal sont reprises du classement public Chatbot Arena + publié sur OpenLM.ai (consultation 18 août 2026). Ce site indique explicitement qu’il s’appuie sur des Elo de type Arena et sur l’AAII.
Ce n’est pas un export intégral de leur base : cinq lignes seulement, pour un usage éditorial, avec lien vers la source.
Les classements en ligne changent. Toujours revérifier la page source le jour J.
Graphique : Arena Elo (5 modèles)
Arena Elo · 5 modèles phares
Échelle zoomée 1495 → 1515 pour lire l’ordre. Écart max = 9 points seulement (quasi-égalité). Sans zoom, les barres se superposent presque.
Figure 1. Arena Elo (plus haut = mieux sur ce classement de préférences). Barres proportionnelles à (score − 1495) / 20. Données citées, graphique original Kervia.
Tableau : Elo, code, AAII, MMLU-Pro
Valeurs lues sur OpenLM Chatbot Arena+ le 18 août 2026 :
| Modèle | Arena Elo | Coding | AAII | MMLU-Pro | Licence (selon source) |
|---|---|---|---|---|---|
| Claude Opus 5 | 1511 | 1566 | 63 | 91,6 | Propriétaire |
| GPT-5.6 Sol | 1509 | 1567 | 61 | 90,2 | Propriétaire |
| Grok 4.6 | 1507 | 1563 | 61 | 89,6 | Propriétaire |
| Gemini 3.1 Pro | 1504 | 1531 | 56 | 91,0 | Propriétaire |
| DeepSeek V4 Pro | 1502 | 1550 | 54 | 87,5 | MIT (selon le tableau consulté) |
AAII = Artificial Analysis Intelligence Index (agrégat multi-benchmarks). Détail méthodo côté Artificial Analysis.
Arena Elo = logique de duels / préférences (écosystème type LMArena / LMSYS Arena).
Ce que le graphique dit vraiment
1. Le sommet est un plateau
Entre 1502 et 1511, l’écart Arena n’est que de 9 points. Sur le graphique, on a zoomé (1495→1515) pour que l’ordre se lise, sans ce zoom, les barres seraient quasi identiques. En pratique : plusieurs modèles sont « assez bons » sur des tâches générales. Le choix se joue ailleurs (outil, prix, données, intégration).
2. Le coding n’est pas l’Elo général
GPT-5.6 Sol et Claude Opus 5 restent très hauts en Coding sur ce tableau ; Gemini 3.1 Pro est un cran en retrait sur cette colonne tout en restant excellent en MMLU-Pro. Un bench code ≠ un bench rédaction client.
3. Open weights dans le peloton
DeepSeek V4 Pro apparaît dans la même zone Elo que les fermés, avec une licence ouverte indiquée MIT sur la source. Pour une PME, « open » change surtout la souveraineté / self-host, pas magiquement la qualité du process. Licences, self-host et limites concrètes : open weights pour une PME.
4. Un score ne voit pas votre métier
Aucun de ces indices ne mesure :
- la qualité de vos documents internes ;
- le respect de votre politique données ;
- le coût réel à l’usage ;
- la maintenabilité d’un agent dans votre stack.
Comment s’en servir en entreprise (méthode Kervia)
- Clarifier la tâche (rédaction, support, code, extraction…)
- Cadrer les données (quoi ne jamais envoyer)
- Tester 2 modèles max sur 20 cas réels, pas sur un leaderboard
- Mesurer temps gagné + erreurs + relectures humaines
- Entretenir (les classements bougent ; votre process doit rester lisible)
C’est la méthode Kervia appliquée aux modèles : le bench informe, il ne décide pas.
Pour la différence chat vs agent (souvent confondue avec « le meilleur LLM ») : Chat IA ou agent IA.
Limites de cet article
- Snapshot 18 août 2026 : périmé dès la semaine suivante possible.
- Une seule vue tabulaire publique (OpenLM), elle-même agrégative.
- Pas de re-run Kervia des suites GPQA, SWE-bench, etc.
- Noms de variantes (« Sol », « Thinking », Flash…) : toujours vérifier la version exacte chez l’éditeur avant un achat API.
Sources
- OpenLM : Chatbot Arena + : tableau public (Arena Elo, Coding, AAII, MMLU-Pro) ; consultation 18 août 2026.
- LMArena Leaderboard : référence de l’écosystème Arena / préférences humaines.
- Artificial Analysis : LLM Leaderboard : référence de l’indice d’intelligence agrégé (AAII) et comparaisons multi-critères.
Les marques citées appartiennent à leurs éditeurs. Usage descriptif uniquement.
Pour le métier qui code : développeur face à l’IA (études).
QUESTIONS FRÉQUENTES
Pour aller à l’essentiel.
Quel est le « meilleur » modèle IA en ce moment ?
Il n’y a pas un gagnant unique. Sur les classements publics de préférence humaine (Arena) et d’indices agrégés (AAII), plusieurs modèles de pointe se tiennent dans un mouchoir. Le bon choix dépend de la tâche, du coût, de la confidentialité et du cadre d’usage.
Peut-on se fier uniquement au classement LMSYS / Arena ?
Non. L’Arena mesure surtout des préférences humaines en duel sur des prompts variés. Ce n’est ni un test métier PME, ni une mesure de coût, ni une garantie de conformité données. C’est un signal utile parmi d’autres.
Kervia a-t-elle produit ces scores elle-même ?
Non. Les chiffres de cet article sont repris de sources publiques citées (consultation du 18 août 2026) et présentés dans un graphique original. Nous n’avons pas relancé les évaluations en laboratoire.


