La question m'est arrivée trois fois cette semaine, sous trois formes différentes. Un stagiaire en Titre Pro qui hésite entre deux abonnements. Une consultante en reconversion qui veut « la meilleure IA » pour préparer ses candidatures. Un formateur qui me demande si ce qu'il a appris en mars est déjà périmé. Trois personnes, une même inquiétude : le paysage bouge si vite qu'on ne sait plus où poser le pied.
Alors posons-le ensemble, chiffres en main, à la date du 17 août 2026. Pas pour couronner un champion — vous verrez que la notion même de champion devient discutable — mais pour comprendre ce que les classements disent, ce qu'ils ne disent pas, et ce que ça change concrètement pour vous.
Au 17 août 2026, Claude Opus 5 domine les classements composites, mais l'écart entre le 1er et le 10e n'est plus que de 9,5 %. Quatre familles de modèles chinois — Kimi, Qwen, GLM, DeepSeek — sont désormais dans ou aux portes du top 10. Et selon le benchmark retenu, l'ordre du podium s'inverse : GPT-5.6 Sol repasse devant sur LiveBench. Traduction pour vous : le choix du modèle compte de moins en moins, la maîtrise de l'usage compte de plus en plus.
Comment lire ces classements sans se faire avoir
Avant les tableaux, trois précautions de lecture — parce qu'un classement mal lu est pire qu'une absence de classement.
Un indice composite n'est pas un taux de réussite. Le premier tableau s'appuie sur l'Intelligence Index d'Artificial Analysis, qui agrège plusieurs évaluations en un score unique. Un modèle à 63 points n'a pas « 63 % de bonnes réponses » : c'est une position sur une échelle relative, rien de plus. La colonne « niveau relatif » de mes tableaux est un calcul simple — le score du modèle divisé par celui du leader — qui sert uniquement à visualiser les écarts.
Une photographie, pas un film. Ces chiffres sont relevés au 17 août 2026 pour le classement général, au 15 août pour le classement code. Dans deux semaines, certaines lignes auront bougé — c'est même le cœur de ce que cet article démontre. Un classement de LLM se date comme un bulletin météo.
Certains résultats sont préliminaires. Sur l'arène de code, plusieurs entrées récentes — Qwen 3.8 Max, Grok 4.6, Gemini 3.7 Flash, DeepSeek V4 Pro — reposent encore sur un volume de votes en cours de consolidation. Leur rang peut varier.
Le top 10 général au 17 août 2026
Voici le classement composite, relevé le 17 août 2026 sur Artificial Analysis.
| Rang | Modèle | Entreprise | Intelligence Index | Niveau relatif |
|---|---|---|---|---|
| 1 | Claude Opus 5 Max | Anthropic | 63 | 100 % |
| 2 | Claude Fable 5 | Anthropic | 62 | 98,4 % |
| 3 | GPT-5.6 Sol Max | OpenAI | 61 | 96,8 % |
| 4 | Grok 4.6 High | xAI | 61 | 96,8 % |
| 5 | Kimi K3 Max | Moonshot | 60 | 95,2 % |
| 6 | Qwen 3.8 2.4T A95B | Alibaba | 58 | 92,1 % |
| 7 | Qwen 3.8 Max | Alibaba | 58 | 92,1 % |
| 8 | GPT-5.6 Terra Max | OpenAI | 57 | 90,5 % |
| 9 | Muse Spark 1.2 | Meta | 57 | 90,5 % |
| 10 | Claude Opus 4.8 | Anthropic | 57 | 90,5 % |
Source : Artificial Analysis, Intelligence Index, relevé le 17 août 2026. Niveau relatif : score ÷ 63 (score du leader) — ce n'est pas un taux de bonnes réponses.
Ce que je retiens de ce tableau, ce n'est pas le nom du premier. C'est l'écart : 9,5 % entre le 1er et le 10e sur un indice composite. Il n'y a pas si longtemps, le même exercice montrait des marches d'escalier ; aujourd'hui, c'est une rampe douce. Le trio OpenAI-Anthropic-Google, qui régnait presque seul sur ce genre de classement il n'y a pas si longtemps, n'en occupe plus que cinq lignes sur dix.
Notez aussi qui est dixième : Claude Opus 4.8, le modèle qui dominait tout au printemps. Sa relégation en bas de tableau, à 90,5 % du leader, dit tout du rythme. Nous l'avions mesuré au moment de la sortie de son successeur, dans notre comparatif Claude Fable 5 : un cycle de domination dure désormais un trimestre.
Sur le code, l'écart se resserre encore
Le deuxième tableau vient de l'arène WebDev de LMArena, où de vrais utilisateurs comparent à l'aveugle des interfaces produites par deux modèles et votent pour la meilleure. Près de 580 000 votes au 15 août 2026 — c'est le classement le plus « terrain » qui existe pour le code.
| Rang | Modèle | Elo Arena | Niveau relatif |
|---|---|---|---|
| 1 | Claude Opus 5 Max | 1 692 | 100 % |
| 2 | Kimi K3 Max | 1 674 | 98,9 % |
| 3 | Qwen 3.8 Max | 1 667 | 98,5 % |
| 4 | Claude Opus 5 High | 1 663 | 98,3 % |
| 5 | Grok 4.6 High | 1 631 | 96,4 % |
| 6 | Claude Fable 5 | 1 627 | 96,2 % |
| 7 | GPT-5.6 Sol xHigh / Codex | 1 622 | 95,9 % |
| 8 | Gemini 3.7 Flash High | 1 587 | 93,8 % |
| 9 | GLM-5.2 Max | 1 585 | 93,7 % |
| 10 | DeepSeek V4 Pro High | 1 584 | 93,6 % |
Source : LMArena, WebDev Arena, relevé le 15 août 2026 (~580 000 votes). Les entrées Qwen 3.8 Max, Grok 4.6, Gemini 3.7 Flash et DeepSeek V4 Pro sont indiquées comme préliminaires par l'arène : leur rang peut encore varier.
Deux modèles chinois sur le podium du code, à moins de 1,5 % du leader. Kimi K3, dont nous avions examiné les promesses d'ouverture en juillet, n'est plus une curiosité : c'est un concurrent frontal. Et ce classement a déjà changé en moins de deux semaines — début août, GPT-5.6 Sol pointait sixième et Kimi K3 déjà deuxième. La photographie du 3 août était périmée le 15. Celle du 15 le sera en septembre.
La nuance qui compte : les benchmarks ne sont pas d'accord
Voici le passage que les classements en une image ne montrent jamais — et c'est précisément celui qui devrait guider votre décision.
Sur LiveBench, qui renouvelle régulièrement ses questions pour limiter la contamination des données d'entraînement et mesure mathématiques, code, raisonnement et suivi d'instructions, l'ordre du podium s'inverse : GPT-5.6 Sol Max atteint 81,0, devant GPT-5.5 Thinking à 80,2 et Claude Opus 5 à 80,1 (relevé du 17 août 2026).
Le même jour, deux instruments de mesure sérieux donnent donc deux leaders différents — avec moins d'un point d'écart. Ce n'est pas une anomalie : c'est l'information principale. Quand les instruments ne parviennent plus à départager les premiers, c'est que la différence réelle, pour votre usage quotidien, est devenue plus petite que la marge d'erreur de la mesure.
Ma lecture au 17 août, en une ligne par modèle : Claude Opus 5 reste le meilleur généraliste sur l'ensemble intelligence, agents et code ; GPT-5.6 Sol est quasiment ex æquo, avec un avantage sur le raisonnement mesuré par LiveBench ; Kimi K3 est la surprise de l'année, au niveau de la frontière et redoutable en code ; Grok 4.6 signe une nette remontée ; Qwen 3.8 s'impose sur le rapport performances-coût.
Quatre familles chinoises dans le groupe de tête
Prenez les deux tableaux ensemble et comptez : Kimi, Qwen, GLM et DeepSeek — quatre familles de modèles chinois figurent dans ou aux portes du top 10, selon le benchmark. Ce type de classement était encore récemment un entre-soi américain, OpenAI, Anthropic et Google se partageant les podiums.
Ce basculement n'est pas qu'une affaire de scores. Une partie de ces modèles est diffusée en poids ouverts, à des coûts d'usage sensiblement inférieurs — nous avions détaillé ce que « ouvert » veut dire et ne veut pas dire dans l'analyse de Qwen 3.8 Max face à Claude. Pour les entreprises comme pour les indépendants, cela installe une réalité nouvelle : la performance de pointe cesse d'être un monopole, et le prix de l'intelligence artificielle devient un vrai terrain de concurrence.
Je me garde des deux emballements symétriques — « les États-Unis ont perdu » comme « ce ne sont que des copies ». Les chiffres ci-dessus disent une chose plus sobre : la course s'est resserrée, et elle compte désormais plus de coureurs sérieux qu'il n'y a de places sur un podium.
Ce que ça change pour votre reconversion
Revenons à mes trois questions de début de semaine — le stagiaire, la consultante, le formateur. Que leur répondre avec ces tableaux sous les yeux ?
Au stagiaire qui hésite entre deux abonnements : l'écart entre les modèles de tête est passé sous le seuil où il devrait déterminer votre choix. Prenez celui qui s'intègre le mieux à votre environnement de travail, et investissez la différence — en temps, pas en euros — dans l'apprentissage de l'outil. À 96 % ou à 100 % du leader, un modèle mal utilisé produit le même résultat médiocre.
À la consultante qui veut « la meilleure IA » : la meilleure IA pour une candidature est celle à qui vous donnez le meilleur contexte. C'est votre travail de clarification — le poste visé, vos preuves, votre trajectoire — qui fait la qualité de la sortie, pas les trois points d'Intelligence Index. C'est exactement le sujet de notre page sur l'IA dans une reconversion professionnelle : l'outil accélère un projet clair, il n'éclaircit pas un projet flou.
Au formateur qui craint d'être périmé : ce qui se périme en un trimestre, ce sont les classements. Ce qui ne se périme pas, c'est la compétence de lecture que vous venez d'exercer sur cet article — dater une donnée, vérifier une source, distinguer un indice composite d'un taux de réussite. Cette compétence-là est précisément celle qui manque le plus sur le marché du travail, et elle s'enseigne. Notre panorama des métiers d'avenir face à l'IA et notre analyse IA et emploi à l'horizon 2030 creusent cette question.
Ce n'est plus « quel est le meilleur modèle ? », c'est « qu'est-ce que je sais faire avec ? ». Si votre projet professionnel est encore flou, aucun des dix modèles de ces tableaux ne le clarifiera à votre place. Le bilan gratuit en 3 minutes est fait pour ça : poser votre situation d'abord, outiller ensuite.
Questions fréquentes
Quel est le meilleur LLM en août 2026 ?
Cela dépend de l'instrument de mesure. Au 17 août 2026, Claude Opus 5 (configuration Max) domine l'Intelligence Index d'Artificial Analysis (63 points) et l'arène de code de LMArena (Elo 1 692), mais GPT-5.6 Sol Max le devance sur LiveBench (81,0 contre 80,1). L'écart entre les modèles de tête est inférieur à la variabilité entre benchmarks : il n'y a plus un « meilleur » incontestable, il y a un groupe de tête.
Les modèles chinois ont-ils rattrapé les modèles américains ?
Sur les benchmarks publics relevés à la mi-août 2026, oui pour l'essentiel : Kimi K3 et Qwen 3.8 sont sur le podium du code à moins de 1,5 % du leader, et quatre familles chinoises (Kimi, Qwen, GLM, DeepSeek) figurent dans ou aux portes du top 10, selon le benchmark. L'écart résiduel se joue sur les configurations maximales et l'écosystème d'agents, plus que sur la capacité brute.
Un classement de LLM reste-t-il valable combien de temps ?
Quelques semaines au mieux. Entre le 3 et le 15 août 2026, l'ordre du classement code a déjà bougé. Un classement non daté est une information morte : vérifiez toujours la date de relevé, et méfiez-vous de tout contenu qui présente un ordre de modèles comme définitif.
Les chiffres de cet article sont relevés le 17 août 2026 (classement général, LiveBench) et le 15 août 2026 (arène de code) sur les plateformes publiques citées. Les classements de modèles évoluent en continu : à la date où vous lisez ces lignes, certains rangs ont probablement bougé — c'est d'ailleurs la seule prédiction sans risque de cet article.