Sonnet 5.5 : moins cher qu'Opus, mais à quel effort ?

Par Publié le 13 min de lecture

Bannière éditoriale : Claude Sonnet 5.5. Sous le titre, « À 2 points d'Opus 5.5 sur le travail de bureau, mais à l'effort maximal seulement », un graphique compare Opus 5.5 puis Sonnet 5.5 sur six tests d'Anthropic, en pourcentage : Terminal-Bench 66,4 % puis 70,6 %, FrontierCode 54,4 % puis 46,2 %, CursorBench 57,8 % puis 55,5 %, Humanity's Last Exam 67,7 % puis 64,5 %, OSWorld 81,8 % puis 80,1 %, Chartography 64,4 % puis 61,6 %. Une note manuscrite demande « À quel effort ce score ? ». Portrait de Benjamin Duplaa à droite.

Ce mardi matin, j'ai changé de modèle dans mon outil de travail. Le menu proposait une ligne de plus : Sonnet 5.5, sorti la veille. Le premier travail que je lui ai confié a été de relire l'annonce de son propre éditeur et de vérifier chaque chiffre à sa source. Un modèle d'Anthropic qui relit Anthropic : je sais ce que cela vaut. C'est pourquoi chaque constat de cet article renvoie à une source extérieure à lui, listée en fin de page, et non à son avis sur lui-même.

Deux choses sont sorties de cette relecture, que l'annonce ne met pas côte à côte. La première se trouve dans mon propre article de juillet : j'y écrivais que le prix de Sonnet 5 passerait de 2 à 3 dollars le million de tokens en septembre. La page tarifaire d'Anthropic dit aujourd'hui que cette hausse n'aura pas lieu. La seconde compte davantage si vous choisissez un outil : le score de « travail de bureau » que l'annonce met en avant, à deux points d'Opus 5.5, est celui de l'effort maximal. Au réglage que les applications utilisent par défaut, le classement d'où il vient donne 284 points d'écart.

En clair —

Anthropic a publié Claude Sonnet 5.5 le 28 septembre 2026, six jours après Opus 5.5. Au token, il coûte la moitié d'Opus 5.5 (2 $ et 10 $ le million, contre 4 $ et 20 $), au même prix que Sonnet 5, dont la hausse prévue a été annulée. Sur GDPval-AA, le test le plus proche du travail de bureau, les deux modèles sont à égalité à l'effort maximal (1 844 contre 1 846, pour une incertitude de ±24). Mais les applications tournent par défaut à l'effort moyen : à ce réglage, le classement d'Artificial Analysis donne 1 292 à Sonnet 5.5 et 1 576 à Opus 5.5, soit 284 points d'écart. Anthropic écrit elle-même qu'Opus 5.5 reste nettement plus solide sur le travail complexe et ouvert. Pour vous, la bonne mesure reste la vôtre : trois tâches réelles, un chronomètre, et le temps qu'il faut pour corriger.

Ce que l'annonce affirme

Sonnet 5.5 est le deuxième modèle de la famille Claude 5.5, après Opus 5.5 du 22 septembre. Anthropic le présente comme un complément plus rapide et moins cher d'Opus 5.5 : Opus pour le travail complexe qui demande du jugement, Sonnet pour les tâches quotidiennes bien cadrées, la correction de bugs, et la création de documents, de présentations et de tableurs soignés. Un troisième modèle, Haiku 5.5, doit suivre « dans les semaines qui viennent ».

Trois promesses chiffrées : une génération de texte plus de 30 % plus rapide que Sonnet 5, un coût par tâche jusqu'à 30 % plus bas dans les tests de l'éditeur, et un prix au token inchangé. La baisse de coût, explique Anthropic, vient du fait que le modèle a besoin de bien moins de tokens pour le même travail, pas d'un prix cassé. Retenez ce détail : il compte pour la suite.

Le tableau d'Anthropic, ligne par ligne

Voici les lignes du tableau publié par Anthropic où Sonnet 5.5 est comparé à Sonnet 5 et à Opus 5.5, avec la colonne « Ce qui est mesuré » que j'ajoute. L'annonce y ajoute GPT-6 Sol, d'OpenAI, sur quatre tests ; je ne les reprends pas, car elle signale elle-même qu'un correctif d'OpenAI n'est peut-être pas encore pris en compte dans certains classements.

TestCe qui est mesuréSonnet 5Sonnet 5.5Opus 5.5
Terminal-Bench 4.0Programmation en terminal par un agent autonome10,3 %70,6 %66,4 %
FrontierCode 1.1Programmation : la modification serait-elle acceptée ?42,4 %46,2 %54,4 %
CursorBench 4.0Programmation, tâches tirées de sessions réelles34,1 %55,5 %57,8 %
GDPval-AA v2.1Travail de bureau qualifié (score de duel)1 4491 8441 846
AA-Briefcase v1.1Travail de bureau de longue haleine (score de duel)1 3591 8111 822
Humanity's Last Exam (avec outils)Questions d'experts, toutes disciplines54,9 %64,5 %67,7 %
OSWorld 2.1 (score partiel)Usage d'un ordinateur57,0 %80,1 %81,8 %
Chartography (sans outils)Lecture de graphiques professionnels15,6 %61,6 %64,4 %

Source : Anthropic, annonce de Claude Sonnet 5.5, 28 septembre 2026 [relevé le 2026-09-29]. Chiffres publiés par l'éditeur. GDPval-AA et AA-Briefcase ont été mesurés par Artificial Analysis sur une version préliminaire de Sonnet 5.5 dont un défaut, corrigé depuis, pouvait dégrader certaines réponses ; Anthropic en attend un effet faible, qui sous-estimerait plutôt le modèle. Réglages précisés par l'éditeur : effort « Xhigh » pour Opus 5.5 sur Terminal-Bench 4.0, effort « Max » pour Sonnet 5.5 sur FrontierCode. Les scores de type Elo (GDPval-AA, AA-Briefcase) sont des classements en duels, pas des pourcentages.

Lu tel quel, le tableau donne ceci. Sonnet 5.5 devance Opus 5.5 sur un seul test, Terminal-Bench 4.0 (70,6 % contre 66,4 %, où Opus 5.5 est mesuré à son meilleur réglage). Il reste derrière sur les sept autres : de 1,7 à 8,2 points sur les cinq tests en pourcentage, de 2 et de 11 points de classement sur les deux tests de travail de bureau. Face à Sonnet 5, l'écart est énorme : de 3,8 points sur FrontierCode à plus de 60 points sur Terminal-Bench 4.0.

Ce dernier saut, de 10,3 % à 70,6 % en trois mois, est rare, et l'annonce ne l'explique pas. Elle précise seulement qu'à l'effort moyen, le réglage des applications, Sonnet 5.5 dépasse largement le meilleur score de Sonnet 5 pour moins d'un dixième du coût par tâche. La méthode des tests est détaillée dans la fiche technique du modèle, pas dans l'annonce.

Le même test, cinq réglages

Le tableau d'Anthropic ne donne pas le réglage de la ligne GDPval-AA, celle qui ressemble le plus à du travail de bureau. Le classement public d'Artificial Analysis, qui a mesuré ce test, le donne, et il donne aussi tous les autres. Comme je l'expliquais le 22 septembre à propos d'Opus 5.5, c'est un classement en duels, jugés à l'aveugle par des modèles d'IA : « 1 846 » veut dire « gagne plus souvent », pas « fait mieux qu'un professionnel ». Voici les trois modèles, du réglage le plus faible au plus élevé.

EffortSonnet 5Sonnet 5.5Opus 5.5Écart Opus 5.5 – Sonnet 5.5
Faible1 0591 1681 22456
Moyen (défaut des applications)1 1451 2921 576284
Élevé (défaut de la plateforme)1 2461 5171 692175
Très élevé (« Xhigh »)1 3441 7251 82095
Maximal1 4491 8441 8462

Source : Artificial Analysis, classement GDPval-AA v2.1 [consulté le 2026-09-29]. Scores de type Elo, au raisonnement adaptatif. Intervalle de confiance à 95 % de ±18 à ±24 points selon la ligne : deux scores qui diffèrent de moins d'une vingtaine de points ne sont pas distinguables. Défauts par interface d'après Anthropic. Le classement bouge : Anthropic signale que la mesure de Sonnet 5.5 a été faite sur une version préliminaire.

Trois lectures.

À l'effort maximal, l'égalité est réelle. 1 844 contre 1 846 : deux points, pour une incertitude de ±24. Sur ce test et à ce réglage, les deux modèles sont indiscernables, et c'est bien ce que dit l'annonce.

Un cran plus bas, l'écart apparaît. À « Xhigh », Opus 5.5 est à 1 820 et Sonnet 5.5 à 1 725 : 95 points, plus de quatre fois l'incertitude. À l'effort moyen, celui que les applications d'Anthropic utilisent par défaut, Sonnet 5.5 est à 1 292 et Opus 5.5 à 1 576 : 284 points. Pour rejoindre le niveau qu'Opus 5.5 atteint à l'effort moyen, l'effort « élevé » de Sonnet 5.5 (1 517) ne suffit pas tout à fait ; il faut le « Xhigh » (1 725) pour le dépasser.

Écart entre Opus 5.5 et Sonnet 5.5 sur GDPval-AA, en points de classement, selon l'effort
Effort faible56
Effort moyen (défaut des applications)284
Effort élevé (défaut de la plateforme)175
Effort « Xhigh »95
Effort maximal2

Source : Artificial Analysis, GDPval-AA v2.1 [consulté le 2026-09-29]. Écart = score d'Opus 5.5 moins score de Sonnet 5.5, au même réglage.

Le progrès sur Sonnet 5 est réel, mais pas partout. À effort égal, Sonnet 5.5 dépasse Sonnet 5 de 109 points à l'effort faible à 395 points à l'effort maximal. Pourtant, à l'effort moyen, son 1 292 reste sous le meilleur score de Sonnet 5 (1 449, à l'effort maximal) : pour le dépasser, il faut l'effort « élevé ». Anthropic écrit que, « sur plusieurs tests », Sonnet 5.5 à effort faible ou moyen dépasse le meilleur score de Sonnet 5 pour environ un dixième du coût. Les courbes de son annonce portent sur Terminal-Bench, FrontierCode, CursorBench et AA-Briefcase, pas sur GDPval-AA.

Un second exemple montre pourquoi un score sans son réglage ne vaut rien. Le 22 septembre, Anthropic publiait pour Opus 5.5 un score de 89,0 % sur Chartography, le test de lecture de graphiques ; le 28, elle en publie un de 64,4 %. Ce n'est pas une erreur : la première ligne est « avec outils », la seconde « sans outils ». Chaque tableau indique son réglage, en petit. Aucun ne signale que le suivant changera la définition du chiffre.

Le prix : moitié moins au token, pas par tâche

Au token, la comparaison est simple.

ModèleEntrée (par million de tokens)Sortie (par million de tokens)
Sonnet 5.52 $10 $
Sonnet 52 $10 $
Opus 5.54 $20 $
Fable 5.110 $50 $

Source : Anthropic, tarifs de l'API [consulté le 2026-09-29]. Tarifs standard, hors mode rapide, hors traitement par lots.

Sonnet 5.5 coûte la moitié d'Opus 5.5 et le cinquième de Fable 5.1. Mais la facture d'une tâche dépend aussi du nombre de tokens que le modèle consomme, donc du réglage. Anthropic écrit que Sonnet 5.5 complète Opus 5.5 au mieux à effort faible, là où il coûte moins cher par tâche, et qu'à effort élevé il peut faire jeu égal « pour un coût similaire ». À la lumière du classement ci-dessus, ma lecture est la suivante : un modèle à moitié prix qui doit réfléchir plus longtemps pour atteindre le même niveau ne coûte pas moitié moins par tâche. « Moitié prix » est un prix au token, pas une garantie sur votre tâche.

Si vous utilisez une application avec un abonnement, ces prix ne vous concernent pas directement : ils fixent ce que paient les outils construits sur le modèle, qui les répercutent ou non. Ce qui vous concerne, c'est le réglage par défaut de votre outil.

Ce que nous avions écrit, et ce qui a changé

Le 3 juillet, dans notre article sur Sonnet 5, nous écrivions que le prix de lancement, 2 $ et 10 $, courait jusqu'au 31 août et passerait ensuite à 3 $ et 15 $. La page tarifaire d'Anthropic dit aujourd'hui que 2 $ et 10 $ est « désormais le prix standard » et que la hausse prévue le 1er septembre n'aura pas lieu. Notre texte était exact à sa date. Il ne l'est plus depuis qu'Anthropic a renoncé à la hausse, et je ne peux pas dater ce changement : la page ne le date pas. L'article de juillet porte désormais une note de mise à jour et le bon tarif. Un prix annoncé « jusqu'à » une date se relit à cette date.

Pour quelles tâches, selon Anthropic

Anthropic écrit noir sur blanc, dans la même annonce, que dans ses propres tests et dans ceux de testeurs externes, Opus 5.5 reste nettement plus solide sur le travail complexe et ouvert qui demande un jugement soutenu. Sonnet 5.5, dit-elle, est le plus à l'aise sur les tâches bien cadrées.

Une tâche « bien cadrée », dans ma lecture, pas celle d'Anthropic, se reconnaît à trois choses : une entrée claire, un format attendu, un résultat que vous pouvez vérifier vous-même. Transformer des notes en compte rendu selon un modèle, tenir un tableau de suivi, mettre en forme une présentation à partir d'un gabarit : oui. Arbitrer entre deux financements pour un projet qui ne rentre dans aucune case, ou rédiger la position d'un organisme face à un litige : non, et c'est là que l'écart entre les deux modèles pèse.

Anthropic cite un seul cas de travail de bureau de bout en bout, et c'est un test interne. Elle a donné à Sonnet 5.5 les documents de résultats trimestriels d'une entreprise cotée, les transcriptions des appels correspondants et un modèle de présentation, et lui a demandé une revue d'exploitation de dix diapositives. Deux experts ont jugé son premier jet prêt à être envoyé tel quel. Un cas, choisi et décrit par l'éditeur : à lire comme une illustration, pas comme une mesure.

Ce que ça change pour vous

Si vous préparez une reconversion vers un métier de bureau, ou si vous formez des adultes à ces métiers, la question n'est pas de savoir quel modèle gagne. Elle est : à quel réglage, pour quelle tâche, et combien de temps me faut-il pour corriger ? Ce test-là se fait en une demi-heure.

  1. Choisissez trois tâches de bureau réelles : un compte rendu à partir de notes, un tableau de suivi avec des formules, une présentation de six diapositives à partir d'un gabarit.
  2. Faites-les avec le réglage par défaut de votre outil, celui que vous utiliserez vraiment, pas avec le meilleur possible. Notez ce réglage.
  3. Chronométrez le temps qu'il vous faut pour rendre chaque livrable présentable. Recalculez à la main cinq cellules du tableau, relisez chaque chiffre du compte rendu, chaque source de la présentation.
  4. Écartez sans discussion toute erreur grave : un chiffre faux, une règle périmée, un dispositif qui n'existe plus. Une erreur grave annule dix bonnes réponses.
  5. Si vous avez accès aux deux modèles, refaites la tâche la plus longue avec l'autre, au même réglage. Gardez le moins cher si le temps de correction est le même.

Ce qui devient ordinaire, c'est de mettre en forme, résumer, tabuler. Sur GDPval-AA, le modèle de milieu de gamme de septembre, à l'effort maximal, devance de 136 points l'Opus 5 de juillet (1 844 contre 1 708, deux mesures au même réglage). Ce qui reste rare, c'est de cadrer la tâche, de vérifier le résultat, de repérer l'erreur et d'assumer ce qu'on signe. C'est ce que j'appelle les métiers que l'IA valorise vraiment, et c'est pourquoi on peut se former à l'IA sans être technicien. L'étude sur les offres d'emploi des métiers exposés à l'IA, où elles ont chuté de plus de 50 % depuis fin 2023, donne de son côté un repère chiffré sur le marché.

Pour celles et ceux qui forment : deux modèles en six jours chez un même éditeur, un troisième annoncé. Un programme de plusieurs mois ne peut se caler ni sur une version, ni sur un réglage. Ce qui se transmet d'un outil à l'autre, c'est la méthode.

Une précision, parce qu'elle compte : cet article a été préparé avec Sonnet 5.5 lui-même, le modèle dont il parle. Ses chiffres viennent des sources listées plus bas, pas de son jugement sur lui-même. J'utilise Claude au quotidien, sur abonnement payant. Ma façon d'employer l'IA en formation d'adultes est décrite ici.

FAQ

Combien coûte Claude Sonnet 5.5 ?

2 dollars le million de tokens en entrée et 10 dollars en sortie ; 0,20 dollar pour la lecture du cache et 2,50 dollars pour son écriture. C'est le tarif de Sonnet 5, dont la hausse à 3 et 15 dollars, prévue au 1er septembre, a été annulée. Opus 5.5 coûte 4 et 20 dollars.

Sonnet 5.5 est-il meilleur qu'Opus 5.5 ?

Dans le tableau d'Anthropic, il ne le devance que sur Terminal-Bench 4.0 et reste derrière sur les sept autres lignes. Sur GDPval-AA, il l'égale à l'effort maximal (1 844 contre 1 846), reste 95 points derrière à l'effort « Xhigh » et 284 points derrière à l'effort moyen. Anthropic écrit qu'Opus 5.5 reste nettement plus solide sur le travail complexe et ouvert.

Quel réglage utilisent les applications, et où le trouver ?

Anthropic indique que l'effort par défaut est « moyen » dans Claude Code et dans ses applications, et « élevé » sur sa plateforme pour développeurs. Le modèle est annoncé « sur toutes les plateformes », dont Amazon Web Services, Google Cloud et Microsoft Azure, avec une option de conservation zéro des données. L'annonce ne détaille pas quelles formules d'abonnement y donnent accès ni les limites d'usage : regardez le sélecteur de modèles de votre application.

Pourquoi certaines demandes de cybersécurité passent-elles sur Sonnet 5 ?

Sonnet 5.5 est le premier modèle de la gamme Sonnet lancé avec les protections « cyber » des modèles les plus puissants d'Anthropic. Le travail courant de développement, dont la recherche et la correction de bugs, reste possible ; les tâches de cybersécurité à plus haut risque « retombent visiblement » sur Sonnet 5. Si vous vous entraînez sur des exercices de sécurité, certaines demandes peuvent donc être traitées par l'ancien modèle.

Faut-il changer d'outil pour se former ?

Non. Le modèle que vous apprendrez à utiliser aura été remplacé avant la fin d'une formation de plusieurs mois. Ce qui se transfère d'un outil à l'autre, c'est la méthode : formuler la tâche, vérifier le résultat, repérer l'erreur. Faites votre propre test sur trois tâches de votre futur métier, au réglage que vous utiliserez.

Sources

La méthode de sourçage appliquée sur ce site est décrite sur la page Sources et méthodologie.

🔗 Aller plus loin


Vous hésitez sur les compétences à travailler face à l'IA, ou sur le métier à viser ? Faire mon bilan gratuit · 3 min : sept questions pour situer où vous en êtes, avant d'engager du temps ou de l'argent. Et si votre situation ne rentre dans aucune case, écrivez-moi.

Soyez libre de vos pensées et de vos décisions, toujours.

Lettre mensuelle · Reconversion adulte

Recevoir le meilleur du journal, une fois par mois.

Terrain, chiffres, méthode. Pas plus, pas moins. Désabonnement en 1 clic, données jamais cédées.