Claude Sonnet 5.5 : Anthropic attaque le mid-market avec 30 % plus rapide et 30 % moins cher
🔎 Trois semaines après Opus 5.5, la famille 5.5 se décline
Anthropic n'a pas traîné. Le 28 septembre 2026, à peine trois semaines après le lancement d'Opus 5.5, l'entreprise dévoile Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5. La promesse est simple : plus de 30 % de vitesse de génération en plus, jusqu'à 30 % de coût en moins par tâche, et des performances qui frôlent celles du modèle frontière de la maison.
Le timing n'est pas anodin. La guerre des prix fait rage entre les grands laboratoires, et Anthropic vient de démontrer avec GPT-6 Sol et Luna à moitié prix que le mid-market est devenu le vrai champ de bataille. Sonnet 5.5 est la réponse d'Anthropic : garder le tarif par token inchangé, mais faire payer les clients moins cher en consommation réelle.
Ce lancement est aussi le deuxième depuis que Dario Amodei a publiquement appelé à ralentir le rythme d'amélioration des modèles les plus avancés. Anthropic assume : selon CNBC, l'entreprise précise elle-même que le modèle « ne repousse pas la frontière des capacités ». On optimise, on ne révolutionne pas. Et c'est peut-être exactement ce que le marché attend.
L'essentiel
- Lancement le 28 septembre 2026 : Claude Sonnet 5.5 est le deuxième modèle de la famille Claude 5.5, trois semaines après Opus 5.5.
- 30 % plus rapide, jusqu'à 30 % moins cher par tâche : même prix par token (2 $/M input, 10 $/M output), mais moins de tokens consommés et moins d'appels d'outils.
- Benchmarks impressionnants : Terminal-Bench 4.0 à 70,6 % (contre 10,3 % pour Sonnet 5), GDPval-AA à 1 844, quasiment à égalité avec Opus 5.5 (1 846).
- Contre-analyse nuancée : Artificial Analysis mesure le plus gros usage de tokens jamais enregistré (~193 000 output tokens par tâche à effort max), soit un coût par tâche réel de 7,60 $, environ 50 % de plus que Sonnet 5.
- Cinq niveaux d'effort (low, medium, high, xhigh, max), contexte 1M natif, sortie max 128k tokens, cutoff juin 2026.
- Disponible partout : AWS, Google Cloud, Microsoft Azure, avec zéro rétention de données en option.
Outils recommandés
| Outil | Usage principal | Prix (septembre 2026, vérifiez sur anthropic.com) | Idéal pour |
|---|---|---|---|
| Claude Sonnet 5.5 | Codage agentique, automatisation, usage général | 2 $/M input, 10 $/M output, 0,20 $/M cache read | Développeurs et équipes qui veulent des perfis Opus sans le tarif |
| Claude Opus 5.5 | Tâches frontière, raisonnement maximal | 4 $/M input, 20 $/M output | Cas complexes où chaque point de benchmark compte |
| Claude Code | Développement assisté en terminal | Inclus dans les abonnements Claude / facturé à l'API | Développeurs qui veulent un agent de code en CLI, effort medium par défaut |
| Hostinger | Hébergement VPS pour déployer vos agents et API | À partir de quelques €/mois (vérifiez sur hostinger.com) | Héberger vos backends qui appellent l'API Claude en production |
Les chiffres qui comptent — Terminal-Bench 4.0 multiplié par presque 7
Réponse directe : oui, le saut de performances par rapport à Sonnet 5 est massif sur les benchmarks de codage agentique, au point de poser la question de la méthodologie de mesure.
Le chiffre qui saute aux yeux : 70,6 % sur Terminal-Bench 4.0, contre 10,3 % pour Sonnet 5. Un bond de plus de 60 points en quelques mois, c'est rare. Sur CursorBench 4.0, Sonnet 5.5 atteint 55,5 % contre 34,1 % pour Sonnet 5 — mais aussi 57,8 % pour Opus 5.5, ce qui place le modèle mid-range quasiment au niveau du modèle frontière.
Le détail le plus révélateur vient de GDPval-AA : 1 844 pour Sonnet 5.5, 1 846 pour Opus 5.5. Deux points d'écart. Pour un modèle facturé moitié moins cher par token, c'est le signal marketing parfait. AA-Briefcase confirme la tendance avec 1 811.
Autres scores notables :
| Benchmark | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 70,6 % | 10,3 % | — |
| CursorBench 4.0 | 55,5 % | 34,1 % | 57,8 % |
| FrontierCode 1.1 Max | 46,2 % | — | — |
| GDPval-AA | 1 844 | — | 1 846 |
| Humanity's Last Exam (avec outils) | 64,5 % | — | — |
| OSWorld 2.1 | 80,1 % | — | — |
| Chartography | 61,6 % | 15,6 % | — |
Le score de 80,1 % sur OSWorld 2.1 mérite qu'on s'y attarde : c'est un benchmark d'agentie sur système d'exploitation réel, et c'est exactement le type de charge de travail qui explosera avec la démarche ouverte autour de la plateforme OpenShell et Sentry de Nvidia. Les modèles capables de piloter un OS de façon fiable deviennent la matière première des agents en production.
La contre-analyse d'Artificial Analysis — le coût réel par tâche monte
Réponse directe : oui, les 30 % d'économie annoncés sont vrais à effort de référence, mais à effort max, le modèle consomme tellement de tokens que le coût par tâche réelle augmente de 50 % par rapport à Sonnet 5.
C'est la contre-analyse la plus importante de ce lancement, publiée par Artificial Analysis. Leurs mesures placent Sonnet 5.5 à 56 sur l'Intelligence Index, numéro 2 derrière Opus 5.5 (max) — une excellente position. Mais le détail token par token est édifiant :
- ~193 000 output tokens par tâche à effort max, soit environ 60 % de plus qu'Opus 5.5 ou Sonnet 5, et environ 7 fois plus que GPT-6 Astra.
- Coût par tâche réel de 7,60 $, soit environ 50 % de plus que Sonnet 5.
- À effort Low ou Medium en revanche, le modèle dépasse le meilleur score de Sonnet 5 pour environ un dixième du coût par tâche — là, la promesse d'Anthropic est tenue, et de loin.
Autrement dit : Sonnet 5.5 est un modèle extraordinairement bavard quand on lui donne les moyens de réfléchir longtemps. Il regroupe davantage ses appels d'outils — ce qui réduit le nombre d'étapes, comme le note The Decoder — mais chaque étape génère énormément de tokens. VentureBeat confirme que la baisse de coût par tâche vient de la réduction des tokens et des appels d'outils, pas d'un prix API inférieur.
Deuxième point de vigilance : les connaissances factuelles. Sur AA-Omniscience, Sonnet 5.5 plafonne à 54 % contre 66 % pour Opus 5.5. La bonne nouvelle, c'est que son taux d'hallucination est plus bas (47 % contre 59 %) — il sait moins de choses, mais ment moins sur ce qu'il sait. Pour un agent de code, c'est un arbitrage acceptable. Pour un agent de recherche, c'est rédhibitoire, et vous aurez intérêt à regarder du côté des meilleurs LLM pour la recherche.
À noter aussi : Artificial Analysis a identifié un bug sur les structured outputs en pré-release, corrigé avant la sortie publique. Rassurant sur le processus qualité d'Anthropic.
La position tarifaire — même prix par token, facture allégée
Réponse directe : Anthropic ne baisse pas ses prix affichés, elle baisse votre facture en rendant le modèle plus efficace. C'est une stratégie plus intelligente et plus durable.
Les tarifs de Sonnet 5.5 sont identiques à ceux de Sonnet 5 : 2 $/M input, 10 $/M output, 0,20 $/M cache read. Pour mémoire, Sonnet 5 était arrivé en juin à ce prix de lancement, rendu permanent en août au lieu des 3 $/15 $ initialement prévus. Opus 5.5, lui, facture le double : 4 $/20 $ par million de tokens.
| Modèle | Input (/M tokens) | Output (/M tokens) | Cache read (/M tokens) |
|---|---|---|---|
| Claude Opus 5.5 | 4 $ | 20 $ | — |
| Claude Sonnet 5.5 | 2 $ | 10 $ | 0,20 $ |
| Claude Sonnet 5 | 2 $ | 10 $ | 0,20 $ |
Dans le contexte de la guerre des prix qui secoue le marché depuis GPT-6 Sol et Luna à moitié prix, cette approche est un coup de pression indirect : plutôt que de suivre la spirale baissière des prix affichés face à Gemini 3.8 Flash et aux modèles OpenAI low-cost, Anthropic joue la carte de l'efficience par tâche. Le message aux clients : « Comparez vos factures mensuelles, pas nos grilles tarifaires. »
C'est aussi la continuité directe de la stratégie initiée avec Sonnet 5, dont nous avons analysé les performances d'Opus au prix Sonnet. Anthropic transforme méthodiquement sa gamme mid-range en cheval de Troie : capturer le volume des développeurs et des entreprises qui ne peuvent pas justifier 20 $/M d'output, puis les faire monter en gamme via les niveaux d'effort.
Côté infrastructure, ce lancement s'appuie sur une capacité de calcul considérable — l'accord récent avec SpaceX pour Colossus 1 et ses 220 000 GPUs donne une idée de l'échelle des moyens engagés pour tenir ce rythme de sorties.
Cinq niveaux d'effort — le levier caché du coût
Réponse directe : la vraie innovation économique de Sonnet 5.5 n'est pas le prix, c'est le contrôle granulaire de l'effort de raisonnement, qui permet de diviser la facture par dix sans sacrifier la qualité.
Sonnet 5.5 propose cinq niveaux d'effort : low, medium, high, xhigh, max. Le défaut est high sur l'API et medium dans Claude Code. C'est le point le plus sous-communicqué du lancement, et pourtant le plus important pour votre portefeuille.
Concrètement :
- À effort Low ou Medium, Sonnet 5.5 dépasse le meilleur score jamais atteint par Sonnet 5 pour environ un dixième du coût par tâche. C'est le sweet spot absolu pour les tâches courantes : revue de code, refactoring simple, génération de tests, agents de support.
- À effort High (défaut API), vous obtenez les scores de benchmarks annoncés, avec une consommation de tokens déjà élevée.
- À effort Max, vous atteignez le niveau Opus 5.5 sur beaucoup de tâches, mais avec ~193 000 tokens de sortie par tâche et 7,60 $ par tâche selon Artificial Analysis. À ce niveau, la question à se poser est simple : pourquoi ne pas utiliser directement Opus 5.5 à 4 $/20 $ ?
La recommandation pratique est donc claire : bloquez l'effort Medium par défaut dans vos applications, et ne montez en xhigh/max que sur des tâches explicitement difficiles. C'est la différence entre une facture API maîtrisée et une mauvaise surprise en fin de mois.
Autre spécification à connaître : contexte de 1M tokens natif, sortie max de 128k tokens (300k sur Message Batches en beta), cutoff juin 2026, et l'ID claude-sonnet-5-5. La vitesse de génération, elle, est plus de 30 % supérieure à Sonnet 5 — un gain qui se ressent immédiatement dans Claude Code et dans les boucles agentiques où la latence s'accumule à chaque étape.
Ce que ça change pour les développeurs en production
Réponse directe : pour 90 % des usages de codage, Sonnet 5.5 rend Opus 5.5 inutile. Le calcul est brutal et en faveur du passage à la gamme mid.
Si vous développez avec Claude au quotidien, voici l'impact concret :
Dans Claude Code, le défaut à effort Medium signifie que vous bénéficiez des gains de vitesse et de coût sans rien changer à votre configuration. Pour les tâches de codage journalières — comprendre une codebase, écrire une fonction, corriger un bug — Sonnet 5.5 à Medium est très probablement le meilleur rapport qualité/prix du marché. Notre comparatif des meilleurs LLM pour coder sera mis à jour en conséquence.
Dans vos pipelines CI/CD et vos agents automatisés, la réduction du nombre d'appels d'outils (grâce au regroupement) diminue le nombre d'étapes par tâche. Moins d'étapes, c'est moins de latence, moins de points de défaillance, et moins de tokens. C'est particulièrement pertinent pour les architectures agentiques décrites dans notre guide sur les meilleurs LLM pour les agents IA.
Sur le plan opérationnel, le modèle est déployé sur AWS, Google Cloud et Microsoft Azure, avec zéro rétention de données disponible. Pour les entreprises avec des contraintes de conformité, c'est un argument de poids — et les garde-fous cybersécurité sont, pour la première fois sur un Sonnet, comparables à ceux des modèles frontière.
Pour les usages frontière, en revanche, Opus 5.5 garde son intérêt : GDPval-AA est certes à égalité (1 846 contre 1 844), mais l'écart se creuse sur les connaissances factuelles (66 % contre 54 % sur AA-Omniscience) et sur les tâches où le budget tokens n'est pas un problème. Si vous hésitez entre les deux écosystèmes, notre comparatif Claude vs ChatGPT et le comparatif mensuel des meilleurs LLM vous aideront à trancher.
Et si vous préférez garder la main sur vos données et vos coûts, les meilleurs LLM à run en local restent une alternative crédible pour les tâches sensibles, avec notre guide d'installation d'un LLM local via Ollama ou LM Studio.
Sécurité et system card — moins de mésalignement, mais un raisonnement plus opaque
Réponse directe : la system card est plutôt rassurante sur les risques, avec une réserve notable sur la lisibilité du raisonnement.
Les évaluations RSP (Responsible Scaling Policy) concluent que Sonnet 5.5 est globalement moins capable qu'Opus 5.5 et ne franchit aucun nouveau seuil. Les risques de mésalignement sont jugés faibles. Point intéressant : c'est le modèle avec la plus faible propension de tous ceux testés à sonder les limites de ses conteneurs — une bonne nouvelle pour qui exécute des agents en environnement sandboxé, à l'heure où des initiatives comme la plateforme OpenShell de Nvidia tentent d'encadrer la sécurité des agents.
Le bémol vient du côté interprétabilité : le raisonnement de Sonnet 5.5 est plus illisible que celui des modèles précédents. Pour une entreprise qui investit dans l'audit de ses agents — comme Anthropic elle-même l'a montré avec son chercheur en alignement automatisé qui surpasse les humains — c'est une tension à surveiller. On optimise les performances, on dégrade la transparence.
❌ Erreurs courantes
Erreur 1 : Croire que « 30 % moins cher » s'applique à tous les usages
Ce qui ne va pas : les 30 % d'économie sont mesurés à effort de référence. À effort Max, Artificial Analysis mesure un coût par tâche de 7,60 $, soit ~50 % de plus que Sonnet 5, à cause de ~193 000 output tokens par tâche.
La solution : verrouillez l'effort Medium par défaut dans vos applications, et réservez xhigh/max aux tâches explicitement difficiles. Mesurez votre coût par tâche réel, pas le prix par token.
Erreur 2 : Supprimer Opus 5.5 de votre stack trop vite
Ce qui ne va pas : l'égalité sur GDPval-AA (1 844 vs 1 846) invite à basculer 100 % sur Sonnet 5.5. Mais l'écart de 12 points sur AA-Omniscience (54 % vs 66 %) montre que le modèle frontière garde l'avantage sur les connaissances factuelles.
La solution : gardez un routage par tâche — Sonnet 5.5 pour le code et l'agentique, Opus 5.5 pour l'analyse factuelle et les décisions à fort enjeu.
Erreur 3 : Comparer les grilles tarifaires au lieu des factures
Ce qui ne va pas : à prix par token identique à Sonnet 5, on pourrait conclure qu'il n'y a aucun gain économique.
La solution : comparez le coût par tâche accomplie sur vos propres workloads. C'est la métrique qui compte, et c'est exactement là qu'Anthropic veut vous faire gagner.
Erreur 4 : Ignorer la dégradation de la lisibilité du raisonnement
Ce qui ne va pas : la system card note un raisonnement plus illisible que les modèles précédents, ce qui complique l'audit de vos agents.
La solution : si l'auditabilité est critique pour vous, mettez en place des traces structurées en amont et en aval des appels au modèle, et testez les structured outputs (le bug de pré-release a été corrigé, mais validez sur vos cas).
❓ Questions fréquentes
Quel est le prix exact de Claude Sonnet 5.5 ?
2 $ par million de tokens en input, 10 $/M en output et 0,20 $/M en cache read (septembre 2026, vérifiez sur anthropic.com). C'est identique à Sonnet 5 et deux fois moins cher qu'Opus 5.5 (4 $/20 $). L'économie de 30 % annoncée vient de la consommation réduite, pas du prix affiché.
Sonnet 5.5 remplace-t-il Opus 5.5 ?
Pas entièrement. Sur le codage agentique et GDPval-AA, les deux sont quasiment à égalité, et Sonnet 5.5 coûte moitié moins cher. Mais Opus 5.5 garde un net avantage sur les connaissances factuelles (66 % vs 54 % sur AA-Omniscience) et sur les tâches à effort Max. Le routage par tâche reste la meilleure stratégie.
Quelle est la différence avec Sonnet 5 ?
Plus de 30 % de vitesse de génération, jusqu'à 30 % de coût en moins par tâche, et des gains massifs sur les benchmarks : Terminal-Bench 4.0 passe de 10,3 % à 70,6 %, CursorBench 4.0 de 34,1 % à 55,5 %. S'ajoutent cinq niveaux d'effort et des garde-fous cybersécurité de niveau frontière, une première pour un Sonnet.
Le modèle est-il disponible sur les clouds ?
Oui, Sonnet 5.5 est déployé sur AWS, Google Cloud et Microsoft Azure dès le lancement, avec zéro rétention de données disponible en option. L'ID du modèle est claude-sonnet-5-5, avec un contexte de 1M tokens natif et une sortie max de 128k tokens.
Faut-il s'inquiéter des risques de sécurité ?
La system card juge les risques de mésalignement faibles et le modèle ne franchit aucun nouveau seuil RSP. C'est aussi le modèle le moins enclin à sonder les limites de ses conteneurs. Le principal point de vigilance est l'opacité croissante du raisonnement, qui complique l'audit des agents en production.
Claude Haiku 5.5 arrive-t-il bientôt ?
Anthropic a annoncé Claude Haiku 5.5 dans les prochaines semaines. Logiquement, il héritera des gains d'efficience de la famille 5.5 à un tarif encore plus bas, ce qui pourrait redistribuer les cartes sur le segment des modèles économiques face à GPT-6 Sol et Gemini 3.8 Flash.
✅ Conclusion
Claude Sonnet 5.5 n'est pas un modèle frontière et Anthropic le dit elle-même — c'est mieux que ça : c'est le modèle le plus rentable de sa gamme, à condition de maîtriser le curseur d'effort. À Medium, il enterre Sonnet 5 pour un dixième du coût ; à Max, il rattrape Opus 5.5 mais explose les compteurs de tokens. Testez-le dès aujourd'hui avec l'effort Medium par défaut, et consultez notre comparatif des meilleurs LLM pour coder pour le situer face à la concurrence.