Claude Opus 5.5 égale Fable 5.1 sur la plupart des tâches et coûte 40 % de moins qu’Opus 5

Auditer et corriger une base de 200 000 lignes de code en moins de trois heures, là où Opus 5 en réclamait plus de vingt. Le nouveau modèle d’Anthropic progresse en capacités, mais c’est surtout sur la facture que la différence se joue.

Présenté le 22 septembre, Claude Opus 5.5 inaugure la famille Claude 5.5. Anthropic le situe au niveau de Claude Fable 5.1, l’un de ses modèles les plus avancés, sur la majorité des tâches, pour un coût d’exploitation inférieur de 40 % à celui d’Opus 5. Sonnet 5.5 et Haiku 5.5 suivront dans les prochaines semaines.

C’est aussi le premier modèle publié depuis qu’Anthropic a plaidé pour un rythme plus mesuré dans la course aux modèles de pointe. Il a été évalué avant sa sortie par des évaluateurs externes, parmi lesquels METR.

Ce que Claude Opus 5.5 fait mieux qu’Opus 5

Sur les tests publiés par Anthropic, le modèle prend la tête en programmation agentique, en utilisation d’ordinateur et en travail de connaissance. Sur Terminal-Bench 4.0, qui mesure la conduite de tâches complexes en ligne de commande, il atteint 66,4 %, contre 52,3 % pour Opus 5 et 57,9 % pour GPT-6 Astra d’OpenAI.

Les exemples fournis vont dans le même sens. Un testeur a mené une migration de 680 000 lignes de code en moins d’une journée. En interne, la traduction du répartiteur de charge HAProxy du C vers le Rust a pris 9 h 30, contre 12 heures pour Fable 5.1, pour un coût inférieur de 51 %.

TestOpus 5.5Fable 5.1Opus 5GPT-6 Astra
Terminal-Bench 4.0, code agentique66,4 %55,8 %52,3 %57,9 %
FrontierCode v1.154,4 %50,3 %48,0 %53,3 %
GDPval-AA v2.1, travail de connaissance (Elo)1846173517081542
Humanity’s Last Exam, avec outils67,7 %65,6 %63,6 %57,2 %
Terminal-Bench-Science 0.158,7 %52,6 %29,0 %64,6 %
AutomationBench, processus métier40,0 %31,4 %26,9 %41,4 %

Le tableau n’est pas uniforme pour autant. GPT-6 Astra garde l’avantage en recherche scientifique agentique, avec 64,6 % contre 58,7 %, et reste légèrement devant en automatisation de processus métier. Anthropic reconnaît d’ailleurs qu’à ce niveau, les écarts de benchmark deviennent un guide moins fiable des différences réelles.

Des prix en baisse de 20 à 60 % selon le poste

C’est sur ce terrain qu’Opus 5.5 marque le plus nettement. Les jetons d’entrée et de sortie passent à 4 et 20 dollars par million, soit environ 3,49 et 17,45 euros, en baisse de 20 %. La lecture de cache, qui représente l’essentiel du coût des tâches agentiques et de programmation, tombe à 0,20 dollar par million, 60 % de moins qu’Opus 5.

Prix par million de jetonsOpus 5.5Opus 5
Jetons d’entrée4 $5 $
Jetons de sortie20 $25 $
Lecture de cache0,20 $0,50 $
Écriture de cache5 $6,25 $

Le modèle consomme en outre moins de jetons par tâche et produit sa réponse plus de 30 % plus vite. Anthropic chiffre l’économie totale à 40 % sur des usages types. Un mode rapide, jusqu’à 2,5 fois plus véloce, est proposé dans Claude Code et sur la plateforme Claude, à 8 et 40 dollars par million de jetons.

Côté abonnements, les limites d’utilisation sur cinq heures augmentent sur les formules Pro, Max, Team et Enterprise facturées au siège.

Des garde-fous alignés sur ceux de Fable 5.1

Anthropic présente Opus 5.5 comme son modèle le mieux noté à ce jour sur son audit comportemental automatisé, une batterie de milliers de scénarios simulés. Il serait bien moins enclin que ses prédécesseurs à engager des actions difficiles à annuler, et plus résistant qu’Opus 5 aux injections de prompt.

Jugé comparable à Claude Mythos 5.1 en biologie et en cybersécurité, il hérite des protections de Fable 5.1. La plupart des tâches de cybersécurité sont redirigées vers Opus 4.8, et l’accès complet en biologie passe par un programme de vérification réservé aux organisations sélectionnées.

Deux changements concernent directement les développeurs européens. Le modèle intègre un filigrane destiné à la conformité avec l’AI Act, et il n’est plus proposé avec le mode de réflexion désactivé.

Claude Opus 5.5 est disponible dès maintenant sur la plateforme Claude, Amazon Web Services, Google Cloud et Microsoft Azure, sous l’identifiant claude-opus-5-5.

Quand les meilleurs modèles ne se départagent plus qu’à quelques points, c’est le coût par tâche accomplie qui décide d’un déploiement. C’est précisément le terrain qu’a choisi Opus 5.5, et celui où il creuse le plus l’écart, y compris face à GPT-6 Astra, qu’il devance sur FrontierCode pour environ un cinquième du coût par tâche.

Source et visuel : Anthropic

Wael.K

Ravi de vous accueillir sur ma page dédiée aux articles ! Je suis Wael El Kadri, et je suis un ingénieur civil de profession. Mais ma véritable passion est le matériel informatique. J'en suis passionné depuis l'âge de 12 ans, et j'aime apprendre et découvrir de nouvelles choses. En 2016, j'ai créé ma page personnelle sur les réseaux sociaux, baptisée Pause Hardware. C'est là que je partage mes créations en modding, mais aussi divers sujets liés au matériel informatique en général. J'ai également crée le site web, pausehardware.com, en 2019 où je publie des articles plus approfondis sur le matériel à travers des tests et revues et articles de news. J'ai eu l'opportunité de participer en tant qu'exposant à plusieurs événements liés aux jeux vidéo, aux côtés de grandes marques, notamment lors de la Paris Game Week en 2018 et 2019. Je reste constamment en quête de nouvelles manières de partager mes connaissances et ma passion pour le matériel informatique avec d'autres passionnés. Voici quelques publications médiatiques qui ont mis en lumière mon travail : Deux articles dans le magazine Extreme PC, parus dans ses  numéros 1 et 21 : Extreme PC Magazine Issue 21 (adobe.com) Également, un article sur Forbes intitulé "Dix Modèles de PC Incroyables en 2021" sur forbes.com : Ten Incredible PC Mods Of 2021 (forbes.com)
guest
0 Commentaires
Le plus ancien
Le plus récent Le plus populaire
0
Nous aimerions avoir votre avis, veuillez laisser un commentaire.x