Retour
Menu des articles44

News · Logiciel

Claude Opus 5.5 écrase GPT-6 Astra et Codex, à une condition

Opus 5.5 fait 58 sur l’Intelligence Index d’Artificial Analysis, Astra 53, Sol 48. En agent de code : 66,0 contre 61,6 et 56,7. En tokens, c’est l’effort qui décide : au maximum Opus est le plus gourmand, en « high » il bat Astra au maximum en score, en coût et en tokens.

Par 27 septembre 20269 min de lecture1 vue
Claude Opus 5.5 écrase GPT-6 Astra et Codex, à une condition

Cinq jours après sa sortie, Claude Opus 5.5 est le modèle le plus intelligent jamais mesuré par Artificial Analysis : 58 points sur son Intelligence Index, contre 53 pour GPT-6 Astra. Sur le banc d’agents de code du même laboratoire, Claude Code avec Opus 5.5 fait 66,0, Codex avec Astra 61,6, Codex avec GPT-6 Sol 56,7. Sur le terrain de l’intelligence, OpenAI n’a pas de réponse cette semaine.

Sur celui des tokens, le tableau est plus subtil. Poussé à l’effort maximal, Opus 5.5 est un gouffre : 4,4 fois plus de tokens de sortie qu’Astra par tâche. Mais un cran en dessous, à l’effort « high », il bat Astra poussé au maximum sur les trois tableaux à la fois : score, coût et tokens. C’est là que le « Opus écrase Astra » devient vrai. Pas partout, pas à n’importe quel réglage.

Info

Contrôle du 27 septembre 2026. Constructeur : annonce Anthropic (ouvre anthropic.com dans un nouvel onglet) et documentation (ouvre platform.claude.com dans un nouvel onglet), 22 septembre. Mesures indépendantes : Artificial Analysis (ouvre artificialanalysis.ai dans un nouvel onglet), pages modèles et Coding Agent Index (ouvre artificialanalysis.ai dans un nouvel onglet), chiffres relus dans les données publiées le 27. OpenAI : GPT-6 Sol et Luna (ouvre openai.com dans un nouvel onglet). Les benchmarks d’Anthropic sont des chiffres constructeur ; ceux d’Artificial Analysis sont mesurés par un tiers.

Ce qu’Anthropic a sorti le 22 septembre

Opus 5.5 est disponible depuis le 22 septembre sur l’API Claude, AWS, Google Cloud et Azure, et dans les abonnements Claude. Le prix baisse : 4 $ le million de tokens en entrée, 20 $ en sortie, contre 5 $ et 25 $ pour Opus 5. La lecture de cache passe de 0,50 $ à 0,20 $. Contexte d’un million de tokens, 128 000 en sortie.

Côté abonnés, Anthropic annonce une hausse des limites sur cinq heures pour Pro, Max, Team et Enterprise, et un reset de quota offert. Mixed News chiffre la hausse à 20 % et situe la fin du reset au 22 octobre ; Anthropic ne publie pas le pourcentage sur sa page.

Le même jour, OpenAI sortait GPT-6 Sol et Luna, et baissait de moitié leur prix API. Sol, désormais modèle par défaut de Codex, coûte 2 $ et 10 $ le million. Astra, sorti le 3 septembre, reste à 10 $ et 50 $.

L’intelligence : Opus devant presque partout

Le tableau publié par Anthropic, avec les chiffres d’OpenAI tels que rapportés par OpenAI :

BancOpus 5.5GPT-6 AstraGPT-5.6 Sol
Terminal-Bench 4.066,4 %57,9 %37,3 %
FrontierCode v1.154,4 %53,3 %47,5 %
CursorBench 4.057,8 %—41,7 %
GDPval-AA v2.1 (Elo)1 8461 5421 588
Humanity’s Last Exam67,7 %57,2 %—
AutomationBench40,0 %41,4 %28,8 %
Terminal-Bench-Science58,7 %64,6 %22,4 %

Deux réserves. Opus 5.5 est mesuré à l’effort maximal (xhigh sur Terminal-Bench), Astra à l’effort « high ». Et l’écart sur FrontierCode, 1,1 point, est dans le bruit. Astra garde deux bancs : l’automatisation et la science en terminal.

Artificial Analysis confirme la hiérarchie avec ses propres mesures. Opus 5.5 au maximum : 58, premier sur 211 modèles, « the highest score we have measured by several points ». Astra au maximum : 53. Sol au maximum : 48.

Graphiques Artificial Analysis : Intelligence Index v4.3, Opus 5.5 à 58 devant Fable 5.1 et GPT-6 Astra à 53 ; en bas, intelligence en fonction du coût par tâche.

Crédit : Artificial Analysis (ouvre artificialanalysis.ai dans un nouvel onglet), 22 septembre 2026. Graphique redimensionné, non modifié.

Les tokens : le vrai match

C’est ici que les impressions de forum et les chiffres se séparent. Les pages modèles d’Artificial Analysis donnent, pour tout l’Intelligence Index :

Modèle et effortScoreCoût par tâcheTokens générés
Opus 5.5, max585,98 $260 M
Opus 5.5, high541,82 $53 M
Opus 5.5, medium511,34 $38 M
GPT-6 Astra, max533,26 $60 M
GPT-6 Sol, max481,06 $77 M

Lu ligne par ligne :

  • Au maximum, Opus 5.5 est le plus bavard du lot. Environ 119 000 tokens de sortie par tâche, contre 27 000 pour Astra. Artificial Analysis note aussi qu’il en produit 1,6 fois plus qu’Opus 5 au même réglage. Son coût par tâche ne tient que grâce à la baisse de prix.
  • À « high », il écrase Astra au maximum. 54 contre 53 en score, 1,82 $ contre 3,26 $ par tâche, 53 millions de tokens contre 60. Plus intelligent, 44 % moins cher, et plus sobre. C’est le chiffre qui justifie le titre.
  • À « medium », le réglage par défaut, il reste devant Sol au maximum (51 contre 48) pour 38 millions de tokens au lieu de 77. Anthropic affirme de son côté qu’au réglage par défaut, Opus 5.5 bat Astra au maximum sur GDPval-AA pour environ un cinquième du coût par tâche. C’est un chiffre constructeur.

En agent de code : meilleur, mais pas sobre

Le Coding Agent Index v1.5 d’Artificial Analysis fait tourner les agents eux-mêmes, Claude Code contre Codex, sur des tâches de développement longues. Chiffres relus dans les données de la page le 27 septembre :

AgentScoreCoût par tâcheTokens de sortie par tâcheÉtapes
Claude Code, Opus 5.5 max66,013,04 $333 k155
Codex, GPT-6 Astra max61,67,47 $47 k39
Codex, GPT-6 Sol max56,72,99 $62 k86

Opus 5.5 est le meilleur agent de code mesuré, avec plus de quatre points d’avance sur Astra et neuf sur Sol. Mais il y arrive en 155 étapes, contre 39 pour Astra, et en produisant environ sept fois plus de tokens. Il coûte 1,75 fois plus par tâche. En agent, au réglage maximal, la victoire d’Opus est une victoire d’endurance, pas d’économie.

Face au modèle par défaut de Codex, Sol, l’écart d’intelligence est net partout : +10 points sur l’Intelligence Index au maximum, +9 points en agent de code. Face à Astra, tout dépend du réglage.

Ce qu’en disent les utilisateurs

Sur Hacker News, dans le fil de lancement, les deux camps se répondent. cbg0 : « I have a subscription to both and Astra burns usage like crazy ». notatoad : « Astra burned through 70% of my weekly usage in ~5hrs on a $100 plan ». drcongo décrit Opus 5.5 comme « basically perfect - right first time every time ».

En face, drbscl rappelle qu’Opus 5.5 est « even more verbose » d’après Artificial Analysis. margorczynski défend Astra : « Astra will usually do that using less token and offer a better quality solution ». jasbury, converti : « I finally decided to try Astra. It handled all of my prompts in one go. » Et Someone1234 résume le débat de réglage : le medium d’Opus 5.5 « actually can make sense », mais le coût du max est « completely unhinged ».

Ces avis sont cohérents avec les mesures. Astra consomme beaucoup de quota parce que son token coûte cher (50 $ le million en sortie). Opus 5.5 consomme beaucoup parce qu’il écrit beaucoup, surtout au maximum. Ce ne sont pas les mêmes défauts, et ils ne se corrigent pas avec le même bouton.

Attention

Opus 5.5 a cinq jours. Aucune mesure indépendante ne compare encore la consommation réelle d’un forfait Claude Max à celle d’un ChatGPT Pro sur le même travail : il n’y a que des témoignages. Les chiffres Anthropic sont des chiffres constructeur, avec des réglages d’effort différents pour Opus et Astra. Et l’histoire récente invite à la prudence : les modèles bougent après leur lancement (on a enquêté sur ce cycle). Le tracker communautaire livenerf suit Opus 5.5 depuis le 22 septembre ; premier verdict attendu vers le 24 octobre.

Verdict

En intelligence brute, Opus 5.5 est devant tout le monde, Astra compris, et de loin devant Sol, le modèle par défaut de Codex. En consommation, il n’écrase Astra qu’à une condition : ne pas le pousser au maximum. À l’effort « high », il est plus intelligent, moins cher et plus sobre qu’Astra au maximum. Au maximum, il reste le plus fort, mais aussi le plus gourmand du marché.

Pour un abonné, la conclusion pratique est simple : le réglage compte autant que le modèle. Opus 5.5 en « high » ou « medium » est aujourd’hui le meilleur rapport intelligence / quota mesuré. En « max », c’est une Formule 1 : imbattable, et elle boit en conséquence.

Sources

Laisser un avis

Ta note :

Anti-robots : recopie le code

Avis des lecteurs

Pas encore de note. La première est pour toi.

Aucun avis publié pour le moment.

À lire aussi