Retour

News · Logiciel

GPT-6 Astra « devenu plus bête » : ce que montrent les tests, ce qu’OpenAI a corrigé

Le 12 septembre 2026, OpenAI a admis que GPT-6 Astra « faisait moins bien » pour une partie des utilisateurs. Des comparaisons à prompt identique étaient déjà publiques. Voici les plaintes, les tests, et les trois défauts réellement corrigés.

Par 13 septembre 202612 min de lecture1 vue
GPT-6 Astra « devenu plus bête » : ce que montrent les tests, ce qu’OpenAI a corrigé

OpenAI a lancé GPT-6 Astra le 3 septembre 2026. Une semaine plus tard, le même modèle était accusé d’avoir été discrètement affaibli. Des utilisateurs ont renvoyé le même prompt, avec les mêmes réglages, et ont obtenu un résultat visiblement plus pauvre. Le 12 septembre, Tibo Sottiaux, qui travaille sur Codex et ChatGPT chez OpenAI, a répondu : ce n’était pas une impression collective. Trois défauts de qualité ont été identifiés et corrigés. Un reset d’usage a suivi dans la nuit du 12 au 13.

État des informations au 13 septembre 2026. Les messages publics ci-dessous ont été lus sur X via leur identifiant de statut. Ils authentifient l’existence des plaintes, pas la rigueur de chaque test. Nous n’avons pas rejoué nous-mêmes ces prompts. OpenAI n’a pas publié de note technique détaillée : sa réponse tient dans le message de Sottiaux (ouvre x.com dans un nouvel onglet). Notre premier décryptage d’Astra portait sur le lancement, les tarifs et les limites ; celui-ci porte sur la semaine où le modèle a « mal tourné » aux yeux d’une partie de ses utilisateurs.

Couverture : illustration originale réalisée avec OpenAI ImageGen pour YATOFIX. Deux épreuves de la même planche, l’une nette, l’autre brouillée, représentent un écart de qualité — pas un visuel officiel d’OpenAI.

Ce qui s’est passé, jour par jour

Le 3 septembre, Astra arrive avec un déploiement chaotique : beaucoup d’abonnés payants n’y avaient pas encore accès. Sam Altman a présenté le lancement comme « messy » (ouvre theverge.com dans un nouvel onglet). Dans les jours suivants, les démonstrations spectaculaires — scènes 3D, jeux, usage d’ordinateur — ont occupé le devant de la scène.

Le basculement est plus tardif. Le 8 septembre, Armin Ronacher, auteur de Flask, écrit qu’Astra l’impressionne, mais qu’il est déjà revenu à GPT-5.6 Sol pour l’ingénierie logicielle (ouvre x.com dans un nouvel onglet). Le 10 septembre, le compte synthwavedd, très lu dans ce milieu, parle d’une « Post-Launch Lobotomy » (ouvre x.com dans un nouvel onglet). Le 11 septembre, les comparaisons à prompt identique se multiplient. Le 12 septembre au matin (heure de Paris : 05:20), OpenAI publie le correctif.

DateCe qui est établiCe qui reste une lecture
3 septembreLancement public d’Astra
8 septembreRonacher dit revenir à Sol pour le codeRégression de modèle, ou simple inadaptation au flux de travail
10–11 septembreVague de messages « plus bête qu’au lancement »Nerf volontaire des poids, ou défaut de service
11 septembreComparaisons à prompt et réglages identiquesChaque test n’a qu’un auteur, un environnement, un essai
12 septembreOpenAI nomme trois bugs et annonce un resetLa part exacte du trafic touché n’est pas un audit public

Cette chronologie mélange deux phénomènes. Certains n’ont jamais préféré Astra pour le code quotidien. D’autres disent qu’Astra du 11 septembre était moins bon qu’Astra du lancement, à brief égal. Seul le second point est celui qu’OpenAI a traité comme un incident de qualité.

Les plaintes : plus rapide, plus superficiel, moins fiable

Le message qui a donné le ton est celui de synthwavedd, le 10 septembre (ouvre x.com dans un nouvel onglet) : Astra ferait des erreurs « alarmantes de simplicité » sur une recherche que le modèle du premier jour n’aurait pas commises. Le surnom de « lobotomie post-lancement » a circulé parce qu’il collait à un réflexe déjà vu : un modèle impressionne à J+0, puis semble s’émousser.

Retranscription du message public de synthwavedd sur X, 10 septembre 2026.

Retranscription du message public (ouvre x.com dans un nouvel onglet) de leo (@synthwavedd), 10 septembre 2026, 19:46 heure de Paris. 2 059 j’aime au moment de notre lecture. Ce n’est pas une capture officielle de l’interface X.

Le même jour et le lendemain, le vocabulaire se durcit. Pankaj Kumar affirme qu’OpenAI a « nerfé » Astra (ouvre x.com dans un nouvel onglet) : Extra High irait 30 à 40 % plus vite, avec une qualité en baisse, ce qui lui fait penser que la quantité de calcul allouée — le « juice » — a été réduite. Il rappelle que GPT-5.6 Sol avait déjà subi le même soupçon en juillet, et que les nouvelles souscriptions Pro à 200 $ avaient été suspendues dans le climat de saturation du lancement — un point rapporté par plusieurs médias, distinct du correctif du 12 septembre.

Retranscription du message de Pankaj Kumar, avec la capture jointe par l’auteur.

Retranscription du message (ouvre x.com dans un nouvel onglet) de Pankaj Kumar, 11 septembre 2026. L’image jointe est celle publiée par l’auteur sur X, pas une reconstruction.

Chez les développeurs qui paient le modèle au volume, le jugement est plus sec. Dax Raad, qui construit l’outil Opencode, écrit qu’une partie de son équipe est revenue à Sol (ouvre x.com dans un nouvel onglet) : Astra fait des choses nouvelles, mais les inconvénients et une dépense effective « doublée » ne justifient pas la bascule. Pranjal Paliwal, qui avait d’abord salué le modèle, revient sur son code (ouvre x.com dans un nouvel onglet) : « We don’t have AGI. We have a regression. »

Ces messages ne mesurent pas la même chose. « Plus rapide » peut vouloir dire moins de raisonnement interne. « Plus cher » peut vouloir dire plus de tokens, plus d’outils, ou plus de reprises. « Plus bête » peut vouloir dire une vraie perte de capacité, ou un assistant qui n’achève plus le travail. D’où l’intérêt des essais où le prompt ne change pas.

Le test qui a fait basculer le débat : le même prompt, avant et après

Le 11 septembre, Salio publie une vidéo « GPT-6 Astra (Launch) vs GPT-6 Astra (Today) » (ouvre x.com dans un nouvel onglet). Même prompt, résultat « nettement pire », et la conclusion : « It genuinely feels like OpenAI nerfed Astra ». Le message a dépassé 780 000 vues. Md Ismail Sojal le reprend le jour même : Today’s GPT-6 Astra output looks worse (ouvre x.com dans un nouvel onglet), en insistant sur l’identité du prompt et des réglages.

Vidéo publiée par Salio (@Mr_Salio) (ouvre x.com dans un nouvel onglet) le 11 septembre 2026, 42 secondes. C’est le document original, pas une reconstruction. Un essai unique, même à prompt identique, ne constitue pas un protocole scientifique.

Retranscription du message de Salio présentant la comparaison.

Retranscription du message (ouvre x.com dans un nouvel onglet) du 11 septembre 2026. 4 891 j’aime au moment de notre lecture.

Le forum officiel Codex raconte la même histoire avec un chiffre de durée. Un utilisateur, whereareiam, écrit le 12 septembre avoir relancé la même tâche SVG, sur GPT-6 Astra High, dans le même environnement. Cinq jours plus tôt, Astra avait passé 2 min 52 s et produit un vrai dessin vectoriel. Le jour du message, la réponse tombe en 36 secondes, visiblement plus pauvre ; Sol, dit-il, faisait mieux que cet Astra-là. Le fil « Astra – A noticeable drop in quality compared to how it was at launch » (ouvre community.openai.com dans un nouvel onglet) avait été ouvert la veille par karolplu : au lancement, des itérations précises du premier coup ; ensuite, le même niveau que Sol, avec des consignes simples à répéter.

Cinq jours plus tôt, selon l’auteur : SVG reconstruit en vrai vecteur.
Cinq jours plus tôt, selon l’auteur : SVG reconstruit en vrai vecteur.
Le 12 septembre, même prompt, même effort High : résultat jugé nettement inférieur, en 36 secondes.
Le 12 septembre, même prompt, même effort High : résultat jugé nettement inférieur, en 36 secondes.

Images publiées le 12 septembre 2026 par whereareiam sur le forum développeurs OpenAI (ouvre community.openai.com dans un nouvel onglet). Nous n’avons pas le fichier source du prompt, seulement ces deux sorties et le temps d’exécution annoncé.

Ce couple durée / qualité est le plus gênant pour la thèse du « simple mauvais jour ». Un modèle qui rend en 36 secondes ce qu’il traitait en près de trois minutes n’a pas seulement « moins d’inspiration ». Il a, au minimum, moins travaillé. Cela peut venir d’un effort de raisonnement raccourci, d’un moteur mal configuré, ou d’un outil qui coupe la vérification. Les trois explications ne sont pas équivalentes. Seule la deuxième a été nommée par OpenAI comme un défaut mesuré sur une « longue traîne » de trafic.

Tout le monde n’y a pas vu un nerf

Le compte Antikythera objecte dès le 11 septembre : Astra n’est pas devenu stupide après coup (ouvre x.com dans un nouvel onglet). Il l’était déjà au lancement, paresseux, addict aux puces, trop littéral, enclin à trop concevoir. L’enthousiasme de la première semaine aurait masqué ces défauts ; un bon AGENTS.md les atténue. Mustafa Sahinli, lui, compare plutôt à Claude Opus 4.6 « après une semaine » (ouvre x.com dans un nouvel onglet) : le cycle post-lancement, pas forcément un sabotage.

Ces lectures ne s’annulent pas. Un modèle peut être inégal dès J+0 et encore dégradé par un incident de service. Ronacher, le 8 septembre, se plaçait déjà dans le premier cas : Astra lui paraît extraordinaire et, en même temps, une vraie régression pour son quotidien de code (ouvre x.com dans un nouvel onglet).

Retranscription du message d’Armin Ronacher, 8 septembre 2026.

Retranscription du message (ouvre x.com dans un nouvel onglet) d’Armin Ronacher (@mitsuhiko). Publié deux jours avant la vague « lobotomie », il décrit un problème de fond, pas seulement un bug du 11 septembre.

Ce qu’OpenAI a réellement corrigé

Le 12 septembre à 05:20, heure de Paris, Sottiaux s’adresse aux utilisateurs d’Astra. Le message dit avoir travaillé avec une partie d’entre eux, puis liste trois causes. Ce n’est pas « nous n’avons pas changé les poids ». Ce n’est pas non plus « vous imaginiez ». C’est un entre-deux plus précis.

Retranscription du message de Tibo Sottiaux annonçant le correctif.

Retranscription du message officiel (ouvre x.com dans un nouvel onglet) de Tibo (@thsottiaux), 12 septembre 2026. Environ 6,1 millions de vues au moment de notre lecture. 27 737 j’aime.

Les trois points, dans l’ordre du message :

  1. Des skills écrites pour les modèles précédents se déclenchaient trop souvent, ou empêchaient Astra de vérifier son propre travail. Une skill est un paquet d’instructions et d’outils que l’assistant charge pour une tâche. Si une recette conçue pour GPT-5.x coupe l’autocritique d’Astra, le modèle peut paraître plus bête sans que ses poids aient changé.
  2. Une expérience optionnelle de gestion du contexte provoquait des arrêts trop tôt, ou des réponses à d’anciens messages. OpenAI l’a désactivée. Estimation interne : 4 000 à 5 000 utilisateurs concernés. Ce n’est pas « tout le monde ». C’est assez pour pourrir un fil long, surtout dans Codex.
  3. Des moteurs mal configurés dégradaient, de façon mesurée, la qualité d’une longue traîne de requêtes. Ces moteurs ont été retirés.

Sottiaux ajoute des « améliorations mineures » : un meilleur suivi du dernier message, un suivi plus régulier du travail en cours, davantage de vérifications. Les exemples publics, écrit-il, ont servi à corriger vite. Un reset d’usage était prévu avant minuit le 12 septembre, donc dans la nuit du 12 au 13 en France.

Info

OpenAI n’a pas dit avoir « nerfé » Astra. Elle a dit avoir trouvé des skills trop agressives, une expérience de contexte nocive pour quelques milliers de comptes, et des moteurs mal réglés sur une fraction du trafic. Un nerf des poids — remplacer le modèle par une version plus petite ou plus quantifiée — n’est pas documenté dans ce message. L’absence de cette phrase n’interdit pas qu’un autre changement existe ; elle interdit de le présenter comme un fait.

Le parallèle avec Sol, en juillet, reste utile comme précédent de perception, pas comme preuve d’un mode opératoire identique. À l’époque déjà, Sottiaux avait nié un affaiblissement délibéré tout en reconnaissant des expériences sur l’effort de raisonnement. Ici, les mots sont plus concrets : skills, expérience opt-in, moteurs retirés.

Ce que cela change, concrètement, pour un utilisateur

Si votre session coupait trop tôt, répondait à un ancien message, ou livrait un travail non relu, le diagnostic officiel colle. Si Astra vous coûtait deux fois plus cher qu’un Sol qui finissait mieux le code, le diagnostic officiel ne règle pas le fond : le modèle peut rester un mauvais choix économique. Si Extra High vous semble trop vite fini, le « juice » n’a pas été tranché. Sottiaux n’aborde pas, dans ce message, les plaintes sur xHigh qui consommerait moins que Medium.

Le geste utile, après le reset de la nuit du 12 au 13, est banal et vérifiable : reprendre une tâche déjà faite la semaine précédente, mêmes fichiers, même effort, et comparer le livrable. Un SVG, un correctif C++, une recherche avec sources. Pas « fais-moi quelque chose d’impressionnant ». Les démonstrations 3D du lancement n’invalident pas un échec de production, et inversement.

Nous n’avons pas, au matin du 13 septembre, de campagne publique qui rejoue les prompts de Salio ou du forum après le correctif. Dire que « c’est réparé pour tout le monde » serait aussi spéculatif que dire que « le modèle a été castré ».

Sources

  1. Tibo Sottiaux — correctif qualité Astra et reset (ouvre x.com dans un nouvel onglet), 12 septembre 2026.
  2. synthwavedd — « Post-Launch Lobotomy » (ouvre x.com dans un nouvel onglet), 10 septembre 2026.
  3. Salio — vidéo launch vs today, même prompt (ouvre x.com dans un nouvel onglet), 11 septembre 2026.
  4. Md Ismail Sojal — reprise du test à prompt identique (ouvre x.com dans un nouvel onglet), 11 septembre 2026.
  5. Pankaj Kumar — accusation de nerf et de « juice » réduit (ouvre x.com dans un nouvel onglet), 11 septembre 2026.
  6. Armin Ronacher — retour à GPT-5.6 Sol pour le code (ouvre x.com dans un nouvel onglet), 8 septembre 2026.
  7. Dax Raad — une partie d’Opencode revient à Sol (ouvre x.com dans un nouvel onglet), 11 septembre 2026.
  8. Pranjal Paliwal — « we have a regression » (ouvre x.com dans un nouvel onglet), 11 septembre 2026.
  9. Antikythera — contre-lecture : inégal dès le lancement (ouvre x.com dans un nouvel onglet), 11 septembre 2026.
  10. Forum OpenAI — baisse de qualité et test SVG 2 min 52 s contre 36 s (ouvre community.openai.com dans un nouvel onglet), 11–12 septembre 2026.
  11. Decrypt — synthèse des plaintes avant le correctif (ouvre decrypt.co dans un nouvel onglet), 12 septembre 2026.
  12. The Verge — Altman et le lancement « messy » (ouvre theverge.com dans un nouvel onglet), 4 septembre 2026.
  13. YATOFIX — GPT-6 Astra, sortie, prix et limites, 5 septembre 2026.

Laisser un avis

Ta note :

Anti-robots : recopie le code

Avis des lecteurs

Pas encore de note. La première est pour toi.

Aucun avis publié pour le moment.

À lire aussi