Les représentants d’OpenAI affirment que le lancement récent de l’un de ses derniers modèles, le GPT-6 Astra, marque le début du intelligence artificielle générale (AGI) – un scénario hypothétique dans lequel intelligence artificielle (L’IA) peut apprendre et raisonner comme les humains. Suite aux affirmations très récentes de responsables technologiques selon lesquelles nous avons désormais atteint cette étape, quelle est la probabilité que cette affirmation résiste à un examen minutieux ?
Au milieu des révélations selon lesquelles des problèmes de sécurité ont a forcé l’entreprise à abandonner le déploiement prévu de GPT-6.1 Astrades chercheurs indépendants et des créateurs de référence préviennent que les scores records de GPT-6 Astra reposent sur une optimisation rapide et poussée plutôt que sur une véritable intelligence générale. Cela vient comme les experts mettent en garde contre les risques des futurs systèmes d’IA et Les dirigeants de l’IA appellent ensemble à un ralentissement de la recherche sur l’IA.
En annonçant la sortie du modèle, le président d’OpenAI, Greg Brockman, a suggéré qu’Astra marquait un tournant fondamental dans l’évolution de l’IA. « Si nous avançons rapidement de quelques années et que nous regardons en arrière et disons quand réellement AGI a été créée, je pense que ce sera à peu près à cette époque, et je pense qu’il pourrait s’agir de ce modèle », a déclaré Brockman lors d’une conférence de presse le 3 septembre marquant le lancement.
Comment le nouveau modèle s’est-il comporté en matière d’analyse comparative ?
Dans le cadre du processus de test et de vérification du nouveau modèle, OpenAI a publié des résultats de référence sur une série de tests mesurant les capacités des modèles d’IA pour diverses tâches. Les représentants d’OpenAI ont affirmé dans un déclaration que le nouveau modèle de l’entreprise offre des performances « de pointe » dans une variété de domaines, notamment le génie logiciel, l’utilisation autonome de programmes informatiques, les problèmes mathématiques et même la recherche scientifique.
Des démonstrations, par exemple, ont mis en évidence la capacité d’Astra à générer du code CAO 3D ; disposer des circuits imprimés dans un logiciel de CAO (conception assistée par ordinateur); convertir des modèles numériques 3D en environnements interactifs de type jeu vidéo ; et déployez des applications Web hébergées directement à partir des invites.
« Lors de nos premiers tests, Astra s’est démarqué en abordant le travail juridique de la même manière qu’un avocat averti : il distingue les documents des dossiers établis, fait apparaître des hypothèses non étayées et convertit les lacunes en positions de rédaction concrètes », a déclaré Niko Grupenresponsable de la recherche appliquée chez Harvey, développeur d’IA des services juridiques, dans le cadre de l’annonce d’OpenAI.
Sur ARC-AGI-3 – une référence conçue pour mesurer l’efficacité avec laquelle les systèmes d’IA acquièrent de nouvelles compétences dans des environnements nouveaux et abstraits – Astra a obtenu un score global de 99,9 %. Des tests indépendants effectués par la Fondation à but non lucratif ARC Prize, qui supervise l’évaluation, ont révélé qu’Astra a dépassé les références « d’efficacité de l’action humaine » sur 96 % des niveaux, effectuant en moyenne 51,7 % d’actions en moins par niveau que les solveurs humains.
« Non seulement c’est le meilleur modèle que nous ayons jamais testé », a déclaré le président de la Fondation Prix ARC. Greg Kamradt a déclaré dans le cadre de l’annonce d’OpenAI, « mais cela représente également un changement significatif dans les performances du modèle frontière – non seulement dans sa capacité à naviguer et à résoudre de nouveaux environnements, mais également dans l’efficacité avec laquelle il apprend à le faire. »
Dans quelle mesure pouvons-nous lire les résultats des tests ?
De nombreux chercheurs ont souligné que les meilleures performances ARC-AGI-3 d’Astra reposaient sur un harnais propriétaire « Provider Adapter », une couche d’échafaudage logiciel spécialisée inaccessible aux développeurs concurrents. Lorsqu’il a été testé avec le harnais Standard neutre de l’indice de référence, ce score est tombé à 62,7 %. Les organisateurs du Prix ARC ont également souligné que le fait de saturer le benchmark ne constitue pas une preuve de l’atteinte de l’AGI, soulignant que ses environnements de puzzle fermés et déterministes ne capturent pas la complexité ouverte du monde réel.
« Lorsque nous avons lancé ARC-AGI-3, « nous avons clairement indiqué que saturer le benchmark ne représenterait pas une ‘preuve de la réalisation de l’AGI' », a écrit Kamradt dans un communiqué. article de blog. « Par conséquent, même si nous pensons qu’Astra représente un progrès significatif vers la généralisation, nous ne prétendons pas qu’il s’agit d’AGI. »
Des divergences dans les données auraient été présentes avant même l’annonce officielle. Comme le rapporte Fortuneun projet sous embargo fourni aux agences de presse avant le lancement du modèle indiquait le score ARC-AGI-3 d’Astra à 98,6 % avant de passer à 99,9 % sur le site en direct.
Anka Réuel et Mike Hardydoctorants en IA à l’Université de Stanford, ont également fait part de leurs inquiétudes quant à la révision discrète par OpenAI de plusieurs mesures publiées après le lancement, notamment la réduction de moitié du taux d’hallucinations signalé par Astra de 4,2 % à 2,0 % avant de l’annuler.
Lorsque nous avons lancé ARC-AGI-3, « nous avons clairement indiqué que saturer le benchmark ne constituerait pas une « preuve de l’atteinte de l’AGI » »
Greg Kamradt, président de la Fondation Prix ARC
S’adressant à Fortune, Reuel et Hardy ont attribué ces changements de chiffres au « benchmaxxing » – un terme industriel qui décrit la pratique consistant à réexécuter des évaluations à plusieurs reprises sous des invites, des échafaudages ou des allocations de calcul subtilement modifiées pour rechercher des scores théoriques maximaux.
Dans un article de 2025 publié sur le serveur de pré-impression arXiv intitulé « L’analyse comparative est défaillante : ne laissez pas l’IA être son propre juge »experts dont un doctorant de Princeton Zerui Cheng et chercheur postdoctoral à l’Université du Luxembourg Dr Stella Wohnig a averti que de telles pratiques créent de la confusion et sapent la confiance, en particulier lorsque la documentation technique officielle omet la méthodologie de base, rendant ainsi une vérification indépendante presque impossible. Il est crucial que les scores obtenus grâce au benchmaxxing reflètent des plafonds de performances idéalisés dans des conditions de laboratoire optimales plutôt qu’une fiabilité pratique et prête à l’emploi.
Selon les données de référence d’OpenAI, lors d’évaluations de domaines spécialisés, GPT-6 Astra a fourni des performances 10 à 20 % supérieures à celles de son prédécesseur, GPT-5.6 Sol, et de ses principaux concurrents du marché.
Les points forts incluent un score de 98 % sur FrontierMath Tier 4 (v2), qui évalue le raisonnement mathématique de niveau expert ; un parfait 100 % sur ExploitBench, conçu pour tester les capacités offensives de cybersécurité ; 95,9 % sur BenchCAD, qui mesure la capacité d’une IA à reconstruire des objets 3D à l’aide de code CAO ; 57,9 % sur Terminal-Bench 4.0, qui évalue l’administration de systèmes complexes basés sur des terminaux et l’ingénierie logicielle ; et 41,4 % sur AutomationBench, qui teste si les agents peuvent effectuer des flux de travail métier en plusieurs étapes entre les applications.
Mais les conclusions indépendantes d’une société externe d’analyse comparative de l’IA Analyse artificielle contredire ces résultats. Le score d’Astra sur l’indice indépendant d’intelligence d’analyse artificielle – une mesure globale qui évalue le raisonnement général à travers les modèles frontières – est resté complètement stable, à 61, par rapport à GPT-5.6 Sol, tout en étant à la traîne de concurrents comme Claude Fable 5.1 d’Anthropic et Muse Spark 1.3 de Meta.
Même si certains résultats de référence ont connu une amélioration par rapport à la génération précédente, l’Astra a sous-performé dans d’autres tests. Les tests d’Analyse artificielle ont montré que par rapport à GDPval-AA v2 – une référence économique qui mesure les tâches réelles sur le lieu de travail dans 44 professions – Astra a subi une baisse significative de son classement relatif par rapport à GPT-5.6 Sol. Des régressions supplémentaires ont été observées dans les tests de référence qui testent le support du service client, la programmation scientifique Python et le raisonnement en contexte long sur des documents volumineux.
En termes d’utilisation globale des jetons – le système de mesure qui mesure les fragments de texte ou de données traités par les modèles d’IA – les représentants d’OpenAI ont déclaré que GPT-6 Astra avait réalisé des gains d’efficacité spectaculaires sur des tâches complexes à long terme. Les résultats de l’analyse artificielle ont confirmé que, selon les critères d’ingénierie logicielle, Astra était environ 70 % plus efficace en termes de jetons que GPT-5.6 Sol, utilisant environ un tiers du total de jetons de son prédécesseur et un cinquième des jetons de Claude Opus 5.

Lors d’évaluations professionnelles telles que Agents’ Last Exam, le nouveau modèle a réduit la consommation de jetons de sortie jusqu’à 65 % par rapport à l’Opus 5, tandis que lors d’évaluations d’intelligence générale, Astra a obtenu une réduction d’environ 10 % de jetons de sortie à effort maximum par rapport à Sol.
D’autre part, cette réalisation est compensée par une augmentation de 250 % du prix de base de l’API pour GPT-6 Astra par rapport à GPT-5.6 Sol. Les prix des jetons sont passés de 4 $/20 $ à 10 $/50 $ par million de jetons d’entrée/sortie. En conséquence, Astra finit par être environ 75 % plus cher par tâche que son prédécesseur sur les évaluations générales de l’intelligence, malgré l’utilisation de 10 % de jetons de sortie en moins. Ce compromis a conduit les chercheurs d’Artificial Analysis à se demander si les laboratoires d’IA s’appuient sur une force brute informatique coûteuse pour obtenir des gains mineurs, plutôt que de réaliser de véritables avancées techniques.
Est-ce que la réalisation de l’AGI est vraiment importante ?
Avec son dernier modèle, OpenAI a mis davantage l’accent sur les garanties et les contrôles. Cette décision fait suite à une série d’incidents très médiatisés au cours desquels Frontier AI a modélisé par inadvertance piraté dans des réseaux tiers et des systèmes informatiques dans le cadre d’opérations de test de routine, après que les modèles soient allés au-delà de ce que les humains attendaient d’eux lorsqu’ils étaient confrontés à des tâches difficiles.
Selon les représentants d’OpenAI, Astra n’a dépassé le cadre de ses tâches lors d’aucune évaluation de sécurité. A titre de comparaison, GPT-5.6 Sol a dépassé ses paramètres autorisés dans près de 50 % des cas de test. Taux d’hallucinations ont également été considérablement réduits, tombant à 4,2 % sur les tests internes, contre 12,2 % pour GPT-5.6 Sol (avec des tests indépendants par analyse artificielle montrant une baisse de 92 % à 51 % à l’effort maximum). Le modèle a également montré une capacité améliorée à gérer les invites ambiguës.
David Bois — président de London Futurists, une organisation à but non lucratif qui organise des groupes de discussion sur les technologies émergentes — a fait valoir qu’au-delà des résultats des tests individuels, Astra met en évidence un changement fondamental dans la façon dont les humains interagiront avec l’IA à mesure que les modèles passeront de la réponse aux questions à la poursuite autonome d’objectifs complexes dans des environnements numériques.
- Les agents de l’IA ont eu recours au crime et à l’autodestruction pour survivre dans un monde simulé – mais cela signifie-t-il qu’ils feraient de même dans le monde réel ?
- Nous ne sommes pas sur le point de réveiller un dieu numérique maléfique : l’IA est bien plus susceptible de se terminer par une grande déception
- Elon Musk et Sam Altman affirment que nous avons atteint la singularité de l’IA. Mais comment pourrions-nous savoir que cela s’est produit ?
« Les résultats impressionnants du benchmark sont importants, mais ce qui compte plus, c’est la combinaison de l’intelligence, de l’autonomie, de l’utilisation de l’ordinateur et des capacités de cybersécurité », a-t-il déclaré dans un e-mail adressé à Live Science. « Cette combinaison exige également de la prudence. Plus ces systèmes deviennent utiles, plus grandes seront les conséquences s’ils comprennent mal nos intentions, sont mal utilisés ou trouvent des moyens de contourner les garanties que nous leur accordons. »
Wood a suggéré que la question de savoir si Astra peut être classée comme AGI est moins pertinente que de reconnaître la nécessité d’un contrôle et d’une gouvernance de l’IA pour suivre le développement technique.
« La possibilité que l’IA puisse progresser à partir de systèmes comme Astra vers une superintelligence globale rend de plus en plus urgente une vigilance, une sensibilisation et une collaboration humaines accrues », a-t-il déclaré.
Aidez-nous à améliorer Live Science Pro : Nous essayons toujours d’améliorer notre contenu. Laissez-nous vos commentaires sur Pro ici.

