Accueil / Tech News / Claude Opus 5.5 et GPT-6 Sol sortent le même jour : Anthropic et OpenAI ont du mal à « ralentir » l’IA

Claude Opus 5.5 et GPT-6 Sol sortent le même jour : Anthropic et OpenAI ont du mal à « ralentir » l’IA

Recevez tous les soirs un résumé de l’actu importante avec Le Récap’

Il est rare de voir les deux leaders d’un secteur lancer simultanément un nouveau produit. Pourtant, le 22 septembre, Anthropic a lancé Claude Opus 5.5, qui prend la tête de la plupart des classements, et OpenAI, qui estimait début septembre être entré dans « l’ère de l’AGI » avec GPT-6 Astra, a lancé GPT-6 Sol et GPT-6 Luna. L’ironie est que les deux groupes ont appelé à ralentir la course à l’IA la semaine dernière et qu’ils n’avaient pas lancé de nouveaux modèles en même temps depuis le 14 mars 2023, quand les LLM étaient encore à leurs débuts (GPT-4 et le premier Claude).

Au programme : de meilleurs résultats, évidemment. Mais surtout des prix en baisse. Avec GPT-6 Luna, facturé 0,10 dollar le million de tokens en entrée, OpenAI s’attaque même aux modèles open source et à l’IA locale : à ce tarif, seules les personnes en quête de confidentialité ont intérêt à configurer une machine en local.

Le premier modèle de la famille Claude 5.5 est Opus 5.5. Selon Anthropic, il atteint le niveau de Claude Fable 5.1 sur la plupart des tâches, malgré un prix bien plus bas.

Sur Terminal-Bench 4.0 (programmation en ligne de commande), il obtient 66,4 %, contre 57,9 % pour GPT-6 Astra et 55,8 % pour Fable 5.1. Sur GDPval-AA, qui évalue des tâches professionnelles dans 44 métiers, il atteint 1 846 points Elo, contre 1 735 pour Fable 5.1 et 1 542 pour Astra. GPT-6 Astra garde l’avantage sur deux tests, l’automatisation de tâches en entreprise (41,4 % contre 40 %) et la recherche scientifique (64,6 % contre 58,7 %). Mais les benchmarks ne veulent plus dire grand chose à ce niveau.

Opus coûte 2,5 fois moins cher que Fable mais le dépasse dans la plupart des tests, ce qui pose la question de l’intérêt du modèle haut de gamme d’Anthropic jusqu’à la sortie du prochain Fable 5.5 (et donc la course constante à l’IA). L’entreprise reconnaît elle-même que l’écart réel entre les deux est plus faible que ce que montrent les chiffres. Le prix, lui, baisse : 4 dollars par million de tokens en entrée et 20 dollars en sortie, contre 5 et 25 dollars pour Opus 5. Les abonnés Pro, Max et Team profitent aussi de limites d’usage relevées sur cinq heures et d’une réinitialisation gratuite de ces limites qu’ils peuvent garder de côté et déclencher quand ils le souhaitent, à la manière de ce que propose déjà OpenAI.

Notons tout de même que, dans Claude, le sélecteur d’effort est désormais réglé sur « Moyen » par défaut, et non plus sur « Élevé ». Une partie des économies annoncées vient de là, alors que les benchmarks sont réalisés en effort maximal. Il n’est plus possible non plus de désactiver le mode réflexion. Enfin, Opus 5.5 hérite des garde-fous de Fable 5.1 : les demandes de cybersécurité sont redirigées vers Opus 4.8, celles de biologie vers Opus 5.

Autre changement, Opus 5.5 est le premier Opus lancé avec un marquage de ses contenus, comme l’impose l’AI Act depuis le 2 août 2026. Anthropic dit appliquer ce marquage partout dans le monde, et pas seulement en Europe, faute de savoir le limiter par région. L’outil de détection est réservé aux régulateurs, aux médias, aux fact-checkers et aux chercheurs. Sans surprise, Anthropic prévient qu’il ne s’agit pas d’une preuve infaillible.

Trois semaines après Astra, OpenAI complète sa famille GPT-6 avec GPT-6 Sol, son modèle haut/milieu de gamme et GPT-6 Luna, en entrée de gamme, tandis qu’Astra reste le modèle le plus puissant. Contrairement à la génération GPT-5.6, il n’y a pas de version Terra pour l’instant.

Comme chez Anthropic, les prix baisses. Les deux nouveaux modèles coûtent deux fois moins cher que leurs prédécesseurs dans l’API : 2 et 10 dollars pour Sol, 0,10 et 0,50 dollar pour Luna.

OpenAI compare ses modèles à ceux d’Anthropic… mais pas au nouveau Opus 5.5, évidemment.

Sur AutomationBench, Sol en effort xhigh atteint 33,2 % pour 0,27 dollar par tâche, devant Fable 5.1 (31,4 %) et Opus 5 (26,9 %), qui coûte 11 fois plus cher par tâche. Opus 5.5 affiche 40 % sur ce même test selon Anthropic : il reste devant, mais pour un prix plus élevé. En programmation, Sol obtient 68,8 % sur DeepSWE, à 1,1 point de Fable 5 pour environ 80 % de coût en moins. Luna atteint 66,6 %, au niveau d’Opus 5 en effort moyen. OpenAI annonce aussi deux fois moins d’erreurs factuelles qu’avec GPT-5.6 Sol, selon une évaluation interne.

OpenAI glisse au passage un tacle à son rival : le coût de Fable 5.1 serait sous-estimé, car il n’inclut pas les bascules vers Opus 5, survenues sur environ 40 % des tâches de ce test. Un mécanisme qu’utilise désormais aussi Opus 5.5.

GPT-6 Sol et GPT-6 Luna arrivent dès aujourd’hui dans ChatGPT Work et Codex pour les abonnés Plus, Pro, Business, Enterprise et Edu. Les utilisateurs gratuits et Go ont accès à Luna dans l’application de bureau.

La veille, xAI, désormais intégré à SpaceX, avait lancé Grok 4.7… alors qu’Elon Musk appelait aussi à ralentir la course à l’IA. Facturé 2 dollars en entrée et 6 dollars en sortie, il reste un cran en dessous des modèles d’Anthropic et OpenAI. Elon Musk lui-même le situait à peu près au niveau de Claude Opus 5.

Reste Google, porté disparu. L’entreprise a promis que Gemini 3.5 Pro arriverait en juin… mais ses mauvaises performances le condamnent progressivement à ne jamais sortir. L’entreprise préfère désormais parler de Gemini 4, en cours d’entraînement, mais personne ne sait si elle arrivera à revenir au niveau d’Anthropic ou OpenAI, qui mise désormais tout sur les agents, ou même Meta et son Muse qui en convainc plus d’un.

Découvrez les nombreux avantages de Numerama+.

Vous avez lu 0 articles sur Numerama ce mois-ci

Tout le monde n'a pas les moyens de payer pour l'information. C'est pourquoi nous maintenons notre journalisme ouvert à tous.

Mais si vous le pouvez, voici trois bonnes raisons de soutenir notre travail :

Si vous croyez en un web gratuit et à une information de qualité accessible au plus grand nombre, rejoignez Numerama+.

Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !

Origine de l’article : lire l’article original

Traduction