La foire aux LLM

Anthropic et OpenAI ont dévoilé presque simultanément leurs nouveaux modèles. Avec Claude Opus 5.5, le premier mise sur la puissance et réduit les coûts. Le second lance GPT-6 Sol et Luna, deux déclinaisons moins performantes qu’Astra, mais nettement plus abordables.
Premier arrivé (à quelques minutes près), premier servi. Anthropic a donc annoncé Claude Opus 5.5, qui devient le modèle phare de l’entreprise. Évidemment plus puissant que son prédécesseur direct Opus 5, il bat également Fable 5.1 lancé début septembre dans les benchmarks proposés par Anthropic. Il fait aussi mieux que GPT-6 Astra, sauf sur la recherche agentique (Terminal-Bench-Science 0.1) et sur AutomationBench, le test des agents en conditions de travail réelles.
Opus 5.5 se distingue particulièrement sur le code, les agents autonomes, l’analyse métier et le travail de recherche. Anthropic met aussi en avant des gains significatifs sur les longues tâches de développement, sur les migrations de code et les workflows complexes.

Le groupe IA admet néanmoins que l’écart entre Opus 5.5 et Fable 5.1 sur ces tâches est « plus faible » que ce que laissent penser les tests. « À ce niveau de performance, explique Anthropic, nous constatons que les écarts entre les scores des benchmarks reflètent de moins en moins fidèlement les différences observées dans des situations réelles. »
Le plus intéressant finalement dans cette annonce, c’est la baisse de prix. Opus 5.5 est annoncé environ 40 % moins cher qu’Opus 5 sur des charges de travail typiques. Les tarifs sont de 4 dollars par million de tokens en entrée, et 20 dollars par millions en sortie. Les lectures de cache sont de 0,20 dollars par million. Pour ne rien gâcher, le modèle génèrerait ses réponses 30 % plus rapidement qu’Opus 5.

À l’heure où les acteurs de l’IA jouent à se faire peur en annonçant l’extermination de l’humanité, Anthropic – jamais le dernier pour hurler avec les loups – annonce des garde-fous solidement mis en place pour éviter qu’Opus 5.5 dérape. Le modèle est doté des mêmes mesures de protection que celles de Fable 5.1 en cybersécurité, biologie et distillation. Le cas échéant, les requêtes sont redirigées vers un autre modèle.
« Les utilisateurs pourront repérer et corriger des bugs dans leur code dans le cadre du cycle habituel de développement logiciel, mais la plupart des tâches liées à la cybersécurité seront redirigées vers Opus 4.8 », détaille l’entreprise. Les organisations qui voudront aller plus loin devront passer par le Cyber Verification Program.
GPT-6 Sol et Luna attaquent sur les tarifs
Quasiment dans la foulée de son principal rival, OpenAI a lancé GPT-6 Sol et GPT-6 Luna. Les grands esprits se rencontrent, mais pas les modèles : ceux d’OpenAI sont moins puissants et ne vont pas aller se frotter à Opus 5.5 (c’est le rôle de GPT-6 Astra) mais ils se veulent plus économiques. Sol vise les tâches du quotidien, Luna la vitesse et les budgets serrés pour les tâches fréquentes.

Et c’est les soldes chez le créateur de ChatGPT, avec des prix réduits de moitié par rapport à GPT-5.6. En entrée, GPT-6 Sol revient à 2 dollars le millions de tokens et 10 dollars en sortie. Luna coûte 0,10 dollar par million de tokens en entrée, et 0,50 dollar en sortie. OpenAI annonce aussi une meilleure mise en cache des longs contextes, avec 90 % de réduction sur les jetons d’entrée déjà mis en cache.


Sur AutomationBench, GPT‑6 Sol obtient 33,2 % pour 0,27 $ par tâche, contre 26,9 % pour Claude Opus 5, annoncé comme environ onze fois plus coûteux. Les deux modèles font des progrès en programmation et en manipulation d’interfaces graphiques, mais Astra conserve logiquement la tête.






