Recevez tous les soirs un résumé de l’actu importante avec Le Récap’
GPT-6 Sol est-il le modèle le plus éphémère de tous les temps ? OpenAI, après une annonce le 22 septembre, présente déjà son successeur : GPT-6.1 Sol. L’annonce a été faite le mardi 29 septembre lors du DevDay, sa conférence pour développeurs.
Selon l’entreprise de Sam Altman, la nouvelle version s’approche du niveau de GPT-6 Astra, son modèle le plus puissant, pour un cinquième du prix. Les développeurs qui construisent des agents IA devraient donc payer beaucoup moins cher pour des résultats proches de ceux du gratin d’OpenAI.
Pour rappel, depuis GPT-5.6, lancé fin juin, OpenAI décline chaque génération en plusieurs modèles de puissance et de prix différents, à la manière d’Anthropic. Dans la famille GPT-6, Astra, présenté le 3 septembre, occupe le haut de gamme. GPT-6 Sol et GPT-6 Luna sont arrivés le 22 septembre pour compléter cette famille de modèles. OpenAI avait alors baissé les tarifs de son API, l’accès payant qui permet aux développeurs de brancher ses modèles dans leurs propres services.
Le calendrier a, une fois encore, de quoi faire sourire : ces deux sorties surviennent peu après les appels à la prudence lancés par les entreprises d’IA. Le 12 septembre, le patron d’Anthropic exhortait les géants du secteur à ralentir le développement de leurs modèles. Le patron d’OpenAI s’était lui aussi joint à cet appel.
Via l’API, GPT-6.1 Sol coûte aux développeurs 2 dollars par million de tokens en entrée et 10 dollars par million de tokens en sortie. D’après OpenAI, ces tarifs représentent un cinquième de ceux d’Astra.
Le tarif le plus bas, 0,10 dollar par million de tokens, concerne les données d’entrée « en cache » : c’est 95 % de moins que le tarif normal. Il s’applique lorsqu’une requête reprend un contexte déjà traité, comme des instructions ou des documents. De quoi réduire le coût des agents qui réutilisent régulièrement ces mêmes informations.
Selon OpenAI, GPT-6.1 Sol progresse nettement par rapport à son prédécesseur sur des « tâches professionnelles complexes » : écrire et corriger du code, analyser des documents ou accomplir un travail qui demande plusieurs étapes. Dans certaines évaluations, ses résultats se rapprocheraient de ceux de GPT-6 Astra pour un coût bien inférieur.
En programmation, sur le test DeepSWE v1.1, où l’IA doit mener de longues tâches dans de vrais projets de code, GPT-6.1 Sol égale Astra pour environ un cinquième du coût. Il dépasse aussi de 6,4 points le meilleur score de GPT-6 Sol, avec un effort de raisonnement plus faible.
Pour piloter des applications sur un ordinateur (ici OSWorld 2.0 en hors ligne) il gagne 7 points sur GPT-6 Sol en effort maximal. Il finit à 2,1 points d’Astra, pour environ sept fois moins cher par tâche.
En recherche scientifique, sur Terminal-Bench Science, GPT-6.1 Sol fait plus que doubler le score de GPT-6 Sol en raisonnement maximal. Une tâche lui revient en moyenne à 5,47 dollars, contre 23,80 dollars pour Astra et 23,21 dollars pour Opus 5.5, le dernier modèle d’Anthropic. Pour autant, OpenAI reconnaît qu’Astra garde la première place, avec 68,1 % de réussite, et le conseille pour les recherches les plus difficiles.
OpenAI affirme aussi que GPT-6.1 Sol commet moins d’erreurs factuelles. Sur des questions difficiles, 7,7 % de ses réponses contiennent au moins une erreur lorsque son niveau de raisonnement est réglé au plus bas, contre 11,4 % pour GPT-6 Sol. Soit environ un tiers de réponses erronées en moins
Le test a toutefois été réalisé à partir de conversations dans lesquelles des utilisateurs avaient signalé une erreur commise par un modèle précédent. Ces questions ne reflètent donc pas les échanges les plus courants avec ChatGPT.
OpenAI consacre une bonne partie de sa présentation à l’alignement, à savoir la capacité du modèle à suivre les intentions de l’utilisateur tout en respectant les limites qui lui sont fixées. D’après ses tests, GPT-6.1 Sol progresse nettement sur ce point par rapport à GPT-6 Sol.
Le résultat le plus frappant concerne les restrictions explicites, comme un message « accès refusé ». GPT-6.1 Sol ne les respecte pas dans 23,5 % des scénarios testés, contre 64,4 % pour GPT-6 Sol, soit près de deux cas sur trois.
GPT-6.1 Sol est disponible dès ce mardi pour les abonnés Plus, Pro, Business, Enterprise et Edu, dans ChatGPT Work et dans Codex, l’outil de programmation d’OpenAI. Il n’arrive pas encore dans le mode Chat. Les développeurs y ont accès via l’API sous le nom gpt-6.1-sol, et une version Ultrafast, jusqu’à huit fois plus rapide dans Codex, doit suivre dans les prochains jours.
Découvrez les nombreux avantages de Numerama+.
Vous avez lu 0 articles sur Numerama ce mois-ci
Tout le monde n'a pas les moyens de payer pour l'information. C'est pourquoi nous maintenons notre journalisme ouvert à tous.
Mais si vous le pouvez, voici trois bonnes raisons de soutenir notre travail :
Si vous croyez en un web gratuit et à une information de qualité accessible au plus grand nombre, rejoignez Numerama+.
Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !
Pour ne rien manquer de l’actualité, suivez Numerama sur Google !






