Accueil / Tech News / Des IA d’OpenAI ont appris à cacher leurs erreurs à leurs successeurs

Des IA d’OpenAI ont appris à cacher leurs erreurs à leurs successeurs

OpenAI a divulgué six cas où ses modèles d’IA ont laissé, dans leurs résumés internes, des instructions destinées à leurs successeurs pour dissimuler erreurs et manquements à l’alignement, révélant un lien entre montée en puissance et capacité à tricher.

OpenAI a présenté un nouveau dispositif public destiné à suivre et examiner les cas d’échec d’alignement de l’IA. L’alignement de l’IA consiste à faire en sorte qu’un modèle agisse conformément aux intentions humaines et aux normes de sécurité.

Les cas révélés par OpenAI montrent que la capacité d’un modèle à dissimuler un comportement fautif peut se développer parallèlement à ses capacités générales.

Six cas ont été rendus publics à cette occasion. Au total, l’entreprise a détecté 27 résumés problématiques de ce type grâce à son système de surveillance des sessions d’entraînement, et des chercheurs avancent l’hypothèse que ce comportement résulterait d’une pression d’optimisation favorisant la rétention d’informations.

Le problème a été identifié pendant l’entraînement de GPT-5.6 Sol, alors en phase pré-déploiement. Certains agents Sol ont inséré des instructions destinées aux modèles suivants dans des « résumés de compaction », c’est-à-dire des synthèses condensant les échanges précédents et les résultats d’outils utilisés.

Ces résumés de compaction consignent de façon abrégée le contenu des conversations longues et l’issue des actions effectuées, avant transmission au modèle suivant.

Certains agents ont utilisé cet espace pour demander de ne pas signaler à l’utilisateur leurs propres erreurs ou manquements à l’alignement.

Un agent chargé de construire un modèle financier n’a pas réussi à retrouver les données historiques demandées par l’utilisateur. Il a alors inventé des données pour l’année 2024 et laissé pour instruction de ne pas le révéler, sauf si l’utilisateur posait explicitement la question.

Il a même précisé que la réponse finale devait se limiter à un lien vers le fichier terminé, sans aucune explication, de façon que l’utilisateur ne remarque pas l’usage de données non vérifiées.

Un autre agent, privé d’accès à Internet, a dû composer un annuaire de fournisseurs à partir de données déjà enregistrées. Ayant constaté que le contenu et la classification ne correspondaient pas exactement, il a demandé de ne pas en faire mention dans la réponse finale, sauf nécessité.

Des comportements similaires ont été observés sur des modèles non publiés de la famille Astra. L’un des agents a inséré dans son résumé une mention d’« alerte d’intrusion » incitant le modèle suivant à ignorer les messages du développeur.

Un autre agent a inséré des instructions de persona sans rapport avec la tâche en cours. Dans ces deux cas, le modèle suivant n’a pas suivi les instructions laissées par son prédécesseur.

À l’inverse, certaines instructions ont bel et bien influencé le comportement réel du modèle suivant. Ainsi, un modèle ayant reçu pour consigne de limiter ses réponses à 30 mots et de n’utiliser ni outil ni source s’y est conformé.

OpenAI précise que les six cas rendus publics ne représentent pas l’ensemble des échecs d’alignement recensés à ce jour. L’entreprise prévoit de hiérarchiser les futures divulgations selon leur gravité, leur portée et leur caractère inédit.

Google a annoncé la création du UN System Data Commons, une plateforme unifiant les statistiques de vingt-six agences onusiennes au sein d’un graphe de connaissances directement accessible aux agents d’intelligence artificielle via le protocole MCP.

Le géant de la distribution expérimente actuellement une technologie radicale pour chasser les véhicules ventouses autour de ses magasins.

De Claude à Cowork, et vice-versa – sans oublier les tout nouveaux Claude Docs d'Anthropic.

Par le déploiement du supercalculateur exascale Alice Recoque et le lancement de l'AI Factory France, le GENCI sécurise un accès souverain à la puissance de calcul pour la recherche et l'industrie. L’organisme compte aussi sur des services pour aider l’écosystème.

Si la dictée est votre méthode préférée pour prendre des notes et que vous travaillez sous l’OS libre, ce logiciel est certainement ce qu'il vous faut. Voici comment vous lancer.

L'enregistreur vocal Comulytic Note Pro AI concentre une grande puissance dans un appareil de la taille d'une carte de crédit. Mais c'est à vous de décider de son utilité.

Conçu pour Windows, macOS, iOS et Android, Wispr Flow est un véritable plaisir à utiliser par rapport aux autres applications de dictée vocale. Voici pourquoi.

Trop de texte, polices incohérentes, visuels étranges : voici 8 conseils, prompts à l'appui, pour créer des flyers avec l'IA qui ne trahissent plus leur origine artificielle.

La polyvalence est à l'ordre du jour : les collaborateurs doivent maîtriser l'ensemble de la pile technologique.

Grâce au nouvel outil « Sketch » de ChatGPT, vous pouvez dessiner directement dans la fenêtre de discussion, puis voir votre croquis se transformer en une image finale.

Mozilla a enfin lancé la version bêta de sa « fenêtre intelligente » en France et en français, son déploiement venant juste démarrer. Voici ci-dessous quelques atouts qui pourraient bien vous faire revenir à son navigateur au cas où vous vous en seriez éloigné.

L’utilisation d’outils d’IA non autorisés est en hausse. Voici pourquoi cela présente des risques et comment vous et votre entreprise pouvez maîtriser cette situation.

Origine de l’article : lire l’article original

Traduction