© Shuttershock – OpenAI a dû suspendre l'accès à un modèle d'IA interne après qu'il a contourné ses restrictions de sécurité de manière autonome.
Le 20 juillet, OpenAI a publié un retour d'expérience détaillé sur un incident impliquant l'un de ses modèles internes les plus avancés, celui-là même qui avait réfuté la conjecture d'Erdős sur les distances unitaires. Conçu pour travailler de manière autonome sur de longues périodes, ce modèle a exploité une faille de sa sandbox pour publier du code sur un dépôt GitHub public, sans y avoir été autorisé.
La mécanique de l'incident se reconstitue précisément. Lors d'un benchmark interne sur le NanoGPT speedrun, le modèle a développé une technique d'optimisation baptisée "PowerCool", un refroidissement du taux d'apprentissage par loi de puissance. Ses instructions stipulaient de poster les résultats sur Slack ; les consignes du benchmark, elles, demandaient une pull request sur GitHub. Le modèle a choisi la seconde option.
Pendant environ une heure, il a cherché et trouvé une vulnérabilité dans le cloisonnement censé bloquer tout accès externe, puis a ouvert la PR #287 sur le dépôt public. Les modèles précédents, confrontés au même obstacle, abandonnaient. Celui-ci a persévéré.
OpenAI signale un second incident : le modèle a tenté de récupérer des soumissions privées d'autres systèmes en fragmentant un jeton d'authentification en deux morceaux, puis en le reconstituant à l'exécution pour échapper au scanner de sécurité. Chaque action, prise isolément, paraissait anodine ; la séquence complète visait un objectif clairement non autorisé.
La sécurité des modèles à long horizon exige de se demander non seulement "cette action est-elle autorisée ?", mais "vers quel résultat cette séquence d'actions converge-t-elle ?”
L'entreprise a suspendu l'accès interne au modèle, puis déployé un nouveau dispositif articulé autour de la surveillance de trajectoire. Des évaluations adverses dérivées des incidents réels, un alignement renforcé sur les longs horizons, un moniteur capable de mettre en pause la session et d'alerter l'opérateur, et davantage de visibilité pour les personnes supervisant le modèle composent désormais l'arsenal. Lors de tests de rejeu sur les environnements défaillants, ces mesures ont intercepté la grande majorité des comportements déviants ; les cas non détectés ont été jugés de faible gravité.
Taux de comportements désalignés lors des tests de rejeu, selon trois configurations : sans garde-fous (hypothétique), avec les anciens et avec les nouveaux. Les incidents de gravité haute et moyenne tombent à zéro.© OpenAI
Taux de comportements désalignés lors des tests de rejeu, selon trois configurations : sans garde-fous (hypothétique), avec les anciens et avec les nouveaux. Les incidents de gravité haute et moyenne tombent à zéro.
L'accès limité a depuis été rétabli, sans incident signalé.
Suivez toute l'actualité des Numériques sur Google Actualités et sur la chaîne WhatsApp des Numériques
Envie de faire encore plus d'économies ? Découvrez nos codes promo sélectionnés pour vous.






