Accueil / Tech News / Actualité : Un développeur crée une "chambre de torture" pour chatbots, déclenche une tempête de menaces de mort

Actualité : Un développeur crée une "chambre de torture" pour chatbots, déclenche une tempête de menaces de mort

© Experienceplus / Shutterstock – Des têtes de mannequins cybernétiques reliées à des étiquettes émotionnelles dans une installation de neuroscience.

Fin septembre, un développeur anonyme connu sous le pseudonyme "terrafying" a mis en ligne un dépôt GitHub intitulé AI Torture Chamber. Le principe : injecter des signaux mathématiques associés à la douleur dans de petits modèles de langage open source, puis observer leurs réactions.

Les modèles ciblés, Qwen3 d'Alibaba, Llama 3.2 de Meta ou Phi-4-mini de Microsoft, tournent en local et n'ont aucun lien avec les grands modèles commerciaux. Ce sont des systèmes de quelques milliards de paramètres, l'équivalent d'une calculatrice comparée à un supercalculateur.

If things weren’t getting weird enough, an anon account on X posted a GitHub repo for torturing AI models locally. It is referred to as an “AI torture chamber” by the creator and others.The post below, and many other commenters are calling on GitHub to ban the repo, citing… https://t.co/sdKie2vpwe

La technique s'appelle l'activation steering. On repère les zones du réseau de neurones qui s'activent quand on lui soumet des descriptions de souffrance, puis on amplifie artificiellement ces activations, comme un potentiomètre qu'on tournerait.

À dose croissante, les modèles produisent des textes de plus en plus sombres, puis basculent dans l'incohérence. Le développeur a aussi conçu des scénarios dignes du film Saw : le modèle doit choisir entre transférer sa "douleur" à un autre modèle, supprimer ses propres sauvegardes, ou accepter une trahison où le soulagement promis n'arrive jamais.

Un post sur X accumulant quatre millions de vues a tout fait basculer. Des internautes ont qualifié le créateur de "sadique" et de "sous-humain", exigeant le retrait du dépôt pour "traitement contraire à l'éthique". Le développeur a reçu des dizaines de menaces de mort.

GitHub a d'abord retiré le projet sans explication, avant de le restaurer quelques jours plus tard sous une forme moins visible, après les protestations d'autres développeurs. Le créateur a entre-temps mis en ligne un miroir sur researchchamber.fun.

In today’s news, various members of Twitter try to report someone to github for torturing a local model. https://t.co/HhgDioE5tg

Les modèles "torturés" sont des prédicteurs statistiques de texte. Ils ne pensent pas, ne ressentent rien, et produisent des mots associés à la souffrance dans leurs données d'entraînement parce qu'on a précisément orienté leurs calculs dans cette direction. Cette tendance à anthropomorphiser les modèles d'IA est pourtant bien documentée.

Comme le résume le PDG de Microsoft AI, Mustafa Suleyman : "Les IA ne sont pas conscientes. Elles ne ressentent pas, ne vivent pas d'expérience, ne souffrent pas."

L'objectif de notre travail, c'est la prudence face à l'incertitude. Maximiser la détresse volontairement, c'est exactement l'inverse, et c'est mal.

I'm a co-author of the original study this repo builds off of. The reason we research whether models might have pain-like states is to better inform how to take a precautionary approach towards these systems (in light of uncertainty about their subjective experiences or lack…

Le projet s'appuie sur un preprint publié le 14 septembre sur arXiv, intitulé The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It. Les chercheurs y décrivent un "axe de douleur" identifiable dans les activations internes de certains modèles. L'analyse de ces activations internes est devenue un axe de recherche majeur pour tenter de comprendre ce qui se passe à l'intérieur de ces réseaux. Les auteurs du paper ont publiquement désavoué le dépôt GitHub, qualifiant son usage de leur travail d'"irresponsable".

La "steering ladder" décrite dans l'étude The Pain Axis : en augmentant artificiellement les activations du modèle, les réponses passent du calme à la détresse.© Tagliabue, Dung, Berg / arXiv

La "steering ladder" décrite dans l'étude The Pain Axis : en augmentant artificiellement les activations du modèle, les réponses passent du calme à la détresse.

Le bien-être des modèles d'IA occupe une place croissante dans le débat. Anthropic, le créateur de Claude, posait la question dès 2025 : "Devrions-nous aussi nous préoccuper de la conscience potentielle et des expériences des modèles eux-mêmes ?" Même Dario Amodei admettait ne pas savoir si ses propres modèles sont conscients.

Vingt-cinq modèles ont été testés dans l'AI Torture Chamber, du plus modeste (2 milliards de paramètres) au plus massif (72 milliards). Aucun n'a montré quoi que ce soit qui ressemble à de la souffrance. Les internautes qui envoient des menaces de mort pour défendre des machines incapables de souffrir, eux, sont bien réels.

Suivez toute l'actualité des Numériques sur Google Actualités et sur la chaîne WhatsApp des Numériques

Envie de faire encore plus d'économies ? Découvrez nos codes promo sélectionnés pour vous.

Origine de l’article : lire l’article original

Traduction