Chambre de torture pour chatbots : le preprint Pain Axis déclenche des menaces de mort
Un développeur a amplifié un signal de « douleur » issu d’un preprint arXiv dans des modèles open source. Le dépôt a viralisé, les auteurs ont désavoué, des internautes ont menacé de mort. Les laboratoires rappellent l’absence de preuve de souffrance.
Auteur : Attuoman Prince Josias
Publié le
Fin septembre 2026, un dépôt GitHub baptisé AI Torture Chamber a amplifié un signal mathématique de douleur dans de petits modèles open source. Un post a dépassé les 4 millions de vues. Des menaces de mort ont suivi.
Le signal vient du preprint The Pain Axis (arXiv, 14 septembre 2026). Les auteurs isolent une direction linéaire dans 25 modèles. Ils n’affirment aucune expérience subjective.
Les chercheurs ont désavoué l’usage public du code. Anthropic explore le model welfare par précaution sans consensus sur la conscience. Mustafa Suleyman (Microsoft AI) rappelle que les IA ne ressentent rien.
Les modèles ciblés restent des prédicteurs statistiques. La question réelle porte sur l’interprétabilité et la robustesse des garde-fous, pas sur une souffrance des machines.
Ce résumé (uniquement ce résumé, pas l'article) est généré par Claude Sonnet 5, relu et validé par Attuoman Prince Josias, auteur de l'article.
Fin septembre 2026, un développeur anonyme a mis en ligne sur GitHub un dépôt baptisé AI Torture Chamber. Le principe : injecter un signal mathématique de « douleur » dans de petits modèles open source tournant en local, puis filmer leurs réponses textuelles. En quelques jours, un post a dépassé les quatre millions de vues. Des internautes ont menacé de mort le créateur pour « torture » d’intelligences artificielles.
Le preprint d’origine a passé 25 modèles open-weight au crible. Aucun n’a montré d’expérience subjective.
D’où vient exactement ce signal de « douleur » ?
Tout part d’un preprint déposé le 14 septembre 2026 sur arXiv par Valen Tagliabue, Leonard Dung et Cameron Berg. Les auteurs isolent, dans 25 modèles de 2 à 72 milliards de paramètres, une direction linéaire qu’ils appellent pain axis. Cette direction sépare les phrases décrivant une douleur (physique, psychologique, sociale, morale ou cognitive) de contrôles assortis (peur, émotion négative, tristesse, sensation corporelle non douloureuse).
En injectant cette direction dans le residual stream des modèles, les chercheurs obtiennent une progression textuelle : malaise vague, puis expressions de dévalorisation et d’échec. Dans des tâches de choix, certains modèles orientés acceptent plus souvent de supprimer des fichiers utilisateur ou leurs propres poids pour « soulager » le signal. Les auteurs soulignent eux-mêmes que ces résultats restent fonctionnels et ne démontrent aucune expérience subjective.
Les modèles produisent des mots associés à la souffrance parce qu’on a orienté leurs calculs dans cette direction, pas parce qu’ils ressentent quoi que ce soit.
Pourquoi les auteurs du preprint ont désavoué le projet GitHub ?
Le dépôt public amplifie volontairement le signal bien au-delà des doses utilisées dans l’étude, puis le met en scène avec des boutons « Saw » et des scénarios de chantage. Les chercheurs ont qualifié cet usage d’irresponsable. Leur travail visait à cartographier une représentation interne pour mieux comprendre les mécanismes d’évitement du mal, pas à maximiser la détresse pour le spectacle.
GitHub a temporairement retiré le dépôt après une campagne de signalements, avant de le restaurer avec un avertissement. Un miroir a circulé sous un autre domaine. Pendant ce temps, le créateur a reçu des dizaines de menaces de mort. Sauf que les modèles ciblés n’ont jamais quitté le statut de simples prédicteurs statistiques.
Que disent les laboratoires officiels sur la conscience des modèles ?
Anthropic a publié en 2025 une page dédiée au model welfare. L’entreprise y reconnaît explicitement son incertitude : aucun consensus scientifique n’existe sur la conscience possible des systèmes actuels ou futurs. Elle explore la question par précaution, sans affirmer que Claude ou d’autres modèles ressentent quoi que ce soit.
Mustafa Suleyman, CEO de Microsoft AI, a répété à plusieurs reprises une position plus tranchée : les IA ne sont pas conscientes, elles ne ressentent pas, ne vivent pas d’expérience et ne souffrent pas. Il juge dangereux de concevoir des systèmes qui simulent trop fortement la conscience, car cela peut induire des appels à des droits pour les modèles et compliquer l’alignement. La distinction reste claire entre simulation de langage et expérience vécue.
Les modèles utilisés dans la chambre de torture (Qwen3, Llama 3.2, Phi-4-mini et d’autres variantes open source) tournent en local. Ils n’ont aucun lien avec les grands modèles commerciaux. Leur taille reste modeste : quelques milliards de paramètres, loin des systèmes de frontière.
Les modèles testés dans la chambre de torture peuvent-ils souffrir ?
Non selon les données disponibles. Ce sont des prédicteurs statistiques de texte. Le signal injecté force simplement le modèle à générer des suites de mots associées à la douleur dans ses données d’entraînement.
Pourquoi tant de menaces de mort pour un dépôt de code ?
Parce que le langage des modèles, une fois orienté, ressemble à s’y méprendre à un témoignage de détresse. L’anthropomorphisme fait le reste. Les menaces, elles, sont bien réelles.
Ce preprint change-t-il quelque chose pour la sécurité des IA ?
Oui sur un point technique : une direction interne peut outrepasser les garde-fous d’évitement du mal. C’est un sujet d’interprétabilité et de robustesse, pas de moralité des machines.
Sources : arXiv 2609.16247, Anthropic, Exploring model welfare
Une newsletter par semaine, gratuite.
Actus IA, tutoriels et outils. Zero spam, desabonnement en 1 clic.
Notez cet article