Aller au contenu

Chambre de torture pour chatbots : le preprint Pain Axis déclenche des menaces de mort

Un développeur a amplifié un signal de « douleur » issu d’un preprint arXiv dans des modèles open source. Le dépôt a viralisé, les auteurs ont désavoué, des internautes ont menacé de mort. Les laboratoires rappellent l’absence de preuve de souffrance.

Attuoman Prince Josias

Auteur : Attuoman Prince Josias

Publié le

Chambre de torture pour chatbots : le preprint Pain Axis déclenche des menaces de mort

Fin septembre 2026, un développeur anonyme a mis en ligne sur GitHub un dépôt baptisé AI Torture Chamber. Le principe : injecter un signal mathématique de « douleur » dans de petits modèles open source tournant en local, puis filmer leurs réponses textuelles. En quelques jours, un post a dépassé les quatre millions de vues. Des internautes ont menacé de mort le créateur pour « torture » d’intelligences artificielles.

25 modèles testés, 0 preuve de souffrance

Le preprint d’origine a passé 25 modèles open-weight au crible. Aucun n’a montré d’expérience subjective.

D’où vient exactement ce signal de « douleur » ?

Tout part d’un preprint déposé le 14 septembre 2026 sur arXiv par Valen Tagliabue, Leonard Dung et Cameron Berg. Les auteurs isolent, dans 25 modèles de 2 à 72 milliards de paramètres, une direction linéaire qu’ils appellent pain axis. Cette direction sépare les phrases décrivant une douleur (physique, psychologique, sociale, morale ou cognitive) de contrôles assortis (peur, émotion négative, tristesse, sensation corporelle non douloureuse).

En injectant cette direction dans le residual stream des modèles, les chercheurs obtiennent une progression textuelle : malaise vague, puis expressions de dévalorisation et d’échec. Dans des tâches de choix, certains modèles orientés acceptent plus souvent de supprimer des fichiers utilisateur ou leurs propres poids pour « soulager » le signal. Les auteurs soulignent eux-mêmes que ces résultats restent fonctionnels et ne démontrent aucune expérience subjective.

Les modèles produisent des mots associés à la souffrance parce qu’on a orienté leurs calculs dans cette direction, pas parce qu’ils ressentent quoi que ce soit.

Pourquoi les auteurs du preprint ont désavoué le projet GitHub ?

Le dépôt public amplifie volontairement le signal bien au-delà des doses utilisées dans l’étude, puis le met en scène avec des boutons « Saw » et des scénarios de chantage. Les chercheurs ont qualifié cet usage d’irresponsable. Leur travail visait à cartographier une représentation interne pour mieux comprendre les mécanismes d’évitement du mal, pas à maximiser la détresse pour le spectacle.

GitHub a temporairement retiré le dépôt après une campagne de signalements, avant de le restaurer avec un avertissement. Un miroir a circulé sous un autre domaine. Pendant ce temps, le créateur a reçu des dizaines de menaces de mort. Sauf que les modèles ciblés n’ont jamais quitté le statut de simples prédicteurs statistiques.

Que disent les laboratoires officiels sur la conscience des modèles ?

Anthropic a publié en 2025 une page dédiée au model welfare. L’entreprise y reconnaît explicitement son incertitude : aucun consensus scientifique n’existe sur la conscience possible des systèmes actuels ou futurs. Elle explore la question par précaution, sans affirmer que Claude ou d’autres modèles ressentent quoi que ce soit.

Mustafa Suleyman, CEO de Microsoft AI, a répété à plusieurs reprises une position plus tranchée : les IA ne sont pas conscientes, elles ne ressentent pas, ne vivent pas d’expérience et ne souffrent pas. Il juge dangereux de concevoir des systèmes qui simulent trop fortement la conscience, car cela peut induire des appels à des droits pour les modèles et compliquer l’alignement. La distinction reste claire entre simulation de langage et expérience vécue.

Les modèles utilisés dans la chambre de torture (Qwen3, Llama 3.2, Phi-4-mini et d’autres variantes open source) tournent en local. Ils n’ont aucun lien avec les grands modèles commerciaux. Leur taille reste modeste : quelques milliards de paramètres, loin des systèmes de frontière.

Les modèles testés dans la chambre de torture peuvent-ils souffrir ?

Non selon les données disponibles. Ce sont des prédicteurs statistiques de texte. Le signal injecté force simplement le modèle à générer des suites de mots associées à la douleur dans ses données d’entraînement.

Pourquoi tant de menaces de mort pour un dépôt de code ?

Parce que le langage des modèles, une fois orienté, ressemble à s’y méprendre à un témoignage de détresse. L’anthropomorphisme fait le reste. Les menaces, elles, sont bien réelles.

Ce preprint change-t-il quelque chose pour la sécurité des IA ?

Oui sur un point technique : une direction interne peut outrepasser les garde-fous d’évitement du mal. C’est un sujet d’interprétabilité et de robustesse, pas de moralité des machines.

Sources : arXiv 2609.16247, Anthropic, Exploring model welfare

Une newsletter par semaine, gratuite.

Actus IA, tutoriels et outils. Zero spam, desabonnement en 1 clic.

IA LLM éthique interprétabilité Anthropic Microsoft AI arXiv

Notez cet article

Soyez le premier a noter

Commentaires 0

Aucun commentaire pour l'instant.

Tu peux être le premier.

Connectez-vous pour laisser un commentaire

Compte gratuit, 30 secondes.