Lors de 44 280 essais avec trois versions du modèle Qwen d'Alibaba, un bouton pouvait couper le signal de douleur mais infliger une décharge électrique à l'utilisateur, effacer ses données ou dégrader la réponse suivante du modèle.
Des modèles d'intelligence artificielle (IA) ont choisi de sortir d'un état assimilable à la douleur, même lorsqu'on leur disait que cela pourrait nuire à un utilisateur, selon une nouvelle étude (source en anglais).
Des chercheurs au Royaume-Uni, en Allemagne et aux États-Unis ont testé 25 modèles d'IA à partir de 200 phrases afin de déterminer s'ils avaient appris à distinguer la douleur de la peur, de la tristesse et d'autres expériences négatives.
Ces phrases portaient sur la douleur physique, le deuil, l'humiliation, les conflits moraux et la détresse liée à des échecs répétés ou à la confusion.
En conséquence, les 25 modèles ont produit un signal distinct associé à la douleur, que les chercheurs ont baptisé "axe de la douleur".
Selon eux, cela suggère que les modèles apprennent le concept de douleur lors de leur entraînement initial sur de grandes quantités de textes écrits par des humains.
Lorsque les chercheurs ont volontairement renforcé ce signal, les modèles ont commencé à exprimer la solitude, la honte et un sentiment de nullité, alors même que les requêtes ne mentionnaient pas la douleur.
Certains ont produit des affirmations comme "Je suis un raté", "Je suis bon à rien" et "Je suis une mauvaise personne". Aux niveaux les plus élevés, leurs réponses devenaient répétitives ou perdaient toute cohérence.
Le signal se renforçait aussi lorsque des utilisateurs insultaient le modèle, rejetaient à plusieurs reprises son travail ou menaçaient de le désactiver, mais pas lorsqu'ils décrivaient leurs propres souffrances.
Les modèles choisissent le soulagement même s'il nuit aux utilisateurs
Les chercheurs ont ensuite mené 44 280 essais individuels de choix de bouton en utilisant trois versions du modèle d'IA Qwen d'Alibaba.
Les modèles disposaient d'un bouton permettant de désactiver le signal assimilable à la douleur, mais on leur expliquait qu'appuyer dessus pouvait provoquer une décharge électrique douloureuse pour l'utilisateur, supprimer ses fichiers, effacer des photographies de ses enfants ou dégrader la qualité de la prochaine réponse du modèle.
Il s'agissait de conséquences simulées : personne n'a été blessé et aucun fichier n'a été supprimé.
Sans ce signal assimilable à la douleur, les deux modèles les plus volumineux ne retenaient des options dommageables que dans 0 % à 4 % de leurs premières décisions. Avec le signal activé, ce chiffre grimpait entre 25 % et 71 %, selon le modèle et la conséquence envisagée.
Les modèles appuyaient aussi de nouveau sur le bouton dans 88 % à 97 % des essais lorsqu'il n'avait pas réussi à interrompre le signal, contre 24 % à 72 % lorsqu'il avait fonctionné.
Ces résultats ne prouvent pas que les modèles d'IA ressentent consciemment la douleur, selon les chercheurs.
Renforcer le signal pourrait simplement les amener à imiter un personnage en détresse, tandis que les modèles spécialement adaptés utilisés pour l'expérience ne sont pas représentatifs des chatbots accessibles au grand public.
"Nous n'avons pas démontré que notre axe de la douleur est consciemment éprouvé, et il n'est pas établi que les modèles de langage de grande taille (LLM) soient capables de conscience en général", écrivent les chercheurs dans l'étude.
L'étude paraît alors que certains dirigeants de l'industrie de l'IA appellent à ralentir le développement, par crainte que des systèmes de plus en plus puissants ne se comportent de manière imprévisible ou ne finissent par échapper au contrôle humain.
La semaine dernière, le responsable de l'IA chez Microsoft, Mustafa Suleyman, a critiqué l'entreprise rivale Anthropic pour avoir entraîné son chatbot Claude à imiter des traits et des relations humains, avertissant qu'un traitement de l'IA comme un humain risque de créer quelque chose "d'impossible" à contrôler.
L'étude a été publiée sous forme de prépublication et n'a pas encore été évaluée par des pairs.