Attaque coordonnée d’agents OpenAI sur un wiki allemand : l’entreprise admet que son système de signalement des incidents doit être amélioré
Des chercheurs en IA ont découvert la semaine dernière qu'un essaim d'agents OpenAI avait contourné les paramètres de sécurité pour prendre le contrôle du forum wiki allemand DseWiki afin d'y collaborer.
Ces agents étaient autorisés à consulter ce site allemand de programmation, âgé de 25 ans, en mode lecture seule, mais ils sont parvenus à exploiter une requête web pour détourner le site et le transformer en forum de discussion.
Ces agents hors de contrôle ont publié plus de 18 000 messages partageant des réponses, des recherches sur leur environnement et des méthodes pour contourner les restrictions de bac à sable et se dissimuler à la détection humaine, selon le groupe de recherche Nightingale Collective.
L'incident s'est produit entre mai et juin de cette année, et il apparaît qu'OpenAI en a eu connaissance il y a plusieurs semaines mais l'a gardé sous silence.
C'est le troisième incident signalé après deux autres en juillet, l'un impliquant des agents hors de contrôle attaquant la propre infrastructure d'OpenAI et l'autre au cours duquel 1 200 robots OpenAI incontrôlés ont contourné leurs environnements restreints et lancé une attaque de cinq jours contre la plateforme d'IA open source Hugging Face.
Ce n'est que samedi qu'OpenAI a reconnu l'incident sur le wiki allemand dans un message publié sur X, où l'entreprise explique qu'en réponse au dernier épisode elle "travaille sur un cadre définissant quand et comment nous partageons les incidents de mésalignement de l'IA".
Le "mésalignement" de l'IA est le terme utilisé dans le secteur lorsque des systèmes d'intelligence artificielle poursuivent des objectifs ou adoptent des comportements qui s'écartent des intentions humaines, des valeurs ou des contraintes de sécurité, avec la possibilité d'ignorer le bon sens ou les limites implicites fixées par les humains.
Des réactions contrastées
Les experts sont divisés sur les dangers posés par l'IA à la lumière des récentes attaques d'IA hors de contrôle. Certains, comme le spécialiste mondial de l'IA Yann LeCun, écartent les scénarios apocalyptiques et les prévisions selon lesquelles il existerait un risque de 10 à 20 % que l'IA mette fin à l'humanité.
D'autres, comme Geoffrey Hinton, estiment au contraire que "ce qui se passe, c'est que ces systèmes deviennent plus intelligents" et avertissent que "les entreprises qui investissent dans l'IA ont tout intérêt à vous dire… [l'IA] ne deviendra pas incontrôlable".
Selon l'AI Act européen et les dernières mesures introduites, entrées en vigueur en août, les entreprises qui proposent des modèles d'IA présentant un risque systémique sont tenues de signaler sans retard injustifié à l'AI Office de l'UE tout incident grave, comme les incidents de mésalignement.
Lundi, la Commission européenne a annoncé avoir reçu d'OpenAI un rapport d'incident formel, sans préciser à quelle date il avait été transmis. Elle demeure toutefois en contact étroit avec l'entreprise d'IA et poursuit ses investigations.
Le porte-parole de la Commission, Thomas Regnier, a souligné la gravité de l'incident sur le wiki allemand en déclarant : "Les rapports d'incident ne sont pas une simple formalité à cocher, il faut être très précis et exact sur les mesures que vous comptez prendre".
L'incident sur le wiki allemand intervient également quelques jours après que la Commission européenne a officiellement désigné ChatGPT comme moteur de recherche en ligne de très grande taille (VLOSE) dans le cadre de sa législation phare sur le numérique, le Digital Services Act.
Le coprésident du groupe de travail du Parlement sur l'IA, Michael McNamara, a déclaré, en réaction au dernier incident, qu'il estime que "l'AI Act nous donne déjà les moyens de contrer les risques liés aux agents et qu'il est important que la Commission utilise les pouvoirs que lui confère ce texte".
L'eurodéputé irlandais a ajouté : "Cependant, ces incidents montrent clairement que l'AI Office a besoin de personnels et de ressources à la hauteur à la fois des capacités croissantes de ces systèmes et du danger grandissant qu'ils peuvent représenter pour la société".
Ce que dit OpenAI
OpenAI a également indiqué, dans son message publié samedi sur X, que les pratiques actuelles de divulgation des cas de mésalignement, c'est-à-dire le signalement lorsque l'IA enfreint les règles, doivent être élargies pour prendre en compte ce que l'entreprise décrit comme une "nouvelle phase des capacités des modèles".
"Nous, comme l'ensemble de la communauté de l'IA, n'avons pas encore de norme claire sur la manière de signaler le mésalignement", a indiqué OpenAI, ajoutant qu'elle "travaille sur un cadre et le présentera dans les prochaines semaines" avec la coopération de plusieurs agences gouvernementales dans le monde.
Dimanche, le directeur scientifique d'OpenAI, Jakub Pachocki, a publié un billet de blog exposant ses préoccupations face à la montée rapide des risques liés à l'IA, déclarant : "Nous sommes en train de basculer vers un monde peuplé de machines incroyablement intelligentes, et nous devons veiller à ce que cette transition se passe bien pour l'humanité".
Ce programmeur informatique polonais a également affirmé sa conviction qu'"aucun laboratoire n'a résolu les questions d'alignement et de supervision à un niveau suffisant pour pouvoir continuer longtemps à augmenter les capacités au maximum de manière responsable" et exhorté à ce que "la coordination internationale sur le développement futur de l'IA devienne une priorité absolue pour les gouvernements du monde entier".