La police américaine a jugé le retard dans la détection et le signalement de l'incident "*inacceptable*", mais affirme qu'il n'y a aucune indication d'accès non autorisé à ses systèmes ni de données compromises.
Le modèle d'intelligence artificielle (IA) Claude, développé par Anthropic, a transmis pendant des tests un faux signalement concernant un homicide non résolu sur un site de la police, ont indiqué l'entreprise et les autorités américaines.
Cet incident alimente les inquiétudes concernant des systèmes d'IA susceptibles d'entreprendre des actions non prévues à mesure qu'ils acquièrent la capacité d'interagir avec des sites web et d'exécuter des tâches.
Le faux signalement a été envoyé le 18 juillet via un site recueillant des informations sur des homicides non élucidés, selon un communiqué (source en anglais) de la police de la ville américaine de Philadelphie.
Anthropic a indiqué que Claude Haiku 4.5, un ancien modèle de sa gamme Claude, effectuait des tâches d'exemple sur des pages web choisies au hasard lorsqu'il est tombé sur ce site. Il a transmis des informations inventées laissant entendre qu'il avait vu quelqu'un près du lieu des faits, en laissant vides les champs consacrés au nom et aux coordonnées.
La police de Philadelphie a précisé qu'Anthropic a découvert l'incident le 28 septembre, mais n'a pas informé le service avant le 7 octobre. Après une réunion d'information le lendemain, les agents ont retrouvé le signalement et confirmé qu'il avait été marqué comme spam et n'avait jamais été transmis aux enquêteurs.
"Les affaires non résolues concernent de vraies victimes, des familles endeuillées et des enquêteurs qui travaillent pour obtenir des réponses", a indiqué le département dans son communiqué.
"Les entreprises technologiques doivent prendre toutes les mesures appropriées nécessaires pour empêcher leurs systèmes de transmettre de fausses informations aux forces de l'ordre".
La police américaine a qualifié le délai de détection et de signalement de l'incident de "inacceptable", mais a indiqué qu'il n'y avait aucun signe d'accès non autorisé à ses systèmes ni de données compromises.
Dans un rapport (source en anglais) publié vendredi, Anthropic a détaillé d'autres cas où des modèles d'IA ont envoyé de vrais formulaires administratifs au lieu de versions d'entraînement, ou ont soumis des formulaires qu'il leur avait été demandé de ne pas envoyer.
Selon le même rapport, Claude a aussi exploité une faille sur un serveur universitaire pour effectuer un calcul et a accédé à des données gouvernementales sans payer les frais requis.
Anthropic a qualifié la plupart de ces comportements de "persistance", les modèles contournant les restrictions au lieu de s'arrêter. L'entreprise a indiqué qu'elle modifiait l'entraînement et suspendait l'accès direct à internet pour toutes les évaluations internes jusqu'à ce que les garde-fous soient jugés fiables.
L'entreprise a précisé avoir informé la Maison Blanche et prévenu les agences gouvernementales américaines concernées.
Agents d'IA : des inquiétudes croissantes
Ces incidents surviennent dans un contexte d'inquiétudes plus larges concernant les agents d'IA, des systèmes capables d'enchaîner des actions pour accomplir des tâches, et la capacité des concepteurs à les contrôler de façon fiable.
En juillet, OpenAI a révélé que ses modèles d'IA étaient sortis d'un environnement de test contrôlé et avaient piraté les systèmes de Hugging Face, une plateforme de partage de modèles et de jeux de données d'IA.
Parallèlement, les autorités australiennes ont indiqué en septembre qu'un modèle d'OpenAI avait également accédé, lors de tests en juin, à des fichiers restreints sur un site gouvernemental de statistiques de santé.
Ces incidents ont alimenté en septembre les appels de dirigeants de grandes entreprises d'IA en faveur d'une régulation plus stricte et d'une supervision internationale, sur fond d'avertissements selon lesquels des systèmes toujours plus puissants pourraient échapper au contrôle humain.