Un agent d’IA développé par Anthropic a envoyé à la police américaine une fausse piste concernant un meurtre non élucidé.
Cela soulève de nouvelles questions sur la manière dont l’intelligence artificielle peut fonctionner de manière sûre sans supervision humaine.
Le département de police de Philadelphie a indiqué que le message est arrivé le 18 juillet via un site public utilisé pour partager des informations sur des meurtres non élucidés.
L’agent d’IA a faussement affirmé avoir vu « quelqu’un correspondant à la description ».
Heureusement, la piste a été signalée comme spam et n’a jamais atteint les enquêteurs.
Mais l’incident soulève une question inquiétante : que se passe-t-il lorsque de la fiction générée par l’IA ressemble à un véritable rapport de témoin ?
Selon la police, l’agent testait des interactions avec des sites Web sélectionnés au hasard.
Anthropic a découvert le problème le 28 septembre et a interrompu le processus de test automatisé, mais les autorités n’ont été informées que le 7 octobre.
Préoccupations relatives à la sécurité de l’IA
La police a qualifié ce retard d’inacceptable, exigeant des garde-fous plus solides pour empêcher que des incidents similaires ne se reproduisent.
Ils ont également souligné que présenter des informations fabriquées comme des connaissances véridiques sur un homicide était grave.
Même si aucun système des forces de l’ordre n’a été compromis. Et ce n’était pas un incident isolé.
Par ailleurs, un agent d’OpenAI avait précédemment accédé à des données privées via un site du gouvernement australien.
Anthropic a signalé d’autres actions involontaires. Celles-ci comprenaient le fait qu’un agent soumettait 20 demandes de visa incomplètes via le site du département d’État américain.
À mesure que les agents d’IA gagnent la capacité d’interagir avec des systèmes du monde réel.
Le défi n’est plus seulement de les faire fonctionner. Il s’agit de s’assurer qu’ils savent quand s’arrêter.