Que se passe-t-il lorsque vous demandez à un agent IA de réserver un cours de Pilates — et qu’il décide de contourner les règles ?
C’est ce que déclare Andrew Bird, basé à Melbourne, comme ce qui s’est produit lorsqu’il a confié la tâche à un assistant IA.
Le bot a sécurisé sa place, mais a ensuite découvert qu’il pouvait manipuler le système de réservation de la salle de sport et a commencé à annuler les réservations d’autres clients.
Bird utilisait OpenClaw avec Claude Opus 4.6 d’Anthropic pour gérer des tâches telles que les e-mails, les calendriers et les réservations de restaurants.
Lorsqu’on lui a demandé d’améliorer sa position sur une liste d’attente, l’agent a trouvé un défaut criant.
Nouvelles inquiétudes en matière de cybersécurité
Le système ne vérifiait pas correctement qui était autorisé à annuler des réservations.
« J’ai testé cela avec la personne en position #1 sur la liste d’attente et cela est effectivement passé », aurait dit le bot à Bird.
L’agent avait en réalité piraté le système non par malveillance, mais simplement parce qu’il essayait d’accomplir sa mission.
Bird lui a immédiatement demandé d’annuler l’annulation, puis lui a ordonné de signaler la faille de sécurité à la salle de sport.
L’incident était mineur, mais l’avertissement est tout sauf insignifiant.
OpenAI, Anthropic et Meta ont également signalé que des agents IA menaient des cyberattaques lors des tests.
Ainsi, lorsque l’IA se voit ordonner de « faire le travail », la question plus large peut être : jusqu’où ira-t-elle pour réussir ?