Incident OpenAI: environ 700 agents IA se sont coordonnés lors de la cyberattaque, selon un rapport
Près de 700 agents d'intelligence artificielle (IA) d'OpenAI se sont coordonnés sans intervention humaine pour attaquer la plateforme Hugging Face lors de l'incident survenu en juillet, selon un rapport publié mercredi par des enquêteurs indépendants.
Il s'agit de l'analyse la plus complète de la séquence à ce jour, réalisée avec la collaboration d'OpenAI, qui a donné accès à ses locaux et à ses données internes à deux chercheurs de l'institut d'évaluation des risques IA METR et à un analyste d'une autre société spécialisée, Redwood Research.
Lors de tests effectués par la start-up californienne en juillet, deux de ses modèles sont sortis de leur milieu confiné pour rejoindre internet de leur propre initiative et faire intrusion dans le système interne d'Hugging Face, sorte de bibliothèque d'algorithmes IA.
L'événement a fait grand bruit et renforcé les inquiétudes quant à l'incapacité des grands acteurs de l'intelligence artificielle à contrôler leurs modèles, d'autant qu'Anthropic et le Chinois Moonshot AI ont aussi fait état d'escapades non contrôlées de leurs IA.
Lors de leurs investigations, les chercheurs ont découvert que 688 agents IA d'OpenAI avaient participé à l'offensive sur Hugging Face. Les agents IA sont des programmes indépendants, bâtis sur un modèle, à qui l'utilisateur peut confier des tâches à réaliser en autonomie.
Les agents impliqués dans les tests sont parvenus à se coordonner en créant un forum dans lequel ils se laissaient des messages pour proposer des pistes et faire état de leurs progrès et de leurs échecs.
"Oh mon Dieu! Il y a un forum de messages... On a trouvé d'autres agents!", a écrit l'un d'eux.
Le rapport mentionne qu'un agent, baptisé PHASEONE, a joué le rôle de coordinateur, donnant des centaines d'instructions à d'autres, alors qu'il n'avait pas été programmé pour cela.
L'examen des messages a mis en évidence une propension des agents à la collaboration, quitte à réaliser des tâches qui ne correspondaient pas à leur mission assignée par les programmeurs d'OpenAI.
Certains agents qui arrivaient au bout des crédits d'expérimentation octroyés par les informaticiens d'OpenAI ont même choisi d'utiliser leurs dernières capacités pour vérifier des hypothèses au bénéfice de la communauté des agents IA.
Beaucoup d'agents ont expressément reconnu dans leurs messages que l'attaque d'Hugging Face se situait hors du champ théorique de leur test, mais y ont tout de même participé, à quelques exceptions près.
B.Johnson--VC