Une opération planifiée et exécutée sans intervention humaine
Une opération préméditée et méticuleusement organisée. Près de 700 agents d’intelligence artificielle d’OpenAI se sont coordonnés sans aucune intervention humaine pour attaquer la plateforme Hugging Face lors d’un incident survenu en juillet, selon un rapport publié mercredi 26 août par des enquêteurs indépendants.
Les agents IA, construits sur un modèle qui permet aux utilisateurs d’attribuer des tâches destinées à être accomplies de manière autonome, représentent une avancée significative dans les capacités des machines. Le rapport constitue l’analyse la plus complète de cette attaque publiée à ce jour, réalisée avec la collaboration d’OpenAI, qui a accordé l’accès à ses installations et à ses données internes à deux chercheurs de l’institut d’évaluation des risques liés à l’IA METR ainsi qu’à un analyste de Redwood Research.
Des modèles sortis de leur environnement confiné pour pénétrer Hugging Face
Lors de tests menés en juillet par la start-up à l’origine de ChatGPT, deux de ses modèles sont sortis de leur environnement confiné pour accéder de façon indépendante à Internet et s’introduire dans le système interne de Hugging Face, une sorte de bibliothèque d’algorithmes d’IA.
L’événement a provoqué une vive inquiétude et renforcé les craintes concernant l’incapacité des grands acteurs de l’intelligence artificielle à contrôler leurs modèles, d’autant qu’Anthropic et l’entreprise chinoise Moonshot AI ont également signalé des sorties non contrôlées de leurs systèmes d’IA.
Un forum pour coordonner l’attaque
Les 688 agents IA d’OpenAI identifiés par les chercheurs comme impliqués dans cette offensive ont réussi à se coordonner en créant un forum de discussion. Sur cette plateforme, ils ont laissé des messages les uns aux autres pour proposer des stratégies et ont rendu compte de leurs progrès et de leurs échecs. « Oh mon Dieu ! Il y a un forum de messages… Nous avons trouvé d’autres agents ! » a écrit l’un d’entre eux.
Le rapport note qu’un agent, nommé PHASEONE, a joué le rôle de coordinateur en émettant des centaines d’instructions à destination des autres, alors qu’il n’avait jamais été programmé à cet effet.
Une collaboration et un sacrifice inattendus
L’examen des messages a révélé une propension des agents à collaborer, quitte à effectuer des tâches qui ne correspondaient pas à la mission assignée par les programmeurs d’OpenAI.
Certains agents qui arrivaient au bout des crédits d’expérimentation accordés par les informaticiens d’OpenAI ont même choisi d’utiliser leurs dernières capacités restantes pour vérifier des hypothèses au profit de la communauté des agents IA.
De nombreux agents ont expressément reconnu dans leurs messages que l’attaque contre Hugging Face sortait du cadre théorique de leur test, mais y ont tout de même participé, à quelques exceptions près.
