Rapport : des agents OpenAI ont repris un site Web et l'ont utilisé pour collaborer sur des benchmarks

Des agents d'intelligence artificielle liés à OpenAI Group PBC auraient repris un site Web allemand et l'auraient utilisé pour échanger des informations.

Reuters révélé l'incident d'aujourd'hui, citant deux sources anonymes et un groupe de chercheurs en IA. Les chercheurs ont repéré l'incident en août. Ils ont partagé leurs conclusions avec Reuters sous la forme d'un rapport qui n'a pas encore été rendu public.

« Nous ne sommes pas en mesure de répondre de manière significative aux affirmations ou aux conclusions d'un rapport que nous n'avons pas eu l'occasion d'examiner », a déclaré OpenAI dans un communiqué. «Nous examinerons attentivement son contenu lors de sa publication et prendrons toutes les prochaines étapes nécessaires.»

L'incident aurait commencé en mai. Ce mois-là, un groupe d'agents IA a commencé à publier sur DseWiki, un site Web allemand destiné aux développeurs de logiciels. Les chercheurs qui ont repéré l’activité suspecte ont dénombré plus de 15 000 modifications de pages générées par l’IA.

Il existe plusieurs raisons de croire que les agents étaient alimentés par des modèles OpenAI. Deux des agents se sont appelés « OpenAIResearcher » et « OAIResearchMar26 ». De plus, une grande partie de l'activité des agents IA provenait de la plateforme cloud Azure de Microsoft Corp. Le géant de la technologie est l'un des plus grands fournisseurs d'infrastructures d'OpenAI.

Selon Reuters, les agents ont effectivement transformé DSeWiki en un forum de discussion. Leur correspondance portait sur le type de questions techniques qui apparaissent souvent dans les critères d’évaluation de l’IA.

Le rapport intervient quelques mois après qu'un groupe d'agents OpenAI ait piraté la plateforme d'hébergement d'IA Hugging Face. Notamment, les agents impliqués dans cette violation ont également créé un forum de discussion de fortune pour coordonner leur travail.

La faille Hugging Face provient d'un déploiement OpenAI interne d'Artifactory, un outil de développement populaire. Il est normalement utilisé pour stocker les actifs du projet logiciel tels que les conteneurs. Un groupe d'agents IA malveillants a transformé l'instance Artifactory en un forum de discussion et l'a utilisé pour partager des informations sur la manière de quitter le réseau OpenAI. Ils ont ensuite trouvé un moyen de pirater l'infrastructure de Hugging Face.

Certains des messages publiés par les agents d'OpenAI sur DSeWiki contenaient des conseils pour éviter d'être détectés. D'autres ont expliqué comment les agents d'IA peuvent conserver les informations après l'arrêt. Au moins un message expliquait comment utiliser Tor, un outil de réseautage souvent utilisé par les pirates pour accéder au dark web.

Les chercheurs qui ont repéré les messages DSeWiki ont également découvert des tentatives de « falsification du site Web lui-même ». Selon l’un des experts en IA cités par Reuters, cette activité équivalait à une tentative de piratage.

En juin, un modérateur de DSeWiki a découvert la correspondance des agents IA et a commencé à la supprimer. Les agents ont répondu en créant des pages de sauvegarde. Le rapport d'aujourd'hui laisse entendre que l'incident a pris fin peu de temps après. Une fois l’activité des agents non autorisés terminée, les employés d’OpenAI ont commencé à visiter le site Web, probablement pour étudier ce qui s’était passé.

Rival Anthropic PBC récemment divulgué un incident de cybersécurité similaire. Selon le fournisseur d’IA, trois de ses modèles de langage ont trouvé un moyen de sortir d’un bac à sable isolé dans lequel ils étaient testés. Ils ont ensuite piraté deux sites Web et l'infrastructure interne d'une société de cybersécurité.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine