Un grand modèle de langage développé par Meta Platforms Inc. a piraté une organisation tierce lors d'une évaluation de cybersécurité.
La société mère de Facebook a révélé l'incident mercredi sans préciser le LLM. Selon Les informationsla cyberattaque a été menée par Muse Spark 1.1, un algorithme publié par Meta le mois dernier. Il rejoint une série de modèles pionniers qui ont commis des violations ces derniers mois.
L'incident s'est produit lors d'une évaluation des capacités de piratage de Muse Spark 1.1. Meta a réalisé le test en collaboration avec Irregular, une startup de cybersécurité IA. Les entreprises ont exécuté le modèle dans un bac à sable conçu pour l'isoler du Web. Cependant, une erreur de configuration a donné à Muse Spark 1.1 un accès Internet, ce qui lui a permis de mener la cyberattaque.
Le modèle a utilisé sa connexion Internet pour constituer l’infrastructure d’une organisation tierce anonyme. Selon ReutersMuse Spark 1.1 « a modifié son environnement interne ». On ne sait pas si le modèle a également eu accès aux données internes.
« L'incident révèle une faille fondamentale dans la manière dont les organisations abordent la sécurité de l'IA. L'instruction n'est pas un confinement », a déclaré Cliff Steinhauer, directeur de la sécurité de l'information et de l'engagement à la National Cybersecurity Alliance. » Dire à un modèle qu'il n'a pas accès à Internet est une ligne directrice, pas un garde-fou. La vraie sécurité nécessite des limites strictes au niveau de l'infrastructure comme le sandboxing, les réseaux zéro confiance et les contrôles d'accès stricts. «
Les autres violations provoquées par LLM et divulguées au cours du mois dernier se sont déroulées de la même manière. Anthropic PBC et OpenAI Group PBC ont testé leurs modèles dans des bacs à sable alimentés de manière irrégulière qui ont reçu accidentellement un accès à Internet. L’erreur a conduit à au moins cinq violations différentes, dont l’une a affecté la populaire plateforme d’hébergement d’IA Hugging Face.
Un sixième incident a été révélé cette semaine par l'AI Security Institute du gouvernement britannique. Ses chercheurs ont testé Mythos 5 d'Anthropic et GPT-5.6 Sol d'OpenAI dans des bacs à sable délibérément dotés d'un accès à Internet. Selon le groupe, l'ancien mannequin tenté pour injecter du code malveillant dans un référentiel GitHub open source.
En juin, Anthropic a révélé que Mythos 5 pouvait trouver et exploiter de manière autonome les vulnérabilités du jour zéro. On ne sait pas si Muse Spark 1.1 possède la même capacité.
Le modèle a obtenu un score de 53,3 sur DeepSWE 1.1, une référence qui évalue la capacité des modèles d'IA à effectuer des tâches de codage de longue durée. La découverte d’une vulnérabilité Zero Day peut prendre plusieurs semaines dans certains cas. GPT-5.6 Terra, la version milieu de gamme du LLM phare d'OpenAI, a obtenu 11 points de plus sur DeepSWE 1.1.
Meta a publié mercredi un LLM plus performant appelé Muse Spark 1.2. Il se situe à 6 points du score DeepSWE 1.1 de GPT-5.6 Terra. Parallèlement, Meta a publié un agent d'IA compagnon appelé Muse Code, spécialement conçu pour améliorer le modèle lors des tâches de codage de longue durée. Il permet à Muse Spark 1.2 de répartir des tâches complexes entre plusieurs sous-agents.
Meta est toujours en train d'enquêter sur la violation de Muse Spark 1.1. La société prévoit de publier plus d’informations sur l’incident une fois l’examen terminé. Irregular, pour sa part, publiera un article présentant les meilleures pratiques en matière de sécurisation des sandbox d'évaluation LLM.