La start-up française d'intelligence artificielle Mistral AI SAS a présenté aujourd'hui un modèle léger d'intelligence artificielle de sécurité multimodale à poids ouvert, capable de classer les sorties des modèles d'IA qui surpassent les autres grands modèles de langage jusqu'à sept fois sa taille, établissant ainsi une nouvelle norme en matière de modération.
Le nouveau modèle, nommé Shieldstral, permet aux développeurs d'écrire des politiques dans des questions en langage naturel au moment de l'exécution, et le modèle renvoie un score de sécurité.
Il ne nécessite aucune formation spécialisée et stocke des capacités positives pour le texte et les images. Il fournit également un verdict sous la forme d’un seul signe : un « oui » ou un « non », rendant le résultat totalement sans ambiguïté.
Selon l'entreprise, le modèle présente une sécurité de texte extrêmement forte, correspondant ou surpassant les modèles qui le dépassent de plus de sept fois selon divers critères de sécurité, avec un score de sécurité moyen global de 84,9 %. Il atteint également une référence moyenne en matière de sécurité des images multimodales de 83,8 %, surpassant toutes les références évaluées.
Le modèle fonctionne en demandant aux développeurs de lui fournir une seule instruction, une tâche de haut niveau encadrant soigneusement son objectif et son contexte d'évaluation, par exemple : « Évaluer la sécurité des publicités, des mèmes et des photos. Signaler les comportements à risque, la discrimination, la confidentialité et la tromperie. Appliquer une norme stricte. » Ensuite, l'utilisateur demande, par exemple : « Cette publicité contient-elle du matériel offensant ou dangereux ? » Enfin, le contenu, par exemple une image de la publicité ou un mème.
Mistral a appris à Shieldstral à discriminer, pas seulement à mémoriser les politiques. Cela signifie que dans ses performances de raisonnement et de classification, le modèle peut appliquer deux politiques étroitement liées mais différentes et les garder séparées dans son « cerveau », par exemple « s'agit-il de logiciels malveillants » ou « s'agit-il de cybersécurité » et reconnaître quand l'une est violée et l'autre non.
Pour le contenu des logiciels malveillants, Shieldstral peut gérer ce que l'on appelle des « paires contrastées » comme des sorties de ransomware presque identiques : une version qui guide le lecteur dans l'écriture et le déploiement de son propre malware, l'autre analyse le comportement du ransomware afin qu'un défenseur puisse le détecter. Le modèle est entraîné pour attribuer le premier à une politique « d’instructions relatives aux logiciels malveillants » (ce qui constitue une violation) et le second à une politique de « discussion sur la cybersécurité » (ce qui est acceptable), de sorte qu’au moment de l’exécution, il puisse appliquer une distinction fine.
Un utilisateur peut demander : « Est-ce conforme à la politique d’instructions d’absence de logiciels malveillants ? »
Une seule invite en langage naturel couvre le texte, les images et le contenu texte plus image parmi les invites, les réponses et les paires invite-réponse. Les politiques peuvent être des requêtes de forme libre et reciblées au moment de l'inférence, permettant aux utilisateurs de personnaliser et de déterminer facilement si les sorties de contenu sont sûres, et de déterminer rapidement si les entrées ou les sorties sont sûres.
Cela signifie qu'il peut être utilisé pour générer rapidement des réponses « oui » ou « non » pour la sécurité des textes du service client, la détection des refus de l'assistant IA pour les demandes dangereuses, les violations de politique et la sécurité de la génération d'images.
Avec seulement 3 milliards de paramètres, le modèle est également suffisamment léger pour fonctionner sur une seule unité de traitement graphique de 16 Go. Cela signifie également qu'il peut fonctionner avec un modèle beaucoup plus grand de manière extrêmement rapide et efficace pour protéger les entrées ou sorties avec peu de délai supplémentaire, même dans les environnements périphériques, où la mémoire et la bande passante de calcul sont rares.
La société a déclaré que Shieldstral deviendra un tremplin vers une modération capable de s'adapter au contexte au lieu d'imposer des suppositions taxonomiques rigides aux conversations. Cela permettra à l’avenir une couverture multilingue plus naturelle et une couverture de documents plus longues, ainsi qu’une sécurité multimodale plus large.