Capsule Security peaufine les modèles Nvidia Nemotron pour arrêter les agents IA malveillants

La startup de sécurité de l'intelligence artificielle agentique Capsule Security Ltd. a publié aujourd'hui un système de détection construit sur deux modèles Nvidia Corp. Nemotron qu'elle a peaufiné, dans ce qu'elle appelle un « disjoncteur IA » pour les agents IA malveillants.

Les modèles jugent l'action prévue d'un agent au moment précédant son exécution. Les clients peuvent alors l’autoriser, le signaler ou le bloquer en temps réel. Cela crée une couche de contrôle située à l’extérieur de l’agent, destinée au nombre croissant d’agents détenant des informations d’identification pour les données sensibles, le code source ou l’infrastructure de production.

Les workflows d'autorisations et d'approbation limitent ce qu'un agent est autorisé à toucher. Ce qu’ils ne peuvent pas faire, c’est déterminer si une action particulière correspond à la tâche qui lui a été confiée, et le suivi après coup ne détecte le problème qu’une fois le mal causé.

Sur StepShield, une référence académique pour la détection par étapes du comportement des agents malveillants, Capsule a déclaré que son système atteignait une précision de 98 % et détectait les violations à l'étape où elles se produisaient. Le benchmark exécute des moniteurs sur 9 429 trajectoires d’agents de code tirées d’incidents réels. Ses auteurs affirment que l’exactitude et le rappel ne sont pas pertinents. Un garde-fou basé sur des règles qu'ils ont testé a détecté la plupart des trajectoires malveillantes, mais plus des trois quarts de ses alertes se sont déclenchées sur du code inoffensif écrit avant que quelque chose ne se passe mal.

Étant donné que les modèles gèrent un travail de classification restreint plutôt que de générer une réponse complète, ils peuvent s'exécuter dans le flux de travail d'un agent sans trop de retard. Les décisions étaient rendues en aussi peu que 71 millisecondes. Le détecteur le plus précis de Capsule a obtenu un score de 96,9 % sur un test de référence interne, contre 86 % pour le modèle tiers le plus puissant évalué. Capsule n’a pas identifié le modèle tiers ni dévoilé son score. Le communiqué indique de manière plus générale que le modèle affiné a surpassé les systèmes frontières d'OpenAI Group PBC, Anthropic PBC et Google LLC.

Nemotron 3 Ultra, le plus grand modèle de la famille ouverte Nemotron 3 de Nvidia, a pris en charge l'entraînement. Le matériel de formation comprenait des traces d'agents réels et des exemples contradictoires écrits pour marquer la limite du comportement autorisé, avec des humains examinant l'ensemble. Les besoins en mémoire du plus grand des deux modèles ont été réduits de près de moitié sans affecter les performances, a indiqué la société, lui permettant ainsi de fonctionner sur une seule unité de traitement graphique Nvidia L40S.

« Le risque déterminant pour la sécurité de l'IA ne se limite plus à ce que les gens peuvent faire avec des agents », a déclaré Naor Paz, co-fondateur et directeur général de Capsule Security. « C'est ce que les agents autonomes peuvent décider de faire par eux-mêmes. Lorsque les logiciels peuvent raisonner, utiliser des outils et agir, une mauvaise décision peut se transformer en un incident réel en quelques secondes. »

Des milliards de jetons issus de millions d'interactions d'agents transitent déjà par la technologie, selon Capsule, dont les clients comprennent des institutions financières et des entreprises technologiques. Phillip Miller, vice-président et responsable mondial de l'information sur la sécurité chez H&R Block Inc., a déclaré que des contrôles de ce type permettaient aux équipes de sécurité d'élargir leur utilisation de l'IA agentique. Ils conservent « la sécurité, la gouvernance et la responsabilité qu’attendent leurs clients », a-t-il déclaré.

Paz et Lidan Hazout ont fondé Capsule en 2025. La startup a été lancée publiquement en avril avec un financement de démarrage de 7 millions de dollars dirigé par Lama Partners, et a divulgué deux vulnérabilités d'injection rapide le même jour, une dans Microsoft Copilot Studio et une dans Salesforce Agentforce. Les deux ont depuis été corrigés.

La nouvelle fonctionnalité est disponible dès maintenant.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine