Anthropic PBC a étendu aujourd'hui son programme de cybervérification à trois niveaux d'accès pour les équipes de sécurité contrôlées, avec moins de blocages sur le travail de cybersécurité à chaque étape.
La refonte vise une restriction Anthropic intégrée à ses propres produits. Parce que l’entreprise considère la cybersécurité comme un double usage, ses modèles généralement disponibles comportent des classificateurs conservateurs qui bloquent la plupart des cyber-travail. Lorsque Claude Opus 5.5 a été lancé le 22 septembre, la plupart des tâches de sécurité qui lui étaient envoyées étaient acheminées vers l'ancien Opus 4.8.
Anthropic intègre simultanément le projet Glasswing au programme. Depuis avril, Glasswing a donné à Claude Mythos accès aux organisations qui sécurisent les logiciels critiques, et Anthropic l'a étendu à 150 organisations supplémentaires en juin. Claude Opus 5.5, Claude Sonnet 5.5 et Claude Mythos 5.1 sont disponibles à chaque niveau de la nouvelle structure, et les modèles ultérieurs seront ajoutés au fur et à mesure de leur expédition.
Defense Access est le niveau d'entrée, destiné aux tâches défensives telles que la réponse aux incidents et l'ingénierie inverse des logiciels malveillants. Les équipes de sécurité qui défendent les systèmes qu'elles possèdent ou entretiennent sont qualifiées, qu'elles travaillent pour une entreprise, une université ou un organisme gouvernemental.
Les chercheurs individuels ayant un historique de vulnérabilités signalées peuvent également postuler, tout comme les opérateurs d’infrastructures critiques aussi petits qu’un hôpital régional. Anthropic s'attend à ce que de nombreuses organisations effectuant un travail défensif soient qualifiées et vise à répondre aux candidatures dans quelques jours.
Red Team Access ouvre la voie aux tests d'intrusion autorisés et au red-teaming sur les systèmes qu'une organisation est autorisée à tester. Même à ce niveau, les classificateurs d'Anthropic bloquent les requêtes en temps réel lorsque le travail s'oriente vers quelque chose comme le déploiement d'un ransomware. Les candidats attendent quelques semaines pour un examen et entre-temps passent au niveau d'accès à la défense, et les chercheurs individuels sont exclus du niveau pour le moment.
L'accès spécialisé contient le moins de cyberblocs des trois. Seules les organisations autorisées à tester des systèmes de sécurité tels que les réseaux électriques et les réseaux de télécommunications sont éligibles, car des défaillances dans ces domaines pourraient mettre des vies en danger ou perturber les marchés. Anthropic examine chacun d'eux en profondeur avec le gouvernement américain, et les membres Glasswing existants accèdent directement au niveau sans réapprobation pour les modèles actuels.
Les organisations inscrites doivent autoriser la conservation des données afin qu'Anthropic puisse surveiller toute utilisation abusive. Enterprise Frontier Safeguards, prévu plus tard cette année, permettra aux clients éligibles de conserver ces données dans l'infrastructure cloud qu'ils contrôlent.
Anthropic a testé les niveaux sur le benchmark des cyberopérations en plusieurs étapes CyScenarioBench, avec Claude Opus 5.5 exécutant chacun de ses 10 défis cinq fois. Chaque tentative sans accès au programme était bloquée à la première invite. Parce que les scénarios sont offensifs, Anthropic s'attendait à un blocage important au niveau d'accès à la défense, où 46 des 50 exécutions ont été arrêtées à un moment donné.
Au niveau Red Team, rien n'a été bloqué et le modèle a terminé 34 de ses 50 runs. Anthropic a déclaré que le résultat est effectivement le même que le taux de réussite de 67,6 % du modèle sans aucune garantie appliquée.
En dehors du laboratoire, l’argument en faveur d’un élargissement de l’accès vient du programme Mythos absorbé par la nouvelle structure. Les partenaires du projet Glasswing ont découvert au moins 129 000 vulnérabilités vérifiées entre avril et juillet, et l'analyse du code open source effectuée par Anthropic en a révélé 5 500 supplémentaires jusqu'en octobre. Sur ce total combiné, plus de 33 000 ont été classés comme étant de gravité critique ou élevée.
Les chiffres s'appuient sur seulement 33 rapports de partenaires, et la société a déclaré que l'impact réel était probablement au moins cinq fois plus élevé. Moins de la moitié des partenaires ont divulgué le nombre de correctifs, souvent parce que des correctifs étaient encore en cours.
Le programme est disponible via la plateforme Claude, Vertex AI de Google LLC et le service Foundry de Microsoft Corp. Sur Bedrock d'Amazon Web Services Inc., il est limité aux clients éligibles aux sauvegardes Enterprise Frontier.