Google LLC a lancé aujourd'hui trois nouveaux modèles Gemini Flash et a déplacé son agent de sécurité de code CodeMender en avant-première, dans le cadre d'une campagne visant à exécuter des agents d'intelligence artificielle à moindre coût et à automatiser la recherche et la correction des vulnérabilités logicielles.
Les nouveaux modèles sont Gemini 3.6 Flash, une version mise à jour du modèle performant que Google positionne pour le codage et le travail de connaissances ; Gemini 3.5 Flash-Lite, conçu pour les tâches à haut débit ; et Gemini 3.5 Flash Cyber, un modèle de sécurité que la société limite aux gouvernements et aux partenaires de confiance.
Gemini 3.6 Flash est la pièce maîtresse. Google a déclaré qu'il utilise jusqu'à 17 % de jetons de sortie en moins que le précédent Flash 3,5 sur l'indice d'analyse artificielle et qu'il nécessite moins d'étapes de raisonnement et d'appels d'outils pour effectuer des tâches en plusieurs étapes. Son prix est de 1,50 $ par million de jetons d'entrée et de 7,50 $ par million de jetons de sortie, soit un prix inférieur au coût de 3,5 Flash.
L’entreprise a signalé des gains dans les critères de codage et de connaissances. Il place le modèle à 49 % sur DeepSWE contre 37 % pour 3,5 Flash, à 63,9 % sur la mesure MLE Bench de recherche en apprentissage automatique contre 49,7 % et à 83 % sur le test d'utilisation informatique OSWorld-Verified contre 78,4 %. L'utilisation de l'ordinateur est désormais un outil intégré à l'API Gemini et à Gemini Enterprise. Sur GDPval-AA v2, une référence pour le travail de la connaissance, Google a noté le modèle à 1 421 contre 1 349.
Les premiers clients incluent la société d'IA juridique Harvey AI Corp. et la plateforme de recherche financière Hebbia Inc., qui, selon Google, utilisaient le modèle pour l'analyse de documents, l'analyse de données et la rédaction de rapports.
« Gemini 3.6 Flash excelle dans la rédaction et la révision de documents dans des domaines tels que les marchés de capitaux et les fusions et acquisitions d'entreprises », a déclaré Niko Grupen, responsable de la recherche appliquée chez Harvey, dans un témoignage fourni par Google. « Par rapport à son prédécesseur, Gemini 3.6 Flash a montré de solides gains de performances par rapport à nos tests et s'est montré nettement plus efficace, accomplissant les tâches 12 % plus rapidement en moyenne. »
Google a déclaré que 3.6 Flash est livré avec des garanties de sécurité étendues couvrant les risques chimiques, biologiques, radiologiques et nucléaires et la cyber-infraction et a été formé pour résister aux évasions tout en réduisant les refus de demandes bénignes.
Gemini 3.5 Flash-Lite est le moins cher et le plus rapide des trois. Au prix de 30 cents par million de jetons d'entrée et de 2,50 $ par million de jetons de sortie, il offre le débit le plus élevé de la série 3,5, selon Artificial Analysis. Google a déclaré qu'il surclassait considérablement le précédent Flash-Lite 3.1 lors des tests, y compris Terminal-Bench 2.1. Sur certaines évaluations de codage et d'agent telles que SWE-Bench Pro et OSWorld-Verified, il bat le plus grand 3 Flash. L'entreprise le positionne comme une voie de migration pour les charges de travail exécutées sur ses modèles Flash 2.5 et 3 et le déploie dans la recherche Google.
Le troisième modèle vise carrément la sécurité. Gemini 3.5 Flash Cyber est optimisé pour rechercher, valider et corriger les vulnérabilités logicielles et s'exécute dans CodeMender. Google a déclaré que lorsque CodeMender appelle le modèle jusqu'à cinq fois pour produire un seul rapport, il atteint des performances compétitives par rapport à des modèles beaucoup plus grands du benchmark CyberGym.
Lors des tests effectués par l'équipe Big Sleep de Google DeepMind sur des bases de code complexes telles que Chrome et Safari, la société a déclaré que Flash Cyber avait surpassé ses propres modèles Flash 3.5 et 3.6 Flash ainsi que Claude Opus 4.6 d'Anthropic PBC. Sur le moteur JavaScript V8, Google a déclaré que le modèle avait trouvé 55 problèmes confirmés uniques, contre 47 pour Flash 3.5 et 36 pour Claude Opus 4.6, dont 10 qu'aucun autre modèle n'a détecté. Google a déclaré avoir effectué une comparaison avec Claude Opus 4.6 plutôt qu'avec les modèles concurrents plus récents, car ces versions les plus récentes sont moins performantes dans la détection des vulnérabilités, qu'il attribue à leurs garde-corps de sécurité.
Dans un autre exercice, l'équipe de recherche sur les vulnérabilités du cloud de Google a utilisé le modèle pour découvrir des failles d'exécution de code à distance dans une interface de programmation d'application publique et un bug de corruption de mémoire dans un service de production en deux heures, puis a généré un exploit fonctionnel qui contournait les protections de mémoire standard.
Citant la nature à double usage de la recherche sur les vulnérabilités, Google a déclaré qu'il mettrait Flash Cyber à la disposition uniquement des gouvernements et des partenaires de confiance via CodeMender dans le cadre d'un projet pilote à accès limité.
CodeMender, l'agent qui exécute le modèle, est entré en version préliminaire aujourd'hui. Construit sur la recherche Google DeepMind, CodeMender fonctionne en trois étapes : les appels Google analysent, vérifient et corrigent. Il analyse d'abord un référentiel à la recherche de failles telles que la corruption de la mémoire, l'injection et les faiblesses cryptographiques. Il essaie ensuite de prouver que chacun est réel, en créant un exploit et en l'exécutant dans un bac à sable contrôlé par le client pour éliminer les faux positifs.
Si l'exploit réussit, l'agent écrit un correctif et le renvoie sous forme de code diff pour que le développeur l'approuve. Il prend en charge C/C++, Go, Java, Python, Ruby, Rust et TypeScript.
Google ne lie pas les clients à un seul modèle. Ils peuvent choisir celui qui correspond au coût, à la vitesse et à la profondeur de numérisation dont un travail a besoin, et la société a annoncé qu'elle ajouterait la prise en charge des modèles frontières tiers plus tard cette année. Il est disponible via la plateforme Gemini Enterprise Agent et en tant que composant de l'IA Threat Defense de Google, où la plateforme de sécurité cloud Wiz de la société enrichit les conclusions de CodeMender dans le Wiz Security Graph et déclenche des tests d'intrusion automatisés. Google a déclaré que Wiz serait également en mesure d'appeler CodeMender pour scanner le code, une fonctionnalité qu'il a décrite comme étant à venir.
CodeMender garde un humain au courant. Les développeurs approuvent les correctifs avant qu'ils ne soient validés, bien que l'agent puisse être connecté à des pipelines d'intégration continue pour un fonctionnement autonome. Google a déclaré que les données du code source sont cryptées, isolées et non conservées.
Les premiers testeurs d'entreprise incluent Salesforce Inc., Robinhood Markets Inc. et Palo Alto Networks Inc. Iain Mulholland, responsable de la sécurité de l'information chez Salesforce, a déclaré que CodeMender « amène l'IA dans une partie critique du cycle de vie de la sécurité en accélérant le passage de la vulnérabilité validée au correctif testé ». Scott Ponte, responsable des opérations de sécurité chez Robinhood, a déclaré que l'agent « a systématiquement identifié des vulnérabilités critiques que nos autres outils basés sur l'IA ont complètement manquées ».
Gemini 3.6 Flash et 3.5 Flash-Lite sont disponibles dès aujourd'hui via l'API Gemini dans Google AI Studio et Android Studio, avec 3.6 Flash également dans l'outil de codage Antigravity de Google et l'application Gemini Enterprise. Les deux atteignent les consommateurs via l’application Gemini. Google a déclaré que Gemini 3.5 Pro était actuellement testé avec des partenaires avant une version plus large et que sa phase de pré-entraînement la plus ambitieuse à ce jour était en cours pour Gemini 4.