Trois semaines seulement après son dernier grand modèle linguistique libérerGoogle LLC a lancé aujourd'hui Gemini 3.8 Flash et Gemini 3.8 Flash Cyber.
Les deux LLM reposent sur le même socle technique. La principale différence est que Gemini 3.8 Flash est un modèle à usage général tandis que Gemini 3.8 Flash Cyber est conçu pour les chercheurs en cybersécurité. Ce dernier algorithme est disponible via une nouvelle initiative d'accès anticipé, le programme Fairwind, qui a également fait ses débuts aujourd'hui.
Google a mis Gemini 3.8 Flash à l'épreuve en lui faisant réaliser 16 tests d'intelligence artificielle. Selon Google, il a surpassé Claude Opus 5 et GPT 5.6 Sol dans neuf des tests.
L'une des évaluations que le modèle a complétées avec plus de précision est Terminal-Bench 1.1, qui mesure la capacité des LLM à aborder des tâches de codage en plusieurs étapes. Les autres critères couvraient des cas d'utilisation tels que l'analyse de données financières et la compréhension de graphiques.
Gemini 3.8 Flash a également atteint des performances compétitives sur les benchmarks que les LLM rivaux ont mieux complétés. Il a obtenu un score de 73,7 % sur DeepSWE-1.1, qui évalue la capacité des modèles d'IA à automatiser les tâches de codage à long terme. Cela place Gemini 3.8 Flash 1% devant GPT-5.6 Sol et quelques fractions de pour cent derrière Opus 5.
« Ces gains de performances proviennent d'un choix de conception de base : 3.8 Flash travaille plus dur », ont écrit les dirigeants de Google, Tulsee Doshi et Raluca Ada Popa, dans un communiqué. article de blog. « Sur des tâches complexes, il fait preuve d'une plus grande diligence en exécutant des étapes de raisonnement supplémentaires et en appelant les outils de manière itérative. Parfois, le modèle peut utiliser plus de jetons pour maximiser les performances, en particulier à des niveaux d'effort plus élevés. »
Gemini 3.8 Flash Cyber, l'autre LLM présenté aujourd'hui par Google, offre également des performances compétitives. Il a obtenu un score de 86,2 % au benchmark CyberGym, qui teste la capacité des LLM à détecter les vulnérabilités dans le code C et C++. Claude Mythos 5 a obtenu un score de 83,8 % tandis que GPT-5.6 Sol a obtenu un score de 83,6 %.
Gemini 3.8 Flash Cyber est disponible via un programme d'accès anticipé appelé Fairwind Program. Il est ouvert aux agences gouvernementales, aux opérateurs d'infrastructures critiques et aux entreprises technologiques chargées de « sécuriser les bases logicielles généralisées ».
Google indique qu'il y a plus de 650 participants au lancement. Le groupe comprend Snowflake Inc., CrowdStrike Holdings Inc., Datadog Inc. et d'autres grandes sociétés de logiciels.
Les participants au programme Fairwind peuvent utiliser Gemini 3.8 Flash Cyber avec une technologie appelée CodeMender. Il s'agit d'un harnais, d'un ensemble d'invites, de fichiers de code et d'autres ressources techniques. CodeMender a été créé par Google DeepMind pour améliorer la capacité des LLM à trouver des vulnérabilités, à évaluer leur gravité et à développer des correctifs.
Les ingénieurs de Google utilisent Gemini 3.8 Flash Cyber en interne pour accélérer leur travail. Selon la société, les développeurs de Chrome ont constaté que le LLM produisait « 2,6 fois plus de correctifs corrects » pour les vulnérabilités du navigateur que ses concurrents. Une autre équipe de Google a utilisé Gemini 3.8 Flash Cyber pour trouver une « vulnérabilité fondamentale critique » qu’il aurait fallu des mois pour découvrir manuellement.