Ce qui change
Google DeepMind a présenté Gemini 3.5 Flash Cyber le 21 juillet 2026, a publié ses mesures, puis a renoncé à le vendre. Sur le moteur JavaScript V8, ce modèle spécialisé a remonté 55 problèmes uniques confirmés, contre 47 pour Gemini 3.5 Flash en version courante et 36 pour Claude Opus 4.6, dont 10 que les deux autres avaient manqués 12. Tout passe par CodeMender, l’agent de découverte et de correction de vulnérabilités dévoilé en octobre 2025 2, et seulement pour des « gouvernements et partenaires de confiance », dans un « programme pilote à accès limité » 1. Google assume le motif: « la nature à double usage de cette technologie » impose « une approche intentionnelle » de son déploiement 1.
| Modèle | Problèmes uniques confirmés sur V8 |
|---|---|
| Gemini 3.5 Flash Cyber | 55 12 |
| Gemini 3.5 Flash (version courante) | 47 12 |
| Claude Opus 4.6 | 36 12 |
Ce que le benchmark dit vraiment
C’est la ligne du milieu qui compte. 55 contre 47, c’est un modèle face à lui-même: même base, même cible, un post-entraînement d’écart. À mon avis, c’est là le vrai résultat, bien plus que le scalp du modèle frontière, et il fragilise la clôture. Les découvertes supplémentaires viennent d’une recette d’entraînement et d’un harnais d’évaluation; or une recette ne s’enferme pas dans un datacentre. Restreindre la distribution fait gagner du temps, pas de la sécurité.
L’objection la plus solide est architecturale plutôt que contractuelle: comme le modèle ne tourne qu’à l’intérieur de CodeMender, les garde-fous activent ses fonctions défensives et désactivent le reste des activités cyber à la frontière de l’agent 2. Le procédé vaut mieux qu’une consigne rangée dans un prompt système, et je l’adopterais tel quel. Il protège ces poids-là. En revanche, il ne protège pas la capacité, qui vit dans une chaîne d’entraînement qu’une équipe bien financée sait reconstruire.
L’asymétrie retombe sur les défenseurs. Wiz et Cloud CISO Security Engineering testent depuis l’intérieur du pilote 1 et disposent du relevé des 55 problèmes sur V8. Les autres auditent le même code ouvert avec 47 et 36.
Impact pour une équipe
Construisez le harnais, pas la liste des modèles auxquels vous espérez accéder. L’écart entre 55 et 47 est la mesure utile, parce qu’il chiffre la part qui vous revient: ce qu’un post-entraînement spécialisé et une boucle de validation apportent face à un modèle de base, sur votre code. Partez d’un modèle appelable. La grille tarifaire de l’API Gemini affiche gemini-3.5-flash et gemini-3.6-flash à 1.50 dollar par million de tokens d’entrée 3, et la ligne « version courante » du tableau, c’est les 47. Lancez-le sur un dépôt dont vous connaissez les défauts, ne gardez que ce qu’un reproducteur confirme, et comptez les problèmes confirmés plutôt que le volume produit. Ce décompte devient votre référence, et les chiffres de Google disent qu’il est déplaçable.