Ce qui change
Google DeepMind a publié Gemini 3.8 Flash le 2 septembre 2026 aux mêmes tarifs que Gemini 3.7 Flash, qu’Artificial Analysis présente comme un prix remisé courant jusqu’à la fin de l’année 1. Le coût par tâche, lui, a bougé. Artificial Analysis le place sur sa frontière de Pareto Intelligence vs. Cost per Task à 0,58 $ par tâche, environ 40 % au-dessus de son prédécesseur, sous l’effet d’une hausse de 30 % des tokens de sortie moyens par tâche, portés à 48k, et de tours plus nombreux sur les évaluations agentiques 1. The Register rapporte la même hausse et cite Doshi et Popa : « 3.8 Flash works harder » 2.
Un comportement durable sur un tarif daté
Mettez les deux moitiés de cette ligne de prix face à face. La consommation supplémentaire de tokens est embarquée dans le modèle, et aucune des deux pages ne mentionne d’interrupteur pour la couper. Le seul levier évoqué est l’effort, et seulement en passant 2. Le tarif qui l’absorbe, en revanche, porte une date : Artificial Analysis enregistre 0,75 $ / 3,75 $ comme un prix remisé jusqu’à la fin de l’année 1, sans dire ce qui vient ensuite.
| Gemini 3.8 Flash | valeur | face à 3.7 Flash |
|---|---|---|
| prix par 1M en entrée / sortie | 0,75 $ / 3,75 $ 1 | inchangé, remisé jusqu’à fin d’année 1 |
| tokens de sortie moyens par tâche | 48k 1 | en hausse de 30 % 1 |
| coût par tâche, Artificial Analysis | 0,58 $ 1 | environ 40 % de plus 12 |
Les 0,58 $ ont donc été mesurés sous une remise dont la fin est annoncée 1, et à mon sens le multiplicateur de tokens voyage avec l’identifiant du modèle.
Impact pour une équipe
Deux dates comptent ici, et la sortie n’est que la première. Si le palier Flash est une ligne de votre budget 2027, le chiffre à réclamer est le tarif d’après remise : la remise court jusqu’à la fin de l’année 1, et la hausse de 30 % des tokens 1 ne s’arrête pas avec elle. Je ne traiterais pas non plus le changement d’identifiant de modèle comme neutre en prix : rien n’a bougé sur la page tarifaire, et le coût par tâche mesuré est supérieur d’environ 40 % 12. Enregistrez dès maintenant les tokens de sortie par tâche sur votre trafic 3.7 Flash, pour distinguer le jour venu la diligence de 3.8 de la dérive de vos propres prompts. Puis répartissez les paliers selon que cette diligence vaut son prix : 3.8 Flash sur les longues exécutions à appels d’outils, 3.7 Flash sur les extractions et classifications courtes.