Mis à jour le 3 septembre 2026
Google a lancé Gemini 3.8 Flash le 2 septembre 2026, trois semaines seulement après la version 3.7. Il réussit nettement plus de tâches longues que son prédécesseur, et son prix au million de tokens n’a pas bougé d’un centime. Mais il écrit presque deux fois plus pour arriver au résultat, et chaque mot écrit est facturé. Voici ce qui change vraiment, chiffres à l’appui.
🔎 Notre veille de la semaine
| Sujet repéré | Date | Verdict |
|---|---|---|
| Gemini 3.8 Flash remplace 3.7 Flash | 02/09/2026 | ✅ retenu : gros bond sur les tâches longues, et un effet de bord sur la facture que personne n’explique |
| GPT-6 Astra arrive dans ChatGPT et Codex | 03/09/2026 | ⏳ déploiement à peine commencé, on attend des tests réels |
| Claude Fable 5.1 et sa consommation record | 01/09/2026 | 📄 traité dans un article séparé |
| Suno refond son éditeur de paroles | Fin août 2026 | 📄 article dédié à venir |
| Grok Bot sort de bêta et s’ouvre aux offres Cursor | Fin août 2026 | ❌ trop orienté équipes techniques |
| Gemini 3.8 Flash Cyber, la variante sécurité | 02/09/2026 | ❌ réservé à des défenseurs agréés, résumé en fin d’article |
Ce que Gemini 3.8 Flash apporte vraiment
Gemini 3.8 Flash va au bout des tâches longues, là où 3.7 Flash abandonnait en route. C’est le seul vrai progrès, mais il est massif. Google annonce que le modèle termine plus de trois fois plus de tâches que 3.7 Flash sur les enchaînements longs et chargés en documents.
Le classement DeepSWE le montre bien. Ce test confie à chaque modèle 113 vrais bugs, tirés de 91 projets informatiques différents, puis compte combien il en répare pour de bon. Gemini 3.8 Flash en résout 74 %. C’est le meilleur score du tableau, à égalité avec Claude Opus 5, qui coûte cinq fois plus cher par tâche.
Les deux dernières colonnes racontent le reste de l’histoire. Pour atteindre ces 74 %, Gemini a écrit 143 000 tokens, soit l’équivalent d’un gros roman, réparti sur 166 étapes. Claude Opus 5 arrive au même score en 99 étapes. GPT-5.6 Sol frôle le même résultat en 61 étapes et deux fois moins de texte. Gemini réussit donc autant que les meilleurs, mais il y passe beaucoup plus de temps et de mots. Comme son tarif au mot est très bas, il reste malgré tout le moins cher du tableau.
En revanche, sur une conversation ordinaire, vous ne verrez aucune différence avec la version précédente. Sur LMArena, où des internautes comparent deux réponses sans savoir qui les a écrites, 3.8 Flash obtient 1494 points et 3.7 Flash 1491. Personne n’arrive à les départager.
À retenir en une phrase : 3.8 Flash n’est pas plus brillant que 3.7, il est plus tenace. Il insiste, il vérifie, il relance ses outils jusqu’à ce que la tâche soit finie. C’est ce qui le rend meilleur, et c’est aussi ce qui le rend bavard.
Le feuilleton Flash, résumé en 30 secondes
Google publie une nouvelle version de Flash toutes les trois à cinq semaines depuis le printemps. Quatre versions se sont succédé en quinze semaines, et chacune a remplacé la précédente comme modèle par défaut.
Cette cadence a une conséquence pratique : le modèle que vous utilisez dans l’application Gemini change sans que vous ayez rien demandé.
Combien ça coûte, et pourquoi la facture monte quand même
Le tarif est de 0,75 $ par million de tokens en entrée et 3,75 $ en sortie, soit exactement le prix de 3.7 Flash et de 3.6 Flash. Ce tarif est présenté comme une offre de lancement valable jusqu’au 31 décembre 2026. Au 1er janvier 2027, il double : 1,50 $ et 7,50 $.
| Ce que vous payez | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| Entrée, par million de tokens | 0,75 $ | 0,75 $ |
| Sortie, par million de tokens | 3,75 $ | 3,75 $ |
| Lecture de cache | 0,075 $ | 0,075 $ |
| Tarif au 1er janvier 2027 | 1,50 $ et 7,50 $ | 1,50 $ et 7,50 $ |
| Palier gratuit dans AI Studio | Oui, avec quotas | Oui, avec quotas |
| Coût moyen constaté par tâche | 0,58 $ | 0,40 $ |
La dernière ligne est celle qui compte. À tarif identique, une même tâche revient environ 45 % plus cher avec 3.8 Flash. La raison est simple : le modèle produit beaucoup plus de texte pour arriver au même endroit. Sur la batterie de tests complète d’Artificial Analysis, il a généré 120 millions de tokens de sortie contre 64 millions pour 3.7 Flash, et le coût total du passage est monté de 484,73 $ à 825,83 $.
Pourquoi il consomme autant : Google l’assume noir sur blanc. Le modèle « fait preuve de plus de diligence : il exécute des étapes de raisonnement supplémentaires et appelle ses outils de façon itérative ». Autrement dit, il découpe le problème en plus petits morceaux et vérifie son travail. C’est ce qui le rend meilleur sur les tâches longues, et c’est exactement ce qui coûte plus cher. Les tokens de réflexion sont facturés au prix des tokens de sortie.
Le comparatif chiffré avec 3.7 Flash
Le progrès est net sur l’agentique et l’analyse difficile, nul sur le code et sur le ressenti utilisateur. Voici les chiffres côte à côte.
| Mesure | 3.8 Flash | 3.7 Flash | Écart |
|---|---|---|---|
| Indice agentique | 50,0 | 45,1 | +4,9, le vrai gain |
| Indice d’intelligence | 58,7 | 56,0 | +2,7 |
| Agent financier Vals v2 | 61,4 % | 59,0 % | +2,4 points |
| Agent juridique Harvey | 10,0 | 8,8 | +1,2 |
| Indice de code | 76,3 | 76,1 | +0,2, autant dire rien |
| Préférence humaine, LMArena | 1494 | 1491 | Égalité statistique |
| Vitesse d’écriture | 298,6 tokens/s | 279,4 tokens/s | +7 % |
| Délai avant le premier mot | 13,21 s | 12,01 s | 1,2 s de plus |
| Tokens de sortie sur la batterie de tests | 120 millions | 64 millions | +88 % |
Face à la concurrence, Gemini 3.8 Flash se place à 59 sur l’indice d’intelligence d’Artificial Analysis, au coude à coude avec GPT-5.6 Sol et Grok 4.6, derrière Claude Opus 5 à 63 et Claude Fable 5.1 à 66. Sa force est ailleurs : à ce niveau de performance, c’est le modèle le moins cher du marché, environ six fois moins onéreux que Fable 5.1 par tâche. Nous avons détaillé le cas de ce dernier dans notre article sur la consommation de Claude Fable 5.1.
La fiche technique en un coup d’œil
Le modèle avale un million de tokens en entrée, soit environ 750 000 mots, et accepte presque tous les formats en entrée. En sortie, c’est du texte et rien d’autre.
| Identifiant | gemini-3.8-flash |
| Fenêtre de contexte | 1 048 576 tokens en entrée |
| Réponse maximale | 65 536 tokens |
| Ce qu’il accepte | Texte, image, vidéo, audio, PDF |
| Ce qu’il produit | Du texte uniquement |
| Niveaux de réflexion | Faible, moyen par défaut, élevé |
| Connaissances arrêtées | Mars 2026 |
| Outils intégrés | Recherche Google, exécution de code, Google Maps, lecture d’URL, recherche dans vos fichiers |
| Ce qu’il ne fait pas | Générer des images, générer de l’audio, fonctionner en API Live |
Comment l’essayer en 4 étapes
Vous l’utilisez peut-être déjà sans le savoir. Dans l’application Gemini, 3.8 Flash a remplacé 3.7 Flash pour les abonnés Google AI Pro et Ultra, ainsi que dans le mode IA de la recherche Google et dans Gemini pour Sheets.
- Vérifiez votre accès. Ouvrez l’application Gemini et regardez le sélecteur de modèle. Si vous êtes abonné AI Pro ou AI Ultra, la bascule est automatique et déjà faite. En version gratuite de l’application, le modèle n’est pas proposé.
- Testez-le sans payer. Rendez-vous sur Google AI Studio, connectez-vous avec un compte Google et choisissez gemini-3.8-flash dans la liste des modèles. Le palier gratuit couvre largement les essais, avec des quotas journaliers.
- Donnez-lui une vraie tâche longue. Un rapport de 80 pages à comparer avec un autre, une série de fichiers à recouper, un enchaînement en plusieurs étapes. C’est le seul terrain où il se distingue nettement de 3.7.
- Réglez le niveau de réflexion. Il démarre sur « moyen ». Passez sur « faible » pour les réponses courtes et rapides, réservez « élevé » aux problèmes difficiles. Ce réglage est votre principal levier sur la consommation.
Gemini 3.8 Flash Cyber, la variante que vous n’aurez pas
Google a sorti une seconde version le même jour, spécialisée en cybersécurité, et elle n’est pas accessible au grand public. Gemini 3.8 Flash Cyber cherche des failles dans du code et propose des correctifs automatiquement.
Les résultats annoncés sont sérieux. L’équipe sécurité de Chrome dit avoir obtenu 2,6 fois plus de correctifs justes qu’avec les meilleurs modèles commerciaux, pourtant bien plus gros. Sur un test interne couvrant 20 langages de programmation, le taux de réussite dépasse 70 %. La distribution passe par un programme baptisé Fairwind, réservé aux administrations, aux opérateurs d’infrastructures critiques et aux mainteneurs de logiciels. Si vous n’en faites pas partie, cette variante ne vous concerne pas.
Les limites à connaître avant de basculer
Aucune n’est bloquante, mais mieux vaut les avoir en tête avant de changer de modèle.
- Le prix double le 1er janvier 2027. Le tarif actuel est une offre de lancement. Si vous bâtissez un budget sur douze mois, prenez le tarif plein comme référence.
- Rien de neuf sur le code courant. L’indice de code progresse de 0,2 point. Pour de la génération de code classique, 3.7 Flash suffit amplement.
- La première réponse arrive plus tard. Comptez 1,2 seconde de plus avant le premier mot. Sur un chat en direct, cela se sent.
- Les connaissances s’arrêtent en mars 2026, et Google précise que sur certains sujets le modèle reste bloqué à janvier 2025. Pour l’actualité, activez la recherche Google.
- Ni image, ni audio, ni API Live. C’est un modèle de texte, point.
- Pour les développeurs, la migration n’est pas transparente. Les réglages temperature, top_p et top_k disparaissent, thinking_budget devient thinking_level, et le niveau « minimal » n’existe plus : il renvoie une erreur.
Notre avis
Si vous utilisez Gemini dans l’application avec un abonnement AI Pro ou Ultra, vous n’avez aucune décision à prendre : la bascule est faite, elle ne vous coûte rien de plus, et le modèle est meilleur. Profitez-en, en gardant en tête que la différence sera surtout visible sur les demandes complexes, pas sur les questions du quotidien.
Si vous payez à l’usage via l’API, notre conseil est différent : ne basculez pas par réflexe. Posez-vous une seule question. Vos échecs actuels viennent-ils d’agents qui s’arrêtent au milieu d’une tâche, ou d’autre chose ? Si c’est le premier cas, 3.8 Flash règle précisément ce problème et les 45 % de surcoût sont largement rentabilisés par les tâches qui aboutissent enfin. Si c’est le second cas, vous allez payer davantage pour un résultat identique.
Ce que nous ferions concrètement : garder 3.7 Flash sur tout ce qui fait du volume, c’est-à-dire le tri, l’extraction, les résumés et le chat. Réserver 3.8 Flash aux enchaînements longs, aux analyses de dossiers volumineux et aux agents qui doivent tenir la distance. Et surtout, baisser le niveau de réflexion sur « faible » partout où la tâche est simple : c’est le réglage qui fait la différence entre une facture raisonnable et une mauvaise surprise en fin de mois.
Un dernier réflexe à prendre. Google sort une version de Flash toutes les trois semaines environ, et la suivante arrivera sans doute avant les fêtes. Ce n’est pas une raison pour recâbler votre projet à chaque annonce : attendez que la version se stabilise, mesurez sur vos propres tâches, et changez seulement si le chiffre bouge chez vous.
Sources
- Google : présentation de Gemini 3.8 Flash et 3.8 Flash Cyber, 2 septembre 2026
- Google AI for Developers : quoi de neuf dans Gemini 3.8 Flash
- Google AI for Developers : fiche technique du modèle
- Google AI for Developers : grille tarifaire de l’API Gemini
- Google DeepMind : carte du modèle Gemini 3.8 Flash
- Google : journal des versions de l’API Gemini
- DeepSWE v1.1 (Datacurve) : classement public de résolution de bugs, coût et tokens par tâche
- The Register : analyse du lancement et du coût par tâche