Aller au contenu
Promptique

Rechercher dans Promptique

Actualités

Gemini 3.6 Flash et 3.5 Flash-Lite disponibles : prix, usages et migration

Google lance Gemini 3.6 Flash et 3.5 Flash-Lite en production. Comparez leurs prix, usages, performances annoncées et changements d’API.

Google rend Gemini 3.6 Flash et Gemini 3.5 Flash-Lite disponibles pour les usages de production. Le premier vise les tâches agentiques, le code et le multimodal complexes. Le second privilégie le débit, la latence et le coût. Cette disponibilité générale s’accompagne toutefois de changements d’API à traiter avant toute migration.

La famille Flash ne désigne plus un seul compromis entre vitesse et qualité. Google propose désormais deux profils distincts : un modèle principal capable d’orchestrer des étapes complexes, et un modèle léger pour exécuter un grand nombre de sous-tâches. Pour une équipe produit, l’enjeu n’est donc pas de choisir un vainqueur absolu. Il consiste à placer chaque modèle au bon endroit, à contrôler son coût par résultat et à préserver une voie de retour.

En bref

  • Gemini 3.6 Flash et Gemini 3.5 Flash-Lite sont disponibles en version stable depuis le 21 juillet 2026 dans l’API Gemini.
  • Gemini 3.6 Flash coûte 1,50 $ par million de jetons d’entrée et 7,50 $ par million de jetons de sortie.
  • Gemini 3.5 Flash-Lite coûte 0,30 $ par million de jetons d’entrée et 2,50 $ par million de jetons de sortie.
  • Les deux modèles acceptent jusqu’à environ un million de jetons de contexte et peuvent produire jusqu’à environ 64 000 jetons selon la documentation Google.
  • La migration impose de retirer plusieurs anciens paramètres et les tours de modèle préremplis. Une requête non adaptée peut être ignorée aujourd’hui ou échouer dans une prochaine génération d’API.
  • Les gains de performance et d’efficacité restent liés aux tests présentés ou cités par Google. Ils ne préjugent pas du résultat sur une application particulière.

Deux modèles Flash, deux rôles différents

Gemini 3.6 Flash est présenté comme le modèle polyvalent de la gamme. Google met en avant le code, le travail de connaissance, l’interprétation de graphiques, le raisonnement spatial et les workflows agentiques en plusieurs étapes. Son niveau de réflexion par défaut est medium. Il est destiné aux situations où la tâche doit être planifiée, où plusieurs outils peuvent être appelés et où une erreur de raisonnement intermédiaire risque de compromettre le résultat.

Gemini 3.5 Flash-Lite privilégie les volumes élevés. Son niveau de réflexion par défaut est minimal. Google le destine notamment à l’extraction documentaire, l’analyse structurée, la classification, le routage et l’exécution de sous-agents. Un niveau de réflexion plus élevé peut être demandé lorsque la tâche comporte plusieurs étapes, mais cela peut augmenter la latence et le volume de sortie.

Comparaison des modèles Gemini disponibles en production depuis le 21 juillet 2026
CritèreGemini 3.6 FlashGemini 3.5 Flash-Lite
Identifiant APIgemini-3.6-flashgemini-3.5-flash-lite
Entrée, pour 1 million de jetons1,50 $0,30 $
Sortie, pour 1 million de jetons7,50 $2,50 $
Réflexion par défautmediumminimal
Usages mis en avantCode, multimodal, raisonnement spatial, agents complexesExtraction, classification, données structurées, sous-agents à fort volume

À volume identique, Flash-Lite présente la facture brute la plus faible. Un traitement de 10 millions de jetons d’entrée et 2 millions de jetons de sortie représenterait 8 $ avec Flash-Lite, contre 30 $ avec 3.6 Flash, avant cache, outils, recherche, stockage et infrastructure. Cette comparaison ne tient pas compte du taux de réussite. Si Flash-Lite doit relancer davantage de requêtes ou mobiliser plus de validation humaine, l’économie réelle peut diminuer.

Ce que signifie la disponibilité générale

Une version GA, pour general availability, dispose d’un identifiant stable et est présentée comme prête pour la production. Les deux modèles sont proposés aux développeurs dans l’API Gemini, Google AI Studio et Android Studio. Google annonce également leur disponibilité dans Gemini Enterprise Agent Platform, ainsi que dans l’application Gemini. Gemini 3.6 Flash est disponible dans Google Antigravity, tandis que Flash-Lite est en cours de déploiement dans Google Search.

GA ne signifie pas que le comportement restera figé ni que chaque fonction est disponible de façon identique sur toutes les surfaces. Les quotas, régions, outils intégrés et conditions commerciales peuvent varier. Pour un système critique, conservez l’identifiant exact du modèle, suivez les notes de version et rejouez régulièrement vos évaluations. Le guide 2026 de l’intelligence artificielle générative explique pourquoi les réponses d’un service hébergé doivent être considérées comme une dépendance évolutive.

Les changements d’API à ne pas manquer

La nouveauté la plus importante pour une application existante n’est peut-être pas le modèle lui-même. Google modifie plusieurs conventions de génération à partir de Gemini 3.6 Flash et Gemini 3.5 Flash-Lite. Une migration réduite au remplacement du nom du modèle peut donc créer des écarts silencieux ou des erreurs.

Les paramètres temperature, top_p et top_k sont dépréciés

Selon le guide de migration, ces paramètres sont désormais ignorés par ces modèles et doivent être retirés. Google prévoit qu’une future génération renverra une erreur HTTP 400 lorsqu’ils seront fournis. Si votre application comptait sur une température faible pour obtenir une sortie plus stable, remplacez cette hypothèse par une instruction système explicite, un schéma de sortie et des tests.

thinking_level remplace les anciens réglages de budget

Pour 3.6 Flash, Google recommande medium ou high selon la complexité. Pour Flash-Lite, minimal favorise le débit sur l’extraction ou la classification, tandis que medium ou high peut mieux convenir à un sous-agent autonome. Augmenter le niveau n’offre aucune garantie universelle. Il faut mesurer l’amélioration obtenue face au supplément de temps et de jetons.

Les tours préremplis du modèle ne sont plus acceptés

Une conversation ne peut plus se terminer par un tour non vide portant le rôle model. Cette technique était parfois utilisée pour amorcer une réponse, supprimer un préambule ou forcer le début d’un format. Elle provoque désormais une erreur 400. Google conseille d’utiliser une instruction système et les sorties structurées. Le paramètre candidate_count n’est pas pris en charge dans Gemini 3.x et doit également être retiré.

Ces changements renforcent l’intérêt d’un contrat de sortie explicite. Décrivez les champs, leurs types, les valeurs autorisées et le comportement en cas d’information absente. Le guide complet du prompt engineering propose une méthode pour construire ce contrat et le vérifier sur des cas normaux, limites et contradictoires.

Des gains annoncés, à remettre dans leur contexte

Google indique que Gemini 3.6 Flash utilise 17 % de jetons de sortie en moins que Gemini 3.5 Flash sur l’Artificial Analysis Index. L’entreprise cite aussi des scores supérieurs sur DeepSWE, MLE Bench, OSWorld-Verified et des évaluations de travail de connaissance. Pour Flash-Lite, Google reprend notamment une mesure de 350 jetons de sortie par seconde issue d’Artificial Analysis et publie des écarts sur des tests de code, de contexte long et d’exécution agentique.

Ces résultats ne doivent pas être transformés en promesse générale. Un benchmark isole certaines capacités avec un protocole donné. Il ne mesure pas nécessairement votre langue, vos documents, vos outils, vos règles de sécurité ou votre seuil d’erreur. Les chiffres repris par Google incluent à la fois des évaluations maison et des mesures externes sélectionnées dans son annonce.

Le guide de Google contient même une nuance utile : 3.6 Flash produit du code plus fonctionnel, mais des évaluateurs humains ont parfois préféré des modèles antérieurs pour la mise en page et le style visuel. Google recommande alors des consignes de design explicites. C’est un bon rappel : « meilleur » dépend du critère. Une amélioration en exécution ou précision ne garantit pas une meilleure esthétique.

Impacts pratiques pour choisir et migrer

Choisir 3.6 Flash pour les décisions difficiles à découper

Testez 3.6 Flash lorsqu’une tâche combine plusieurs sources, du code, une image ou plusieurs appels d’outils. Il peut aussi jouer le rôle de planificateur, puis déléguer des opérations répétitives à Flash-Lite. Cette séparation doit rester observable : chaque délégation a un objectif, un budget, un schéma de sortie et une condition d’arrêt.

Choisir Flash-Lite lorsque le volume domine

Flash-Lite mérite un test sur la classification de tickets, l’extraction de factures, la normalisation de données ou la préparation de lots. Commencez par des actions réversibles. Échantillonnez les résultats pour une revue humaine et escaladez les cas dont le niveau de confiance ou la structure sort des bornes.

Traiter la migration comme une nouvelle version de produit

Dupliquez temporairement le trafic hors production ou rejouez un corpus enregistré. Comparez les sorties champ par champ, les appels d’outils, la latence, le nombre de jetons et les refus. Conservez l’ancien modèle comme solution de repli jusqu’à ce que les critères soient atteints. Pour les usages en entreprise, le guide Promptique sur le déploiement, le RGPD et l’AI Act fournit une checklist de gouvernance, de données et de supervision.

Limites et points de vigilance

  • Les tarifs API ne sont qu’une partie du coût. Ajoutez cache, stockage, recherche, outils, monitoring, évaluations et validation humaine.
  • Le contexte maximal n’est pas un objectif de remplissage. Un contexte énorme peut accroître coût, latence et distraction. Fournissez seulement les éléments utiles.
  • La disponibilité d’un outil doit être vérifiée sur la surface cible. Les pages Google peuvent évoluer à des rythmes différents. Testez notamment les outils intégrés avec votre endpoint, votre région et vos quotas.
  • Une sortie structurée valide peut rester fausse. Validez les types, mais aussi les données contre une source fiable.
  • Un modèle rapide ne sécurise pas un agent. Limitez les permissions, contrôlez les paramètres d’outils et exigez une approbation pour les actions sensibles.

FAQ

Gemini 3.6 Flash est-il disponible en production ?

Oui. Google l’a déclaré généralement disponible le 21 juillet 2026 sous l’identifiant stable gemini-3.6-flash. Vérifiez les quotas, régions et fonctions de la surface que vous utilisez.

Quel modèle est le moins cher ?

Flash-Lite affiche le prix par jeton le plus bas des deux : 0,30 $ en entrée et 2,50 $ en sortie par million de jetons. Le modèle le moins cher par jeton n’est pas forcément le moins cher par tâche réussie.

Peut-on migrer en changeant seulement l’identifiant du modèle ?

Ce n’est pas recommandé. Retirez les paramètres d’échantillonnage dépréciés, les tours préremplis et candidate_count. Adaptez le réglage de réflexion, vérifiez les appels d’outils et rejouez vos tests.

Faut-il utiliser un million de jetons de contexte ?

Seulement si la tâche l’exige et si vos essais montrent un bénéfice. Découper, rechercher les passages pertinents ou résumer des éléments stables peut être plus fiable et moins coûteux que transmettre systématiquement tout un corpus.

À retenir

Gemini 3.6 Flash et Gemini 3.5 Flash-Lite donnent aux équipes deux leviers complémentaires : davantage de capacité pour orchestrer les étapes complexes, davantage d’efficacité pour exécuter les volumes. Leur intérêt réel apparaîtra dans une architecture qui mesure la qualité, la latence et le coût par résultat. La disponibilité générale facilite le passage en production, mais les changements d’API imposent une migration testée, documentée et réversible.

Sources officielles