Choisir un modèle Gemini, ce n'est pas mémoriser chaque nom, mais d'abord classer votre tâche. Besoin de raisonnement solide, de code et de multimodalité ? Commencez par le 3.6 Flash. Volume massif et risque faible par appel ? Testez d'abord le 3.5 Flash-Lite. Détection de vulnérabilités et validation de correctifs ? Vérifiez si vous avez accès au Flash Cyber en mode pilote contrôlé.
1Classer la tâche : trois chemins de routage
Pour router des modèles dans l'API Gemini, des agents d'entreprise ou des pipelines documentaires, répartissez le travail en trois catégories : usage général complexe, batch haut débit et défense sécurité. Évaluez d'abord gemini-3.6-flash en production ; testez gemini-3.5-flash-lite pour le traitement répétitif à forte concurrence ; Flash Cyber reste réservé aux équipes sécurité avec accès pilote CodeMender — pas au routage par défaut d'un SaaS ordinaire.
| Type de tâche | Modèle privilégié | Facteurs de décision |
|---|---|---|
| Usage général complexeDéfaut | 3.6 Flash | Profondeur de raisonnement, outils, multimodal |
| Batch haut débit | 3.5 Flash-Lite | Coût, latence, taux d'échec acceptable |
| Défense sécurité | Flash Cyber | Éligibilité CodeMender, pilote contrôlé |
2Quand choisir le 3.6 Flash
ID modèle : gemini-3.6-flash, disponible via l'API Gemini et Google AI Studio. Utilisez-le pour les étapes qui exigent un raisonnement solide et une chaîne d'outils stable :
- Migration et refactorisation de code — Compréhension multi-fichiers et raisonnement inter-dépôts ; les erreurs coûtent cher, Lite n'est pas adapté.
- Compréhension documentaire et analyse multimodale — Texte et images mixtes, extraction de tableaux, interprétation de graphiques : la pleine capacité Flash est requise.
- Nœuds de décision d'agent principal — Planification des sous-tâches, sélection d'outils, gestion des exceptions : le « cerveau » du pipeline.
💡 Point de départ par défaut : en cas de doute, benchmarker d'abord sur le 3.6 Flash. Si le taux de succès et la latence conviennent, déléguer ensuite les sous-étapes à faible risque au Lite.
3Quand choisir le 3.5 Flash-Lite
ID modèle : gemini-3.5-flash-lite, conçu pour le traitement batch à forte concurrence, faible coût et tolérance aux relances. Bonnes candidates pour réduire les coûts :
- Résumé et extraction — Compression de longs textes, extraction de champs : formats de sortie fixes, large tolérance aux erreurs.
- Classification et classement de recherche — Détection d'intention, étiquetage, rappel de candidats : compléter par des règles pour une validation secondaire.
- Génération batch de candidats — Premier filtrage à grand volume et variantes de brouillon : relecture finale par un modèle plus puissant ou un humain.
⚠️ Limite de risque : ne comptez pas sur Lite seul pour les étapes impliquant paiements, conformité ou modifications de configuration en production. Une hausse du taux de relance signale que la tâche dépasse le périmètre du Lite.
4Quand choisir Flash Cyber
Flash Cyber sera déployé via CodeMender en pilote contrôlé pour les administrations et partenaires de confiance — il n'est pas sélectionnable directement dans AI Studio. Il cible le scan de vulnérabilités, la vérification de correctifs et les rapports sécurité. Sans accès contrôlé, continuez avec le 3.6 Flash pour l'analyse de code générale.
5Routage combiné et évaluation de migration
Un agent multi-étapes n'a pas besoin d'un seul modèle pour chaque étape. Schéma courant : 3.6 Flash planifie → Flash-Lite exécute les sous-tâches → humain ou modèle plus puissant valide. Lors de la migration depuis d'anciens modèles Gemini Flash, comparez cinq métriques sur des échantillons métier réels :
y compris validation de format
y compris attentes d'appels d'outils
nombre d'appels d'outils
Suivez aussi le taux de relance et le coût par appel. Basez vos décisions sur vos échantillons métier, pas uniquement sur les benchmarks officiels.
6Checklist avant mise en production
| Point de contrôle | Ce qu'il faut vérifier |
|---|---|
| Disponibilité API | Confirmer que la région et le canal cibles prennent en charge l'ID modèle |
| Tarifs et quotas | Recouper la page tarifaire officielle ; définir limites RPM/TPM et alertes de coût |
| Logs et repli | Journaliser le choix de modèle par étape ; basculer sur le 3.6 Flash si Lite échoue |
La production doit-elle partir par défaut sur le 3.6 Flash ou Flash-Lite ?
Commencez par le 3.6 Flash pour la plupart des scénarios. Une fois le taux de succès et la latence acceptables, déléguez les sous-étapes à fort volume et faible risque au Flash-Lite pour réduire les coûts.
Les développeurs ordinaires peuvent-ils utiliser Flash Cyber ?
Pas en option par défaut. Il est accessible via des pilotes CodeMender contrôlés — sans éligibilité, ne l'ajoutez pas au routage de votre produit.
Comment combiner les modèles dans un agent multi-étapes ?
Utilisez le 3.6 Flash pour la planification et la gestion des exceptions, Flash-Lite pour l'extraction et la classification batch, et une relecture humaine ou par modèle plus puissant pour les sorties critiques.
Le choix de modèle se résume à router selon la complexité, le coût et le risque sécurité — pas à viser un seul modèle « le plus fort ». Démarrez sur le 3.6 Flash, testez Flash-Lite pour le batch à faible risque, réservez Flash Cyber aux équipes éligibles. Évaluez avec vos propres échantillons avant de figer le routage.
- 1Classer les tâches en usage général complexe, batch haut débit ou défense sécurité
- 2Comparer taux de succès, latence P95, tokens de sortie et taux de relance sur des échantillons métier
- 3Configurer modèles de repli, alertes de coût et journalisation par étape ; surveiller après lancement
7Construire votre pipeline d'évaluation sur Mac mini
Le routage Gemini exige un environnement de scripts stable et des jobs d'évaluation continus. Sur macOS, Terminal, Homebrew et Python/Node sont prêts à l'emploi ; le Mac mini M4 gère fluide les tests API concurrents, avec environ 4 W au repos pour des batch 24 h/24. Gatekeeper, SIP et FileVault protègent clés API et échantillons métier.
Pour des benchmarks de sélection de modèles et le développement d'agents, le Mac mini M4 est le point de départ le plus rentable — procurez-vous-en un maintenant pour exploiter tout le potentiel de votre workflow IA.
MacZig · Serveur Mac cloud
Développez l'IA en toute fluidité sur Mac mini
Mémoire unifiée · Fonctionnement 24 h/24 à faible consommation · Environnement Unix natif
Évaluation de modèles et développement d'agents au même endroit