Google: Gemini 3.1 Flash-Lite
gemini-3.1-flash-lite- Entrée / Sortie-50%
- $0.25 / $1.50$0.125 / $0.75
- Contexte
- 1M
- Date de sortie
- 7 mai 2026
- Sortie maximale
- 64K
- Modalités
- VisionDiscussion
- Capacités
- Utilisation d'outilsCache de prompts
À propos de Gemini 3.1 Flash-Lite
Gemini 3.1 Flash-Lite est le modèle à faible latence et à faible coût de Google dans la gamme Gemini 3.1, conçu pour les charges de travail multimodales et d'agents à haut volume. Google décrit des performances de classe « frontier » rivalisant avec des modèles plus grands pour une fraction du coût. Il lit le texte et les images, appelle des outils, renvoie du JSON lié à un schéma et prend en charge la mise en cache du contexte ; il se situe en dessous du niveau Flash en termes de capacités.
Points forts
- Des temps de réponse courts le rendent adapté aux fonctionnalités interactives où chaque appel doit renvoyer une réponse rapidement.
- Les images et le texte sont inclus dans la même requête, ce qui convient au traitement des reçus, des formulaires et des captures d'écran.
- La sortie JSON liée à un schéma élimine le besoin d'une analyse fragile du texte libre.
- L'appel d'outils et la mise en cache du contexte prennent en charge des étapes d'agent répétées et similaires à grande échelle.
Quand préférer un autre modèle
- Pour les agents de codage longs et comportant plusieurs étapes, les modèles Flash et Pro sont plus performants qu'un modèle Lite.
- Ce n'est pas un modèle axé sur le raisonnement ; les calculs complexes ou la planification approfondie sont mieux traités par Gemini 3.1 Pro.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
Texte vers texteGemini APIPOST/v1beta/models/gemini-3.1-flash-lite:generateContentFormat d'API:curl "https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent" \ -H "Content-Type: application/json" \ -H "x-goog-api-key: sk-xxx" \ -d '{ "contents": [ {"role": "user", "parts": [{"text": "Hello!"}]} ] }'
Tarification
Le prix Verified s’applique à Verified, moins cher sur la plupart des modèles. Le prix Official est le prix publié par le fabricant du modèle et s’applique à la route Official, plus fiable. Auto facture la route qui termine la requête.
Spécification par défaut
Par 1M Token- Prix Official
- Entrée $0.25 / Sortie $1.50 / Lecture cache $0.025
- Prix Verified
- Entrée $0.125 / Sortie $0.75 / Lecture cache $0.0125
- Remise
- -50%
Lecture cache
- Prix Official
- $0.025
- Prix Verified
- $0.0125
- Remise
- -50%
Facturation à l'appel, uniquement lors de l'utilisation de l'outil par le modèle.
Recherche web
- Prix Official
- $0.014/recherche
- Prix Verified
- $0.007/recherche
- Remise
- -50%
| Prix OfficialPar 1M Token | Prix VerifiedPar 1M Token | Remise | |
|---|---|---|---|
| Spécification par défaut | Entrée $0.25 / Sortie $1.50 / Lecture cache $0.025 | Entrée $0.125 / Sortie $0.75 / Lecture cache $0.0125 | -50% |
| Tarification du cache de prompt | |||
| Lecture cache | $0.025 | $0.0125 | -50% |
| Frais d'outilsFacturation à l'appel, uniquement lors de l'utilisation de l'outil par le modèle. | |||
| Recherche web | $0.014/recherche | $0.007/recherche | -50% |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
- Taux de réussite sur 30 jours
- 100,0%
- Requêtes sur 30 jours
- 40K+
- Dernière activité
- il y a 7 minutes
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Ouvrir dans Console
Ouvrez Gemini 3.1 Flash-Lite dans Console avec un prompt prêt à modifier ou envoyer.
Aide-moi à tester gemini-3.1-flash-lite avec un message sur /v1beta/models/gemini-3.1-flash-lite:generateContent. Affiche la réponse, la latence et le coût.
Cas d'usage
Idéal pour- Vision
Extraction en masse
Extrayez des champs de milliers de factures ou de formulaires et écrivez chaque résultat sous forme d'objet JSON validé.
Modération et étiquetage de contenu
Étiquetez les téléchargements et les commentaires des utilisateurs par rapport à une politique fixe avec une justification en une ligne.
Couche de routage
Décidez vers quel modèle spécialisé ou quel outil une requête doit être dirigée, puis transmettez-la.
Assistants en temps réel
Alimentez la saisie semi-automatique, les réponses rapides ou les tours d'assistant vocal où une attente visible nuirait à l'expérience de l'utilisateur.
Exemples de prompts
Extrayez le fournisseur, la date, le total et la devise de cette image de facture et renvoyez-les au format JSON.
Étiquetez le commentaire ci-dessous comme spam, abus, question ou éloge et expliquez le choix en une phrase.
Étant donné ce message utilisateur, choisissez l'une des options suivantes : search_docs, create_ticket, answer_directly. Répondez uniquement avec le nom de l'outil.
Ce modèle a une tarification conditionnelle. Les totaux mensuels de tokens ne suffisent pas pour une estimation fiable ; utilisez la tarification détaillée selon la spécification de la requête, le cache et la fenêtre applicable.
FAQ
À quoi Gemini 3.1 Flash-Lite est-il le mieux adapté ?
Aux tâches à haut volume et sensibles à la latence telles que l'extraction, la classification, l'étiquetage, le routage et les réponses multimodales rapides. Il échange une partie de sa profondeur de raisonnement contre de la vitesse et une charge plus légère par appel.
Accepte-t-il les images ?
Oui. Le texte et les images peuvent être mélangés dans une seule requête, il peut donc lire des documents, des captures d'écran et des photos. Sa réponse est renvoyée sous forme de texte ou de JSON correspondant à votre schéma.
Peut-il appeler des outils ?
Oui. L'appel de fonction est pris en charge, ce qui lui permet d'agir comme un agent de première étape qui choisit des outils pour des requêtes simples ou transmet les cas difficiles à un modèle plus grand.
En quoi est-il différent de Gemini 3.5 Flash-Lite ?
3.5 Flash-Lite est la nouvelle génération vers laquelle Google oriente désormais les nouveaux projets ; 3.1 Flash-Lite est l'ancien modèle Lite, toujours stable. Testez vos propres prompts sur les deux avant de migrer votre trafic.
Combien coûte Gemini 3.1 Flash-Lite ?
Sur TokenLab, Gemini 3.1 Flash-Lite coûte Entrée $0.125 / Sortie $0.75 Par 1M Token. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.
Quelles sont les limites de contexte et de sortie de Gemini 3.1 Flash-Lite ?
Gemini 3.1 Flash-Lite accepte jusqu'à 1 048 576 jetons de contexte et génère jusqu'à 65 536 jetons par réponse.
Quel endpoint Gemini 3.1 Flash-Lite doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent pour Gemini 3.1 Flash-Lite. L'exemple de requête ci-dessous montre la structure de code correspondante.
Quelles opérations Gemini 3.1 Flash-Lite prend-il en charge ?
Gemini 3.1 Flash-Lite prend en charge Texte vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.
Comparer Gemini 3.1 Flash-Lite
Guides utilisant Gemini 3.1 Flash-Lite
Sources
Mis à jour le 2 oct. 2026