Google: Gemini 3.5 Flash-Lite
gemini-3.5-flash-lite- Entrée / Sortie-50%
- $0.30 / $2.50$0.15 / $1.25
- Contexte
- 1M
- Date de sortie
- 21 juil. 2026
- Sortie maximale
- 64K
- Modalités
- VisionDiscussion
- Capacités
- Utilisation d'outilsCache de prompts
À propos de Gemini 3.5 Flash-Lite
Gemini 3.5 Flash-Lite est le modèle le plus rapide et le plus rentable de Google de la génération 3.5, sorti en juillet 2026. Il cible le travail à haut volume où les temps de réponse courts sont importants : traitement de documents, extraction et petites tâches agentiques répétées. Il lit le texte et les images, appelle des outils, renvoie du JSON conforme à un schéma et met en cache le contexte, et Google oriente désormais les nouveaux projets vers lui.
Points forts
- Conçu pour des temps de réponse courts sur des travaux répétés des milliers de fois.
- Gère le texte et les images ensemble pour le traitement de documents et de captures d'écran.
- Le JSON conforme à un schéma maintient la cohérence de la sortie d'extraction.
- L'appel de fonction lui permet d'exécuter de petites étapes d'agent telles que des recherches ou du routage.
Quand préférer un autre modèle
- Les sessions de codage longues et les flux de travail d'entreprise complexes relèvent de 3.8 Flash ou 3.1 Pro.
- Il manquera des détails qu'un modèle Flash plus complet saisit sur des documents denses ou ambigus.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
Texte vers texteGemini APIPOST/v1beta/models/gemini-3.5-flash-lite:generateContentFormat d'API:curl "https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash-lite:generateContent" \ -H "Content-Type: application/json" \ -H "x-goog-api-key: sk-xxx" \ -d '{ "contents": [ {"role": "user", "parts": [{"text": "Hello!"}]} ] }'
Tarification
Le tarif TokenLab s'applique à Verified pour réduire vos coûts. Le tarif officiel s'applique à la route Official pour une fiabilité optimale. Auto sélectionne la route qui garantit le succès de votre requête.
Spécification par défaut
Par 1M Token- Tarif Official
- Entrée $0.30 / Sortie $2.50 / Lecture cache $0.03
- Prix TokenLab
- Entrée $0.15 / Sortie $1.25 / Lecture cache $0.015
- Remise
- -50%
Lecture cache
- Tarif Official
- $0.03
- Prix TokenLab
- $0.015
- Remise
- -50%
| Tarif OfficialPar 1M Token | Prix TokenLabPar 1M Token | Remise | |
|---|---|---|---|
| Spécification par défaut | Entrée $0.30 / Sortie $2.50 / Lecture cache $0.03 | Entrée $0.15 / Sortie $1.25 / Lecture cache $0.015 | -50% |
| Tarification du cache de prompt | |||
| Lecture cache | $0.03 | $0.015 | -50% |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
- Taux de réussite sur 30 jours
- 99,7%
- Latence médiane sur 7 jours
- 1,9 sn=346
- Latence P95 sur 7 jours
- 7 sn=346
- Requêtes sur 30 jours
- 100+
- Dernière activité
- il y a 19 heures
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Ouvrir dans Console
Ouvrez Gemini 3.5 Flash-Lite dans Console avec un prompt prêt à modifier ou envoyer.
Aide-moi à tester gemini-3.5-flash-lite avec un message sur /v1beta/models/gemini-3.5-flash-lite:generateContent. Affiche la réponse, la latence et le coût.
Cas d'usage
Idéal pour- Vision
Pipelines de documents
Convertissez des contrats, des factures et des rapports en champs structurés à grande échelle, en écrivant un enregistrement JSON validé pour chaque fichier entrant.
Triage de file d'attente
Triez les tickets ou messages entrants par sujet et urgence avant qu'un humain ou un modèle plus grand ne les voie.
Petits agents
Exécutez des tâches restreintes de type outils-en-boucle telles que des recherches de commandes ou des modifications de calendrier, où chaque étape est petite et la boucle se répète souvent.
Contrôles visuels
Confirmez que les photos téléchargées respectent des règles simples, comme une étiquette visible ou une orientation correcte.
Exemples de prompts
Extrayez chaque ligne de cette facture sous forme de JSON avec description, quantité et montant unitaire.
Évaluez l'urgence de ce ticket comme faible, moyenne ou élevée et donnez la phrase unique qui le justifie.
Vérifiez si cette photo de produit montre clairement l'étiquette d'emballage ; répondez par oui ou par non et expliquez pourquoi.
Ce modèle a une tarification conditionnelle. Les totaux mensuels de tokens ne suffisent pas pour une estimation fiable ; utilisez la tarification détaillée selon la spécification de la requête, le cache et la fenêtre applicable.
FAQ
À quoi sert Gemini 3.5 Flash-Lite ?
Travail rapide, répété et simple : extraction, classification, routage et contrôles multimodaux légers. C'est l'extrémité économique de la famille 3.5, conçue pour le temps de réponse plutôt que pour la profondeur.
Est-il plus récent que Gemini 3.1 Flash-Lite ?
Oui. Il s'agit de la génération ultérieure, et Google le répertorie comme le choix léger recommandé pour les nouveaux projets. L'ancien 3.1 Flash-Lite reste disponible pour les intégrations existantes.
Peut-il lire les images ?
Oui, les images peuvent accompagner le texte dans une requête, et la réponse revient sous forme de texte brut ou de JSON structuré, ce qui convient aux contrôles de photos et à l'extraction de documents numérisés.
Quand est-il trop limité ?
Lorsque la tâche nécessite un raisonnement soutenu, une analyse minutieuse de longs documents ou un travail de codage de plusieurs heures. Passez à Gemini 3.8 Flash ou 3.1 Pro dans ces cas-là.
Combien coûte Gemini 3.5 Flash-Lite ?
Sur TokenLab, Gemini 3.5 Flash-Lite coûte Entrée $0.15 / Sortie $1.25 Par 1M Token. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.
Quelles sont les limites de contexte et de sortie de Gemini 3.5 Flash-Lite ?
Gemini 3.5 Flash-Lite accepte jusqu'à 1 048 576 jetons de contexte et génère jusqu'à 65 536 jetons par réponse.
Quel endpoint Gemini 3.5 Flash-Lite doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash-lite:generateContent pour Gemini 3.5 Flash-Lite. L'exemple de requête ci-dessous montre la structure de code correspondante.
Quelles opérations Gemini 3.5 Flash-Lite prend-il en charge ?
Gemini 3.5 Flash-Lite prend en charge Texte vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.
Comparer Gemini 3.5 Flash-Lite
Sources
Mis à jour le 2 oct. 2026