Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

Google: Gemini 3.5 Flash-Lite

Gemini 3.5 Flash-Lite cible les travaux à haut volume avec des temps de réponse courts. Envisagez-le pour le traitement de documents, l'extraction et les tâches d'agents plus petites qui s'exécutent de manière répétée et nécessitent une gestion efficace des entrées textuelles et visuelles.
Comparer les modèles
gemini-3.5-flash-lite
DisponibleGoogleDiscussionEntrée en cache : 90% de réduction
Entrée / Sortie-50%
$0.30 / $2.50$0.15 / $1.25
Contexte
1M
Date de sortie
21 juil. 2026
Sortie maximale
64K
Modalités
VisionDiscussion
Capacités
Utilisation d'outilsCache de prompts

À propos de Gemini 3.5 Flash-Lite

Gemini 3.5 Flash-Lite est le modèle le plus rapide et le plus rentable de Google de la génération 3.5, sorti en juillet 2026. Il cible le travail à haut volume où les temps de réponse courts sont importants : traitement de documents, extraction et petites tâches agentiques répétées. Il lit le texte et les images, appelle des outils, renvoie du JSON conforme à un schéma et met en cache le contexte, et Google oriente désormais les nouveaux projets vers lui.

Points forts

  • Conçu pour des temps de réponse courts sur des travaux répétés des milliers de fois.
  • Gère le texte et les images ensemble pour le traitement de documents et de captures d'écran.
  • Le JSON conforme à un schéma maintient la cohérence de la sortie d'extraction.
  • L'appel de fonction lui permet d'exécuter de petites étapes d'agent telles que des recherches ou du routage.

Quand préférer un autre modèle

  • Les sessions de codage longues et les flux de travail d'entreprise complexes relèvent de 3.8 Flash ou 3.1 Pro.
  • Il manquera des détails qu'un modèle Flash plus complet saisit sur des documents denses ou ambigus.

Pour commencer

  1. Créer une clé API

    Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.

  2. Envoyez votre première requête

    Copiez l'exemple pour votre langage et lancez-le.

    Texte vers texteGemini API
    POST/v1beta/models/gemini-3.5-flash-lite:generateContent
    Format d'API:
    curl "https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash-lite:generateContent" \
      -H "Content-Type: application/json" \
      -H "x-goog-api-key: sk-xxx" \
      -d '{
        "contents": [
          {"role": "user", "parts": [{"text": "Hello!"}]}
        ]
      }'

Tarification

Le tarif TokenLab s'applique à Verified pour réduire vos coûts. Le tarif officiel s'applique à la route Official pour une fiabilité optimale. Auto sélectionne la route qui garantit le succès de votre requête.

Spécification par défaut

Par 1M Token
Tarif Official
Entrée $0.30 / Sortie $2.50 / Lecture cache $0.03
Prix TokenLab
Entrée $0.15 / Sortie $1.25 / Lecture cache $0.015
Remise
-50%
Tarification du cache de prompt

Lecture cache

Tarif Official
$0.03
Prix TokenLab
$0.015
Remise
-50%

Utilisation et activité

Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.

Utilisation et disponibilité

Dernières 24 heures
Requêtes
Taux de succès
Latence P95
Total des jetons
Performance du modèle
Taux de réussite sur 30 jours
99,7%
Latence médiane sur 7 jours
1,9 sn=346
Latence P95 sur 7 jours
7 sn=346
Requêtes sur 30 jours
100+
Dernière activité
il y a 19 heures

Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.

Ouvrir dans Console

Ouvrez Gemini 3.5 Flash-Lite dans Console avec un prompt prêt à modifier ou envoyer.

Aide-moi à tester gemini-3.5-flash-lite avec un message sur /v1beta/models/gemini-3.5-flash-lite:generateContent. Affiche la réponse, la latence et le coût.

Cas d'usage

Idéal pour
  • Vision
  • Pipelines de documents

    Convertissez des contrats, des factures et des rapports en champs structurés à grande échelle, en écrivant un enregistrement JSON validé pour chaque fichier entrant.

  • Triage de file d'attente

    Triez les tickets ou messages entrants par sujet et urgence avant qu'un humain ou un modèle plus grand ne les voie.

  • Petits agents

    Exécutez des tâches restreintes de type outils-en-boucle telles que des recherches de commandes ou des modifications de calendrier, où chaque étape est petite et la boucle se répète souvent.

  • Contrôles visuels

    Confirmez que les photos téléchargées respectent des règles simples, comme une étiquette visible ou une orientation correcte.

Exemples de prompts

Extrayez chaque ligne de cette facture sous forme de JSON avec description, quantité et montant unitaire.

Évaluez l'urgence de ce ticket comme faible, moyenne ou élevée et donnez la phrase unique qui le justifie.

Vérifiez si cette photo de produit montre clairement l'étiquette d'emballage ; répondez par oui ou par non et expliquez pourquoi.

Ce modèle a une tarification conditionnelle. Les totaux mensuels de tokens ne suffisent pas pour une estimation fiable ; utilisez la tarification détaillée selon la spécification de la requête, le cache et la fenêtre applicable.

FAQ

À quoi sert Gemini 3.5 Flash-Lite ?

Travail rapide, répété et simple : extraction, classification, routage et contrôles multimodaux légers. C'est l'extrémité économique de la famille 3.5, conçue pour le temps de réponse plutôt que pour la profondeur.

Est-il plus récent que Gemini 3.1 Flash-Lite ?

Oui. Il s'agit de la génération ultérieure, et Google le répertorie comme le choix léger recommandé pour les nouveaux projets. L'ancien 3.1 Flash-Lite reste disponible pour les intégrations existantes.

Peut-il lire les images ?

Oui, les images peuvent accompagner le texte dans une requête, et la réponse revient sous forme de texte brut ou de JSON structuré, ce qui convient aux contrôles de photos et à l'extraction de documents numérisés.

Quand est-il trop limité ?

Lorsque la tâche nécessite un raisonnement soutenu, une analyse minutieuse de longs documents ou un travail de codage de plusieurs heures. Passez à Gemini 3.8 Flash ou 3.1 Pro dans ces cas-là.

Combien coûte Gemini 3.5 Flash-Lite ?

Sur TokenLab, Gemini 3.5 Flash-Lite coûte Entrée $0.15 / Sortie $1.25 Par 1M Token. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.

Quelles sont les limites de contexte et de sortie de Gemini 3.5 Flash-Lite ?

Gemini 3.5 Flash-Lite accepte jusqu'à 1 048 576 jetons de contexte et génère jusqu'à 65 536 jetons par réponse.

Quel endpoint Gemini 3.5 Flash-Lite doit-il utiliser ?

Utilisez https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash-lite:generateContent pour Gemini 3.5 Flash-Lite. L'exemple de requête ci-dessous montre la structure de code correspondante.

Quelles opérations Gemini 3.5 Flash-Lite prend-il en charge ?

Gemini 3.5 Flash-Lite prend en charge Texte vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.

Comparer Gemini 3.5 Flash-Lite

Sources

Mis à jour le 2 oct. 2026

Plus de la série Gemini 3

Modèles associés