Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

Google: Gemini 3.5 Flash

Gemini 3.5 Flash est conçu pour le codage soutenu et le travail agentique. Son contexte étendu et ses capacités d'appel d'outils conviennent aux assistants qui doivent mener une tâche à bien sur plusieurs étapes tout en conservant des documents, du code et des décisions antérieures.
Comparer les modèles
gemini-3.5-flash
DisponibleGoogleDiscussionEntrée en cache : 90% de réduction
Entrée / Sortie-50%
$1.50 / $9.00$0.75 / $4.50
Contexte
1M
Date de sortie
19 mai 2026
Sortie maximale
64K
Modalités
VisionDiscussion
Capacités
Utilisation d'outilsCache de promptsRaisonnement

À propos de Gemini 3.5 Flash

Gemini 3.5 Flash est un modèle stable de la gamme Flash de Google, décrit par Google comme la référence en matière de vitesse et de performances fondamentales pour les charges de travail courantes à haut débit. Il lit le texte et les images, appelle des outils, renvoie du JSON conforme à un schéma et prend en charge la mise en cache. Il se situe entre Flash-Lite 3.5 et les versions ultérieures Flash 3.6, 3.7 et 3.8.

Points forts

  • Un modèle Flash polyvalent et stable pour le chat, l'extraction et la synthèse de routine à grand volume.
  • L'appel d'outils prend en charge les assistants qui effectuent une tâche en plusieurs étapes.
  • L'entrée d'images lui permet de traiter des captures d'écran, des scans et des graphiques sans nécessiter de modèle de vision distinct.
  • Le JSON conforme à un schéma et la mise en cache du contexte sont adaptés aux appels de pipeline répétés.

Quand préférer un autre modèle

  • Les modèles Flash 3.6, 3.7 et 3.8 ultérieurs sont plus performants pour les tâches de codage et d'agent.
  • Il ne dispose pas de mode de réflexion dédié ; il est donc préférable de confier les raisonnements complexes en plusieurs étapes à un autre modèle.

Pour commencer

  1. Créer une clé API

    Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.

  2. Envoyez votre première requête

    Copiez l'exemple pour votre langage et lancez-le.

    Texte vers texteGemini API
    POST/v1beta/models/gemini-3.5-flash:generateContent
    Format d'API:
    curl "https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash:generateContent" \
      -H "Content-Type: application/json" \
      -H "x-goog-api-key: sk-xxx" \
      -d '{
        "contents": [
          {"role": "user", "parts": [{"text": "Hello!"}]}
        ]
      }'

Tarification

Le prix Verified s’applique à Verified, moins cher sur la plupart des modèles. Le prix Official est le prix publié par le fabricant du modèle et s’applique à la route Official, plus fiable. Auto facture la route qui termine la requête.

Spécification par défaut

Par 1M Token
Prix Official
Entrée $1.50 / Sortie $9.00 / Lecture cache $0.15
Prix Verified
Entrée $0.75 / Sortie $4.50 / Lecture cache $0.075
Remise
-50%
Tarification du cache de prompt

Lecture cache

Prix Official
$0.15
Prix Verified
$0.075
Remise
-50%
Frais d'outils

Facturation à l'appel, uniquement lors de l'utilisation de l'outil par le modèle.

Recherche web

Prix Official
$0.014/recherche
Prix Verified
$0.007/recherche
Remise
-50%

Utilisation et activité

Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.

Utilisation et disponibilité

Dernières 24 heures
Requêtes
Taux de succès
Latence P95
Total des jetons
Performance du modèle
Taux de réussite sur 30 jours
94,8%
Requêtes sur 30 jours
1K+
Dernière activité
il y a 8 minutes

Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.

Ouvrir dans Console

Ouvrez Gemini 3.5 Flash dans Console avec un prompt prêt à modifier ou envoyer.

Aide-moi à tester gemini-3.5-flash avec un message sur /v1beta/models/gemini-3.5-flash:generateContent. Affiche la réponse, la latence et le coût.

Cas d'usage

Idéal pour
  • Raisonnement
  • Vision
  • Chat orienté client

    Répondre aux questions sur les produits avec une base de connaissances mise en cache dans le préfixe de l'invite.

  • Synthèse par lots

    Synthétiser des transcriptions d'appels ou des tickets et générer un résumé JSON fixe par élément.

  • Lecture de formulaires et de documents

    Extraire les champs de formulaires scannés et de bons de livraison vers des enregistrements structurés qu'un système en aval peut charger directement.

  • Aide au codage de niveau débutant

    Expliquer du code, écrire de petites fonctions et rédiger des tests unitaires lorsque la profondeur n'est pas critique.

Exemples de prompts

Synthétisez cette transcription de support en trois points et définissez 'resolved' sur true ou false.

Lisez ce bon de livraison scanné et renvoyez le numéro de commande, les articles et le statut de la signature au format JSON.

Écrivez une fonction Python qui analyse les dates ISO à partir de chaînes de caractères complexes, ainsi que cinq cas de test.

Ce modèle a une tarification conditionnelle. Les totaux mensuels de tokens ne suffisent pas pour une estimation fiable ; utilisez la tarification détaillée selon la spécification de la requête, le cache et la fenêtre applicable.

FAQ

Qu'est-ce que Gemini 3.5 Flash ?

Un modèle Gemini stable de la gamme Flash destiné aux tâches courantes à haut débit. Il accepte du texte et des images, utilise des outils et produit des sorties structurées, en mettant l'accent sur une vitesse constante plutôt que sur une profondeur maximale.

Comment se compare-t-il à Gemini 3.5 Flash-Lite ?

Flash-Lite est le modèle 3.5 le plus rapide et le plus économique de Google ; Flash est le modèle plus complet pour les tâches nécessitant plus d'attention. Choisissez Lite pour le marquage et l'extraction, et Flash pour la conversation et les sorties plus longues.

Est-il adapté aux agents de codage ?

Il peut gérer de petites tâches de codage, mais les modèles Flash 3.7 et 3.8 ultérieurs de Google sont ceux conçus pour le codage complexe et les agents à long terme. Utilisez 3.5 Flash lorsque le travail est simple et le volume élevé.

Prend-il en charge les images et la mise en cache ?

Oui aux deux. Les images peuvent être incluses à côté du texte dans une seule requête, et la mise en cache du contexte réutilise un long préfixe partagé sur de nombreuses requêtes, comme un ensemble d'instructions fixes.

Combien coûte Gemini 3.5 Flash ?

Sur TokenLab, Gemini 3.5 Flash coûte Entrée $0.75 / Sortie $4.50 Par 1M Token. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.

Quelles sont les limites de contexte et de sortie de Gemini 3.5 Flash ?

Gemini 3.5 Flash accepte jusqu'à 1 048 576 jetons de contexte et génère jusqu'à 65 536 jetons par réponse.

Quel endpoint Gemini 3.5 Flash doit-il utiliser ?

Utilisez https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash:generateContent pour Gemini 3.5 Flash. L'exemple de requête ci-dessous montre la structure de code correspondante.

Quelles opérations Gemini 3.5 Flash prend-il en charge ?

Gemini 3.5 Flash prend en charge Texte vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.

Comparer Gemini 3.5 Flash

Guides utilisant Gemini 3.5 Flash

Sources

Mis à jour le 2 oct. 2026

Plus de la série Gemini 3

Modèles associés