Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

DeepSeek: DeepSeek V4 Flash

DeepSeek V4 Flash gère les longues conversations textuelles et le travail assisté par outils. Son contexte d'un million de jetons est utile lorsqu'un assistant doit raisonner sur une collection importante de documents ou garder une vaste base de code en vue.
Comparer les modèles
deepseek-v4-flash
DisponibleDeepSeekDiscussion
Entrée / Sortie
$0.15 / $0.60
Contexte
1M
Date de sortie
24 avr. 2026
Sortie maximale
384K
Modalités
VisionDiscussion
Capacités
Utilisation d'outilsCache de promptsRaisonnement

À propos de DeepSeek V4 Flash

DeepSeek V4 Flash est le plus petit modèle de la génération V4 de DeepSeek, un modèle de langage à mélange d'experts (MoE) à poids ouverts avec 284B de paramètres au total et 13B de paramètres actifs. DeepSeek le positionne pour sa vitesse et son faible coût de service tout en maintenant un raisonnement proche de V4 Pro. Il fonctionne en modes réflexion et sans réflexion, appelle des outils, met en cache les prompts et répond en JSON sur demande. C'est un modèle textuel.

Points forts

  • DeepSeek rapporte que son raisonnement correspond étroitement à celui de V4 Pro et qu'il tient la route sur les tâches d'agent de base, avec un nombre de paramètres actifs beaucoup plus faible.
  • La réflexion peut être activée par requête avec un effort faible, élevé ou maximal, permettant à un seul modèle de couvrir les réponses rapides et la résolution de problèmes plus lente.
  • Une fenêtre de contexte très longue permet à un assistant de garder une large base de code ou une collection substantielle de documents en vue tout au long d'une conversation.
  • Il prend en charge les appels d'outils, la sortie JSON structurée et la mise en cache des prompts, ce qui aide les longues boucles d'agent qui renvoient les mêmes instructions.

Quand préférer un autre modèle

  • C'est un modèle textuel ; le travail impliquant des captures d'écran ou des diagrammes doit être effectué sur DeepSeek V4.1 Flash ou la variante vision-exp.
  • DeepSeek indique que V4 Pro est en tête sur les benchmarks de codage agentique et les connaissances générales ; les tâches de codage et de recherche les plus complexes conviennent donc mieux à Pro.
  • En mode réflexion, le texte de raisonnement est renvoyé séparément et doit être transmis lors des tours d'outils ultérieurs, ce que le code de l'agent doit gérer.

Pour commencer

  1. Créer une clé API

    Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.

  2. Envoyez votre première requête

    Copiez l'exemple pour votre langage et lancez-le.

    Texte vers texteResponses API
    POST/v1/responses
    Format d'API:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "deepseek-v4-flash",
        "input": "Hello!"
      }'

Tarification

Le tarif TokenLab s'applique à Verified pour réduire vos coûts. Le tarif officiel s'applique à la route Official pour une fiabilité optimale. Auto sélectionne la route qui garantit le succès de votre requête.

Période tarifaire · Heures creuses

Par 1M Token
Tarif Official
Entrée $0.15 / Sortie $0.60 / Lecture cache $0.003
Official
Entrée $0.15 / Sortie $0.60 / Lecture cache $0.003
Remise
—

Période tarifaire · Heures pleines

Par 1M Token
Tarif Official
Entrée $0.30 / Sortie $1.20 / Lecture cache $0.006
Official
Entrée $0.30 / Sortie $1.20 / Lecture cache $0.006
Remise
—
Tarification du cache de prompt

Lecture cache

Tarif Official
$0.003
Official
$0.003
Remise
—

Utilisation et activité

Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.

Utilisation et disponibilité

Dernières 24 heures
Requêtes
Taux de succès
Latence P95
Total des jetons
Performance du modèle
Taux de réussite sur 30 jours
99,5%
Requêtes sur 30 jours
100+
Dernière activité
il y a 10 heures

Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.

Ouvrir dans Console

Ouvrez DeepSeek V4 Flash dans Console avec un prompt prêt à modifier ou envoyer.

Aide-moi à tester deepseek-v4-flash avec un message sur /v1/responses. Affiche la réponse, la latence et le coût.

Cas d'usage

Idéal pour
  • Raisonnement
  • Vision
  • Étapes d'agent à haut volume

    Utilisez-le pour les nombreuses petites décisions au sein d'une boucle d'agent, comme choisir un outil, lire son résultat et planifier l'appel suivant, là où le temps de réponse et le coût s'accumulent.

  • Questions sur l'ensemble d'un dépôt

    Collez une grande base de code ou une pile de documents dans le contexte long et demandez où un comportement est implémenté ou quels fichiers une modification affecterait.

  • Extraction structurée

    Transformez des contrats, des tickets ou des journaux en JSON respectant un schéma, avec la réflexion désactivée pour que chaque enregistrement soit renvoyé rapidement.

  • Remplacement direct pour les anciens noms DeepSeek

    Pointez les clients existants qui utilisaient les noms retirés chat et reasoner vers deepseek-v4-flash, puis choisissez le mode réflexion ou sans réflexion par requête.

Exemples de prompts

La source complète de notre service de facturation suit. Quels modules lisent le champ d'état de la facture, et qu'est-ce qui casse si j'ajoute un nouvel état ?

Extrayez chaque date de renouvellement, période de préavis et frais d'annulation de ces cinq contrats et renvoyez un tableau JSON correspondant à ce schéma.

Vous pouvez appeler search_docs et open_ticket. Un utilisateur signale que les webhooks ont cessé d'arriver hier. Enquêtez avec les outils, puis résumez la cause probable.

Ce modèle a une tarification conditionnelle. Les totaux mensuels de tokens ne suffisent pas pour une estimation fiable ; utilisez la tarification détaillée selon la spécification de la requête, le cache et la fenêtre applicable.

FAQ

Quelle est la différence entre DeepSeek V4 Flash et V4 Pro ?

Flash est le modèle plus petit, avec 13B de paramètres actifs contre 49B pour Pro. DeepSeek affirme que Flash raisonne presque aussi bien que Pro et l'égale sur les tâches d'agent simples, tandis que Pro est plus performant sur le codage agentique et les connaissances générales. Commencez par Flash et passez une tâche à Pro lorsqu'elle échoue.

DeepSeek V4 Flash prend-il en charge le mode réflexion ?

Oui. Activez la réflexion dans la requête et choisissez un effort de raisonnement faible, élevé ou maximal ; élevé est la valeur par défaut. Le raisonnement arrive dans un champ séparé, et les conversations utilisant des outils doivent le renvoyer à chaque tour suivant. Laissez la réflexion désactivée pour les réponses courtes sensibles à la latence.

DeepSeek V4 Flash peut-il lire des images ?

Non. C'est un modèle textuel : le texte entre et le texte sort. DeepSeek V4.1 Flash et la variante V4 Flash vision-exp sont des modèles distincts qui comprennent les images ; utilisez donc l'un d'eux lorsque le prompt inclut des captures d'écran ou des diagrammes.

À quoi sert le contexte long ?

Il permet à une requête de transporter un dépôt entier ou une pile de documents, afin que le modèle puisse répondre où un comportement est implémenté ou quels fichiers une modification touche sans récupération intermédiaire. Associez-le à la mise en cache des prompts lorsque le même matériel est envoyé de manière répétée.

Qu'est-il arrivé aux anciens noms deepseek-chat et deepseek-reasoner ?

DeepSeek les a abandonnés le 24 juillet 2026. Pendant la transition, ils étaient mappés sur V4 Flash en modes sans réflexion et avec réflexion. Le nouveau code doit appeler deepseek-v4-flash et définir l'option de réflexion, plutôt que de compter sur des noms distincts pour chaque mode.

Combien coûte DeepSeek V4 Flash ?

Sur TokenLab, DeepSeek V4 Flash coûte Entrée $0.15 / Sortie $0.60 Par 1M Token. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.

Quelles sont les limites de contexte et de sortie de DeepSeek V4 Flash ?

DeepSeek V4 Flash accepte jusqu'à 1 000 000 jetons de contexte et génère jusqu'à 384 000 jetons par réponse.

Quel endpoint DeepSeek V4 Flash doit-il utiliser ?

Utilisez https://api.tokenlab.sh/v1/responses pour DeepSeek V4 Flash. L'exemple de requête ci-dessous montre la structure de code correspondante.

Quelles opérations DeepSeek V4 Flash prend-il en charge ?

DeepSeek V4 Flash prend en charge Texte vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.

Comparer DeepSeek V4 Flash

Guides utilisant DeepSeek V4 Flash

Sources

Mis à jour le 2 oct. 2026

Plus de la série DeepSeek V4

Modèles associés