Alibaba: Qwen Flash
qwen-flash- Entrée / Sortie
- $0.05 / $0.40
- Contexte
- 998K
- Sortie maximale
- 32K
- Modalités
- Discussion
- Capacités
- Cache de promptsRaisonnement
À propos de Qwen Flash
Qwen Flash est le modèle de texte général rapide et économique d'Alibaba dans la gamme Qwen, destiné aux travaux à haut volume tels que la synthèse, la réécriture et les assistants simples. Il se situe en dessous de Qwen Plus et Qwen Max en termes de capacités et est celui à tester en priorité lorsque le volume compte plus que la profondeur. Alibaba le classe parmi ses noms Qwen hérités, les nouvelles générations Qwen3 étant recommandées pour les nouveaux projets.
Points forts
- Synthétiser et reformater de grandes quantités de texte avec une faible latence par requête.
- Maintenir un long document source disponible dans la conversation pendant qu'il synthétise ou répond.
- Un mode de réflexion optionnel vous permet de consacrer du raisonnement uniquement aux requêtes qui en ont besoin.
- La mise en cache des invites réduit le travail répétitif lorsqu'une longue invite système ou un document est réutilisé.
Quand préférer un autre modèle
- Entrée de texte uniquement, sans appel d'outils.
- La profondeur de raisonnement et la qualité d'écriture sont inférieures à celles de Qwen Plus et Qwen Max sur les tâches d'analyse complexes.
- Alibaba le répertorie comme un nom hérité ; un modèle Qwen3 actuel pourrait donc mieux convenir à une nouvelle construction.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
Texte vers texteResponses APIPOST/v1/responsesFormat d'API:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "qwen-flash", "input": "Hello!" }'
Tarification
Le tarif TokenLab s'applique à Verified pour réduire vos coûts. Le tarif officiel s'applique à la route Official pour une fiabilité optimale. Auto sélectionne la route qui garantit le succès de votre requête.
Entrée tokens <= 125K
Par 1M Token- Tarif Official
- Entrée $0.05 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.0625 / Texte Entrée $0.05 / Texte Sortie $0.40
- Official
- Entrée $0.05 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.0625 / Texte Entrée $0.05 / Texte Sortie $0.40
- Remise
- —
Entrée tokens <= 250K
Par 1M Token- Tarif Official
- Entrée $0.05 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.0625 / Texte Entrée $0.05 / Texte Sortie $0.40
- Official
- Entrée $0.05 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.0625 / Texte Entrée $0.05 / Texte Sortie $0.40
- Remise
- —
Entrée tokens <= 1M
Par 1M Token- Tarif Official
- Entrée $0.25 / Sortie $2.00 / Lecture cache $0.05 / Jetons d'écriture cache $0.3125 / Texte Entrée $0.25 / Texte Sortie $2.00
- Official
- Entrée $0.25 / Sortie $2.00 / Lecture cache $0.05 / Jetons d'écriture cache $0.3125 / Texte Entrée $0.25 / Texte Sortie $2.00
- Remise
- —
Lecture cache
- Tarif Official
- $0.01
- Official
- $0.01
- Remise
- —
Jetons d'écriture cache
- Tarif Official
- $0.0625
- Official
- $0.0625
- Remise
- —
| Tarif OfficialPar 1M Token | OfficialPar 1M Token | Remise | |
|---|---|---|---|
| Entrée tokens <= 125K | Entrée $0.05 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.0625 / Texte Entrée $0.05 / Texte Sortie $0.40 | Entrée $0.05 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.0625 / Texte Entrée $0.05 / Texte Sortie $0.40 | — |
| Entrée tokens <= 250K | Entrée $0.05 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.0625 / Texte Entrée $0.05 / Texte Sortie $0.40 | Entrée $0.05 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.0625 / Texte Entrée $0.05 / Texte Sortie $0.40 | — |
| Entrée tokens <= 1M | Entrée $0.25 / Sortie $2.00 / Lecture cache $0.05 / Jetons d'écriture cache $0.3125 / Texte Entrée $0.25 / Texte Sortie $2.00 | Entrée $0.25 / Sortie $2.00 / Lecture cache $0.05 / Jetons d'écriture cache $0.3125 / Texte Entrée $0.25 / Texte Sortie $2.00 | — |
| Tarification du cache de prompt | |||
| Lecture cache | $0.01 | $0.01 | — |
| Jetons d'écriture cache | $0.0625 | $0.0625 | — |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Ouvrir dans Console
Ouvrez Qwen Flash dans Console avec un prompt prêt à modifier ou envoyer.
Aide-moi à tester qwen-flash avec un message sur /v1/responses. Affiche la réponse, la latence et le coût.
Cas d'usage
Idéal pour- Raisonnement
Synthèse en masse
Condensez des milliers d'articles, de transcriptions d'appels ou d'avis en courts résumés, avec la même invite appliquée à chaque élément.
Transformation de contenu
Convertissez du texte entre différents tons, langues ou formats, comme transformer des notes en un e-mail soigné ou un tableau en prose.
Assistants de chat légers
Prenez en charge un bot FAQ ou un assistant intégré à une application où les réponses sont courtes et où le temps de réponse compte plus que la nuance.
Questions-réponses sur de longs documents
Collez un long manuel ou un ensemble de politiques dans l'invite et répondez aux questions du personnel directement à partir de celui-ci.
Exemples de prompts
Réécrivez la description de produit suivante sur un ton amical, 60 mots maximum, et conservez le numéro de modèle inchangé.
Synthétisez cette transcription de réunion en décisions, points d'action avec responsables et questions non résolues.
En utilisant uniquement le texte de la politique ci-dessus, répondez : un entrepreneur peut-il réclamer des frais de déplacement ? Citez la clause que vous avez utilisée.
Ce modèle a une tarification conditionnelle. Les totaux mensuels de tokens ne suffisent pas pour une estimation fiable ; utilisez la tarification détaillée selon la spécification de la requête, le cache et la fenêtre applicable.
FAQ
À quoi Qwen Flash est-il le mieux adapté ?
Tâches textuelles quotidiennes à haut volume : synthèses, réécritures, transformations de type traduction et assistants simples. C'est le niveau rapide et peu coûteux de la gamme Qwen ; utilisez-le donc lorsque le débit compte et que la tâche ne nécessite pas un raisonnement approfondi.
En quoi Qwen Flash est-il différent de Qwen Plus ?
Flash est le niveau axé sur la vitesse et Plus est le niveau équilibré. Plus offre une analyse et une écriture plus solides ; Flash permet d'effectuer des tâches simples plus rapidement et à moindre coût. Commencez par Flash et déplacez des tâches spécifiques vers Plus si les réponses ne sont pas satisfaisantes.
Qwen Flash prend-il en charge le mode de réflexion ?
Oui. La réflexion peut être activée pour les requêtes nécessitant un raisonnement étape par étape et désactivée pour les requêtes simples. La documentation d'Alibaba répertorie le mode de réflexion comme pris en charge pour ce modèle.
Qwen Flash peut-il traiter des images ou appeler des outils ?
Non. Il s'agit d'un modèle texte-entrée, texte-sortie sans entrée d'image ni appel d'outils. Choisissez un modèle de vision Qwen ou une autre famille si la requête nécessite l'un ou l'autre.
Qwen Flash est-il un bon choix pour un nouveau projet ?
Les pipelines existants peuvent continuer à l'utiliser, et il reste utilisable pour des tâches stables à haut volume. Pour une nouvelle construction, Alibaba oriente vers les nouvelles générations Qwen3 ; comparez-le donc d'abord avec Qwen3.8 Flash.
Combien coûte Qwen Flash ?
Sur TokenLab, Qwen Flash coûte Entrée $0.05 / Sortie $0.40 Par 1M Token. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.
Quelles sont les limites de contexte et de sortie de Qwen Flash ?
Qwen Flash accepte jusqu'à 997 952 jetons de contexte et génère jusqu'à 32 768 jetons par réponse.
Quel endpoint Qwen Flash doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1/responses pour Qwen Flash. L'exemple de requête ci-dessous montre la structure de code correspondante.
Quelles opérations Qwen Flash prend-il en charge ?
Qwen Flash prend en charge Texte vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.
Comparer Qwen Flash
Sources
Mis à jour le 2 oct. 2026