Alibaba: Qwen3.5-Flash
qwen3.5-flash- Entrée / Sortie
- $0.10 / $0.40
- Contexte
- 992K
- Sortie maximale
- 64K
- Modalités
- Discussion
- Capacités
- Cache de prompts
À propos de Qwen3.5-Flash
Qwen3.5-Flash est le niveau d'hébergement plus léger de la famille Qwen3.5 d'Alibaba, conçu pour un traitement de texte plus rapide et moins coûteux que Qwen3.5-Plus. Il dispose d'un très grand contexte et de la mise en cache des invites (prompt caching), ce qui est adapté à la synthèse et aux passages répétés sur une même source volumineuse. Il partage la large couverture linguistique de la famille.
Points forts
- La mise en cache des invites facilite la consultation répétée d'une source volumineuse.
- Optimisé pour la vitesse par rapport au niveau Plus.
- Partage la couverture de 201 langues de la famille Qwen3.5.
- Bien adapté aux étapes de pipeline telles que la synthèse ou l'étiquetage.
Quand préférer un autre modèle
- Qwen3.5-Plus est plus performant pour les analyses complexes.
- Il ne traite que le texte, il ne peut donc pas remplacer un modèle de vision.
- Plus ancien que Qwen3.8-Flash, qui rapporte des résultats de codage agentique.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
Texte vers texteResponses APIPOST/v1/responsesFormat d'API:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "qwen3.5-flash", "input": "Hello!" }'
Tarification
Le tarif TokenLab s'applique à Verified pour réduire vos coûts. Le tarif officiel s'applique à la route Official pour une fiabilité optimale. Auto sélectionne la route qui garantit le succès de votre requête.
Entrée tokens <= 125K
Par 1M Token- Tarif Official
- Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40
- Official
- Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40
- Remise
- —
Entrée tokens <= 250K
Par 1M Token- Tarif Official
- Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40
- Official
- Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40
- Remise
- —
Entrée tokens <= 1M
Par 1M Token- Tarif Official
- Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40
- Official
- Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40
- Remise
- —
Lecture cache
- Tarif Official
- $0.01
- Official
- $0.01
- Remise
- —
Jetons d'écriture cache
- Tarif Official
- $0.125
- Official
- $0.125
- Remise
- —
| Tarif OfficialPar 1M Token | OfficialPar 1M Token | Remise | |
|---|---|---|---|
| Entrée tokens <= 125K | Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40 | Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40 | — |
| Entrée tokens <= 250K | Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40 | Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40 | — |
| Entrée tokens <= 1M | Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40 | Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40 | — |
| Tarification du cache de prompt | |||
| Lecture cache | $0.01 | $0.01 | — |
| Jetons d'écriture cache | $0.125 | $0.125 | — |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Ouvrir dans Console
Ouvrez Qwen3.5-Flash dans Console avec un prompt prêt à modifier ou envoyer.
Aide-moi à tester qwen3.5-flash avec un message sur /v1/responses. Affiche la réponse, la latence et le coût.
Cas d'usage
Synthèse par lots
Condensez de longs rapports dans un pipeline nocturne, avec la même source volumineuse mise en cache à travers les sections sur lesquelles vous posez des questions.
Étiquetage et routage de documents
Étiquetez de longs textes par sujet, urgence ou propriétaire et renvoyez le résultat dans un format fixe que le code en aval peut analyser.
Questions-réponses répétées sur une source unique
Mettez en cache un manuel ou une politique une seule fois et posez de nombreuses questions à son sujet sans payer pour retraiter tout le texte à chaque fois.
Nettoyage de brouillons
Corrigez la grammaire, le ton et la structure de longs brouillons tout en conservant intacts les arguments et les chiffres de l'auteur.
Exemples de prompts
Résumez chaque section de ce manuel en deux lignes.
Étiquetez ce ticket avec le domaine produit et l'urgence, puis renvoyez du JSON.
Répondez aux questions sur la politique collée ; répondez « non indiqué » si l'information est absente.
Ce modèle a une tarification conditionnelle. Les totaux mensuels de tokens ne suffisent pas pour une estimation fiable ; utilisez la tarification détaillée selon la spécification de la requête, le cache et la fenêtre applicable.
FAQ
Qu'est-ce que Qwen3.5-Flash exactement ?
Il s'agit du niveau d'hébergement plus léger de la famille Qwen3.5 d'Alibaba, visant un traitement rapide de longs textes. Il se situe en dessous de Qwen3.5-Plus en termes de puissance et est destiné aux étapes documentaires répétitives et routinières.
Quand devrais-je choisir Flash plutôt que Qwen3.5-Plus ?
Choisissez Flash lorsque la vitesse et le coût importent plus que la profondeur, comme pour la synthèse en masse, l'étiquetage ou les questions-réponses sur une source fixe. Passez à Plus lorsque les réponses nécessitent une analyse plus minutieuse à travers de nombreux passages.
Qwen3.5-Flash prend-il en charge la mise en cache des invites ?
Oui. La mise en cache des invites aide lorsque la même source longue est envoyée encore et encore, comme dans les étapes répétées de traitement de documents où seule la question change entre les appels.
Qwen3.5-Flash peut-il lire des images ?
Non. Qwen3.5-Flash ne traite que le texte. Utilisez Qwen3.8-Flash, Qwen3.7-Plus ou Qwen3-VL Plus lorsque des captures d'écran, des scans ou des graphiques font partie de la tâche, et envoyez le texte extrait à ce modèle à la place.
Existe-t-il un modèle Flash plus récent d'Alibaba ?
Oui. Qwen3.8-Flash est un modèle multimodal de mélange d'experts plus récent, axé sur le codage agentique et le travail d'agent à long terme. Gardez Qwen3.5-Flash pour les pipelines de texte brut qui fonctionnent déjà bien.
Combien coûte Qwen3.5-Flash ?
Sur TokenLab, Qwen3.5-Flash coûte Entrée $0.10 / Sortie $0.40 Par 1M Token. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.
Quelles sont les limites de contexte et de sortie de Qwen3.5-Flash ?
Qwen3.5-Flash accepte jusqu'à 991 808 jetons de contexte et génère jusqu'à 65 536 jetons par réponse.
Quel endpoint Qwen3.5-Flash doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1/responses pour Qwen3.5-Flash. L'exemple de requête ci-dessous montre la structure de code correspondante.
Quelles opérations Qwen3.5-Flash prend-il en charge ?
Qwen3.5-Flash prend en charge Texte vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.
Comparer Qwen3.5-Flash
Sources
Mis à jour le 2 oct. 2026