Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

Alibaba: Qwen3.5-Flash

Qwen3.5 Flash est l'option axée sur l'efficacité pour le travail textuel à long contexte dans la gamme 3.5. Il peut prendre en charge la synthèse et les étapes répétées de traitement de documents où la même grande source doit être consultée tout au long d'une tâche.
Comparer les modèles
qwen3.5-flash
DisponibleAlibabaDiscussion
Entrée / Sortie
$0.10 / $0.40
Contexte
992K
Sortie maximale
64K
Modalités
Discussion
Capacités
Cache de prompts

À propos de Qwen3.5-Flash

Qwen3.5-Flash est le niveau d'hébergement plus léger de la famille Qwen3.5 d'Alibaba, conçu pour un traitement de texte plus rapide et moins coûteux que Qwen3.5-Plus. Il dispose d'un très grand contexte et de la mise en cache des invites (prompt caching), ce qui est adapté à la synthèse et aux passages répétés sur une même source volumineuse. Il partage la large couverture linguistique de la famille.

Points forts

  • La mise en cache des invites facilite la consultation répétée d'une source volumineuse.
  • Optimisé pour la vitesse par rapport au niveau Plus.
  • Partage la couverture de 201 langues de la famille Qwen3.5.
  • Bien adapté aux étapes de pipeline telles que la synthèse ou l'étiquetage.

Quand préférer un autre modèle

  • Qwen3.5-Plus est plus performant pour les analyses complexes.
  • Il ne traite que le texte, il ne peut donc pas remplacer un modèle de vision.
  • Plus ancien que Qwen3.8-Flash, qui rapporte des résultats de codage agentique.

Pour commencer

  1. Créer une clé API

    Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.

  2. Envoyez votre première requête

    Copiez l'exemple pour votre langage et lancez-le.

    Texte vers texteResponses API
    POST/v1/responses
    Format d'API:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "qwen3.5-flash",
        "input": "Hello!"
      }'

Tarification

Le tarif TokenLab s'applique à Verified pour réduire vos coûts. Le tarif officiel s'applique à la route Official pour une fiabilité optimale. Auto sélectionne la route qui garantit le succès de votre requête.

Entrée tokens <= 125K

Par 1M Token
Tarif Official
Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40
Official
Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40
Remise
—

Entrée tokens <= 250K

Par 1M Token
Tarif Official
Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40
Official
Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40
Remise
—

Entrée tokens <= 1M

Par 1M Token
Tarif Official
Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40
Official
Entrée $0.10 / Sortie $0.40 / Lecture cache $0.01 / Jetons d'écriture cache $0.125 / Texte Entrée $0.10 / Texte Sortie $0.40
Remise
—
Tarification du cache de prompt

Lecture cache

Tarif Official
$0.01
Official
$0.01
Remise
—

Jetons d'écriture cache

Tarif Official
$0.125
Official
$0.125
Remise
—

Utilisation et activité

Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.

Utilisation et disponibilité

Dernières 24 heures
Requêtes
Taux de succès
Latence P95
Total des jetons
Performance du modèle
Les métriques s'affichent une fois les seuils de confidentialité et de volume de données atteints.

Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.

Ouvrir dans Console

Ouvrez Qwen3.5-Flash dans Console avec un prompt prêt à modifier ou envoyer.

Aide-moi à tester qwen3.5-flash avec un message sur /v1/responses. Affiche la réponse, la latence et le coût.

Cas d'usage

  • Synthèse par lots

    Condensez de longs rapports dans un pipeline nocturne, avec la même source volumineuse mise en cache à travers les sections sur lesquelles vous posez des questions.

  • Étiquetage et routage de documents

    Étiquetez de longs textes par sujet, urgence ou propriétaire et renvoyez le résultat dans un format fixe que le code en aval peut analyser.

  • Questions-réponses répétées sur une source unique

    Mettez en cache un manuel ou une politique une seule fois et posez de nombreuses questions à son sujet sans payer pour retraiter tout le texte à chaque fois.

  • Nettoyage de brouillons

    Corrigez la grammaire, le ton et la structure de longs brouillons tout en conservant intacts les arguments et les chiffres de l'auteur.

Exemples de prompts

Résumez chaque section de ce manuel en deux lignes.

Étiquetez ce ticket avec le domaine produit et l'urgence, puis renvoyez du JSON.

Répondez aux questions sur la politique collée ; répondez « non indiqué » si l'information est absente.

Ce modèle a une tarification conditionnelle. Les totaux mensuels de tokens ne suffisent pas pour une estimation fiable ; utilisez la tarification détaillée selon la spécification de la requête, le cache et la fenêtre applicable.

FAQ

Qu'est-ce que Qwen3.5-Flash exactement ?

Il s'agit du niveau d'hébergement plus léger de la famille Qwen3.5 d'Alibaba, visant un traitement rapide de longs textes. Il se situe en dessous de Qwen3.5-Plus en termes de puissance et est destiné aux étapes documentaires répétitives et routinières.

Quand devrais-je choisir Flash plutôt que Qwen3.5-Plus ?

Choisissez Flash lorsque la vitesse et le coût importent plus que la profondeur, comme pour la synthèse en masse, l'étiquetage ou les questions-réponses sur une source fixe. Passez à Plus lorsque les réponses nécessitent une analyse plus minutieuse à travers de nombreux passages.

Qwen3.5-Flash prend-il en charge la mise en cache des invites ?

Oui. La mise en cache des invites aide lorsque la même source longue est envoyée encore et encore, comme dans les étapes répétées de traitement de documents où seule la question change entre les appels.

Qwen3.5-Flash peut-il lire des images ?

Non. Qwen3.5-Flash ne traite que le texte. Utilisez Qwen3.8-Flash, Qwen3.7-Plus ou Qwen3-VL Plus lorsque des captures d'écran, des scans ou des graphiques font partie de la tâche, et envoyez le texte extrait à ce modèle à la place.

Existe-t-il un modèle Flash plus récent d'Alibaba ?

Oui. Qwen3.8-Flash est un modèle multimodal de mélange d'experts plus récent, axé sur le codage agentique et le travail d'agent à long terme. Gardez Qwen3.5-Flash pour les pipelines de texte brut qui fonctionnent déjà bien.

Combien coûte Qwen3.5-Flash ?

Sur TokenLab, Qwen3.5-Flash coûte Entrée $0.10 / Sortie $0.40 Par 1M Token. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.

Quelles sont les limites de contexte et de sortie de Qwen3.5-Flash ?

Qwen3.5-Flash accepte jusqu'à 991 808 jetons de contexte et génère jusqu'à 65 536 jetons par réponse.

Quel endpoint Qwen3.5-Flash doit-il utiliser ?

Utilisez https://api.tokenlab.sh/v1/responses pour Qwen3.5-Flash. L'exemple de requête ci-dessous montre la structure de code correspondante.

Quelles opérations Qwen3.5-Flash prend-il en charge ?

Qwen3.5-Flash prend en charge Texte vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.

Comparer Qwen3.5-Flash

Sources

Mis à jour le 2 oct. 2026

Plus de la série Qwen 3 / QwQ

Modèles associés