Alibaba: Qwen3.5-Flash
qwen3.5-flash- Entrada / Saída
- $0.10 / $0.40
- Contexto
- 992K
- Saída máxima
- 64K
- Modalidades
- Chat
- Capacidades
- Cache de prompts
Sobre o Qwen3.5-Flash
O Qwen3.5-Flash é a camada hospedada mais leve da família Qwen3.5 da Alibaba, criada para um processamento de texto mais rápido e barato do que o Qwen3.5-Plus. Ele possui um contexto muito grande e cache de prompt, o que é adequado para sumarização e passagens repetidas pela mesma fonte extensa. Ele compartilha a ampla cobertura de idiomas da família.
Pontos fortes
- O cache de prompt auxilia na consulta repetida de uma única fonte extensa.
- Otimizado para velocidade em relação à camada Plus.
- Compartilha a cobertura de 201 idiomas da família Qwen3.5.
- Uma boa opção para etapas de pipeline, como sumarização ou marcação.
Quando usar outro modelo
- O Qwen3.5-Plus é melhor em análises mais complexas.
- Ele aceita apenas texto, portanto, não pode substituir um modelo de visão.
- Mais antigo que o Qwen3.8-Flash, que reporta resultados de codificação agentica.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
Texto para textoResponses APIPOST/v1/responsesFormato da API:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "qwen3.5-flash", "input": "Hello!" }'
Preço
O preço TokenLab aplica-se ao Verified, que é mais barato na maioria dos modelos. O preço oficial segue a tabela do criador e aplica-se à rota Official, que é mais confiável. O modo Auto cobra pela rota que finalizar o seu pedido.
Entrada tokens <= 125K
Por 1M Token- Preço oficial
- Entrada $0.10 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.125 / Texto Entrada $0.10 / Texto Saída $0.40
- Official
- Entrada $0.10 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.125 / Texto Entrada $0.10 / Texto Saída $0.40
- Desconto
- —
Entrada tokens <= 250K
Por 1M Token- Preço oficial
- Entrada $0.10 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.125 / Texto Entrada $0.10 / Texto Saída $0.40
- Official
- Entrada $0.10 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.125 / Texto Entrada $0.10 / Texto Saída $0.40
- Desconto
- —
Entrada tokens <= 1M
Por 1M Token- Preço oficial
- Entrada $0.10 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.125 / Texto Entrada $0.10 / Texto Saída $0.40
- Official
- Entrada $0.10 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.125 / Texto Entrada $0.10 / Texto Saída $0.40
- Desconto
- —
Leitura de cache
- Preço oficial
- $0.01
- Official
- $0.01
- Desconto
- —
Escrita de cache
- Preço oficial
- $0.125
- Official
- $0.125
- Desconto
- —
| Preço oficialPor 1M Token | OfficialPor 1M Token | Desconto | |
|---|---|---|---|
| Entrada tokens <= 125K | Entrada $0.10 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.125 / Texto Entrada $0.10 / Texto Saída $0.40 | Entrada $0.10 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.125 / Texto Entrada $0.10 / Texto Saída $0.40 | — |
| Entrada tokens <= 250K | Entrada $0.10 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.125 / Texto Entrada $0.10 / Texto Saída $0.40 | Entrada $0.10 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.125 / Texto Entrada $0.10 / Texto Saída $0.40 | — |
| Entrada tokens <= 1M | Entrada $0.10 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.125 / Texto Entrada $0.10 / Texto Saída $0.40 | Entrada $0.10 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.125 / Texto Entrada $0.10 / Texto Saída $0.40 | — |
| Preços de cache de prompt | |||
| Leitura de cache | $0.01 | $0.01 | — |
| Escrita de cache | $0.125 | $0.125 | — |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Abrir no Console
Abra Qwen3.5-Flash no Console com um prompt pronto para editar ou enviar.
Ajude-me a testar qwen3.5-flash com uma mensagem em /v1/responses. Exiba a resposta, latência e custo.
Casos de uso
Sumarização em lote
Condense relatórios longos em um pipeline noturno, com a mesma fonte extensa armazenada em cache nas seções sobre as quais você pergunta.
Marcação e roteamento de documentos
Rotule textos longos por tópico, urgência ou proprietário e retorne o resultado em um formato fixo que o código subsequente possa analisar.
Perguntas e respostas repetidas sobre uma fonte
Armazene um manual ou política em cache uma vez e faça muitas perguntas sobre ele sem pagar para reprocessar todo o texto a cada turno.
Limpeza de rascunhos
Corrija a gramática, o tom e a estrutura em rascunhos longos, mantendo as afirmações e números do autor intactos.
Exemplos de prompt
Resuma cada seção deste manual em duas linhas.
Marque este ticket com a área do produto e urgência e retorne em JSON.
Responda a perguntas sobre a política colada; responda 'não mencionado' se estiver ausente.
Este modelo tem preço condicional. Totais mensais de tokens sozinhos não produzem uma estimativa confiável; use o preço detalhado para a especificação da requisição, cache e janela aplicável.
FAQ
O que é exatamente o Qwen3.5-Flash?
É a camada hospedada mais leve da família Qwen3.5 da Alibaba, voltada para o processamento rápido de textos longos. Ele está abaixo do Qwen3.5-Plus em capacidade e destina-se a etapas de documentos rotineiras e repetidas.
Quando devo escolher o Flash em vez do Qwen3.5-Plus?
Escolha o Flash quando a velocidade e o custo forem mais importantes do que a profundidade, como em sumarização em massa, marcação ou perguntas e respostas sobre uma fonte fixa. Mude para o Plus quando as respostas exigirem uma análise mais cuidadosa em várias passagens.
O Qwen3.5-Flash suporta cache de prompt?
Sim. O cache de prompt ajuda quando a mesma fonte longa é enviada repetidamente, como em etapas repetidas de processamento de documentos onde apenas a pergunta muda entre as chamadas.
O Qwen3.5-Flash consegue ler imagens?
Não. O Qwen3.5-Flash aceita apenas texto. Use o Qwen3.8-Flash, Qwen3.7-Plus ou Qwen3-VL Plus quando capturas de tela, digitalizações ou gráficos fizerem parte da tarefa, e envie o texto extraído para este modelo.
Existe um modelo Flash mais novo da Alibaba?
Sim. O Qwen3.8-Flash é um modelo multimodal de especialistas (mixture-of-experts) mais novo, voltado para codificação agentica e trabalho de agente de longo prazo. Mantenha o Qwen3.5-Flash para pipelines de texto simples que já apresentam bom desempenho.
Quanto custa o Qwen3.5-Flash?
No TokenLab, Qwen3.5-Flash custa Entrada $0.10 / Saída $0.40 Por 1M Token. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.
Qual a janela de contexto e o limite de saída do Qwen3.5-Flash?
O Qwen3.5-Flash aceita até 991.808 tokens de contexto e gera até 65.536 tokens por resposta.
Qual endpoint o Qwen3.5-Flash deve usar?
Use https://api.tokenlab.sh/v1/responses para Qwen3.5-Flash. O exemplo de requisição abaixo mostra o formato de código correspondente.
Quais operações o Qwen3.5-Flash suporta?
Qwen3.5-Flash suporta Texto para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.
Comparar Qwen3.5-Flash
Fontes
Revisado em 2 de out. de 2026