Alibaba: Qwen Flash
qwen-flash- Entrada / Saída
- $0.05 / $0.40
- Contexto
- 998K
- Saída máxima
- 32K
- Modalidades
- Chat
- Capacidades
- Cache de promptsRaciocínio
Sobre o Qwen Flash
Qwen Flash é o modelo de texto geral rápido e de baixo custo da Alibaba na linha Qwen, voltado para trabalhos de alto volume, como sumarização, reescrita e assistentes simples. Ele fica abaixo do Qwen Plus e do Qwen Max em capacidade e é o modelo a ser testado primeiro quando o volume é mais importante do que a profundidade. A Alibaba o lista entre seus nomes Qwen legados, com as gerações mais novas Qwen3 recomendadas para novos projetos.
Pontos fortes
- Sumarizar e reformatar grandes quantidades de texto com baixa latência por solicitação.
- Manter um documento de origem longo disponível na conversa enquanto ele sumariza ou responde.
- Um modo de pensamento opcional permite que você gaste raciocínio apenas nas solicitações que precisam dele.
- O cache de prompt reduz o trabalho repetido quando um prompt de sistema longo ou documento é reutilizado.
Quando usar outro modelo
- Apenas entrada de texto, sem chamada de ferramentas.
- A profundidade de raciocínio e a qualidade da escrita ficam atrás do Qwen Plus e do Qwen Max em tarefas de análise complexas.
- A Alibaba o lista como um nome legado, portanto, um modelo Qwen3 atual pode ser mais adequado para uma nova construção.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
Texto para textoResponses APIPOST/v1/responsesFormato da API:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "qwen-flash", "input": "Hello!" }'
Preço
O preço Verified vale para o Verified, que custa menos na maioria dos modelos. O preço Official é o preço publicado pelo fabricante do modelo e vale para a rota Official, mais confiável. O Auto cobra pela rota que conclui a solicitação.
Entrada tokens <= 125K
Por 1M Token- Preço Official
- Entrada $0.05 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.0625 / Texto Entrada $0.05 / Texto Saída $0.40
- Preço Verified
- —
- Desconto
- —
Entrada tokens <= 250K
Por 1M Token- Preço Official
- Entrada $0.05 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.0625 / Texto Entrada $0.05 / Texto Saída $0.40
- Preço Verified
- —
- Desconto
- —
Entrada tokens <= 1M
Por 1M Token- Preço Official
- Entrada $0.25 / Saída $2.00 / Leitura de cache $0.05 / Escrita de cache $0.3125 / Texto Entrada $0.25 / Texto Saída $2.00
- Preço Verified
- —
- Desconto
- —
Leitura de cache
- Preço Official
- $0.01
- Preço Verified
- —
- Desconto
- —
Escrita de cache
- Preço Official
- $0.0625
- Preço Verified
- —
- Desconto
- —
| Preço OfficialPor 1M Token | Preço VerifiedPor 1M Token | Desconto | |
|---|---|---|---|
| Entrada tokens <= 125K | Entrada $0.05 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.0625 / Texto Entrada $0.05 / Texto Saída $0.40 | — | — |
| Entrada tokens <= 250K | Entrada $0.05 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.0625 / Texto Entrada $0.05 / Texto Saída $0.40 | — | — |
| Entrada tokens <= 1M | Entrada $0.25 / Saída $2.00 / Leitura de cache $0.05 / Escrita de cache $0.3125 / Texto Entrada $0.25 / Texto Saída $2.00 | — | — |
| Preços de cache de prompt | |||
| Leitura de cache | $0.01 | — | — |
| Escrita de cache | $0.0625 | — | — |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Abrir no Console
Abra Qwen Flash no Console com um prompt pronto para editar ou enviar.
Ajude-me a testar qwen-flash com uma mensagem em /v1/responses. Exiba a resposta, latência e custo.
Casos de uso
Indicado para- Raciocínio
Sumarização em massa
Condense milhares de artigos, transcrições de chamadas ou avaliações em resumos curtos, com o mesmo prompt aplicado a cada item.
Transformação de conteúdo
Converta texto entre tons, idiomas ou formatos, como transformar notas em um e-mail polido ou uma tabela em prosa.
Assistentes de chat leves
Dê suporte a um bot de FAQ ou assistente no aplicativo onde as respostas são curtas e o tempo de resposta importa mais do que a nuance.
Perguntas e respostas sobre documentos longos
Cole um manual longo ou conjunto de políticas no prompt e responda às perguntas da equipe diretamente a partir dele.
Exemplos de prompt
Reescreva a seguinte descrição de produto em um tom amigável, com no máximo 60 palavras, e mantenha o número do modelo inalterado.
Resuma esta transcrição de reunião em decisões, itens de ação com responsáveis e perguntas não resolvidas.
Usando apenas o texto da política acima, responda: um contratado pode solicitar reembolso de despesas de viagem? Cite a cláusula que você usou.
Este modelo tem preço condicional. Totais mensais de tokens sozinhos não produzem uma estimativa confiável; use o preço detalhado para a especificação da requisição, cache e janela aplicável.
FAQ
Para que o Qwen Flash é melhor?
Tarefas de texto cotidianas de alto volume: resumos, reescritas, transformações de estilo de tradução e assistentes simples. É a camada rápida e barata da linha Qwen, portanto, use-a quando o rendimento for importante e a tarefa não exigir raciocínio profundo.
Como o Qwen Flash é diferente do Qwen Plus?
O Flash é a camada orientada para velocidade e o Plus é a equilibrada. O Plus oferece análise e escrita mais fortes; o Flash realiza trabalhos simples de forma mais rápida e barata. Comece no Flash e mova tarefas específicas para o Plus se as respostas não forem satisfatórias.
O Qwen Flash suporta o modo de pensamento?
Sim. O pensamento pode ser ativado para solicitações que precisam de raciocínio passo a passo e desativado para as simples. A documentação da Alibaba lista o modo de pensamento como suportado para este modelo.
O Qwen Flash pode processar imagens ou chamar ferramentas?
Não. É um modelo de entrada e saída de texto sem entrada de imagem ou chamada de ferramentas. Escolha um modelo de visão Qwen ou outra família se a solicitação exigir qualquer um dos dois.
O Qwen Flash é uma boa escolha para um novo projeto?
Pipelines existentes podem continuar nele, e ele permanece utilizável para trabalhos estáveis de alto volume. Para uma nova construção, a Alibaba aponta para as gerações mais novas Qwen3, portanto, compare-o primeiro com o Qwen3.8 Flash.
Quanto custa o Qwen Flash?
No TokenLab, Qwen Flash custa Entrada $0.05 / Saída $0.40 Por 1M Token. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.
Qual a janela de contexto e o limite de saída do Qwen Flash?
O Qwen Flash aceita até 997.952 tokens de contexto e gera até 32.768 tokens por resposta.
Qual endpoint o Qwen Flash deve usar?
Use https://api.tokenlab.sh/v1/responses para Qwen Flash. O exemplo de requisição abaixo mostra o formato de código correspondente.
Quais operações o Qwen Flash suporta?
Qwen Flash suporta Texto para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.
Comparar Qwen Flash
Fontes
Revisado em 2 de out. de 2026