Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

Alibaba: Qwen Flash

O Qwen Flash lida com tarefas diárias de texto com uma grande janela de contexto. É um candidato para sumarização de alto volume, transformação de conteúdo e assistentes que precisam manter material de origem longo disponível na conversa.
Comparar modelos
qwen-flash
DisponívelAlibabaChat
Entrada / Saída
$0.05 / $0.40
Contexto
998K
Saída máxima
32K
Modalidades
Chat
Capacidades
Cache de promptsRaciocínio

Sobre o Qwen Flash

Qwen Flash é o modelo de texto geral rápido e de baixo custo da Alibaba na linha Qwen, voltado para trabalhos de alto volume, como sumarização, reescrita e assistentes simples. Ele fica abaixo do Qwen Plus e do Qwen Max em capacidade e é o modelo a ser testado primeiro quando o volume é mais importante do que a profundidade. A Alibaba o lista entre seus nomes Qwen legados, com as gerações mais novas Qwen3 recomendadas para novos projetos.

Pontos fortes

  • Sumarizar e reformatar grandes quantidades de texto com baixa latência por solicitação.
  • Manter um documento de origem longo disponível na conversa enquanto ele sumariza ou responde.
  • Um modo de pensamento opcional permite que você gaste raciocínio apenas nas solicitações que precisam dele.
  • O cache de prompt reduz o trabalho repetido quando um prompt de sistema longo ou documento é reutilizado.

Quando usar outro modelo

  • Apenas entrada de texto, sem chamada de ferramentas.
  • A profundidade de raciocínio e a qualidade da escrita ficam atrás do Qwen Plus e do Qwen Max em tarefas de análise complexas.
  • A Alibaba o lista como um nome legado, portanto, um modelo Qwen3 atual pode ser mais adequado para uma nova construção.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Texto para textoResponses API
    POST/v1/responses
    Formato da API:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "qwen-flash",
        "input": "Hello!"
      }'

Preço

O preço Verified vale para o Verified, que custa menos na maioria dos modelos. O preço Official é o preço publicado pelo fabricante do modelo e vale para a rota Official, mais confiável. O Auto cobra pela rota que conclui a solicitação.

Entrada tokens <= 125K

Por 1M Token
Preço Official
Entrada $0.05 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.0625 / Texto Entrada $0.05 / Texto Saída $0.40
Preço Verified
—
Desconto
—

Entrada tokens <= 250K

Por 1M Token
Preço Official
Entrada $0.05 / Saída $0.40 / Leitura de cache $0.01 / Escrita de cache $0.0625 / Texto Entrada $0.05 / Texto Saída $0.40
Preço Verified
—
Desconto
—

Entrada tokens <= 1M

Por 1M Token
Preço Official
Entrada $0.25 / Saída $2.00 / Leitura de cache $0.05 / Escrita de cache $0.3125 / Texto Entrada $0.25 / Texto Saída $2.00
Preço Verified
—
Desconto
—
Preços de cache de prompt

Leitura de cache

Preço Official
$0.01
Preço Verified
—
Desconto
—

Escrita de cache

Preço Official
$0.0625
Preço Verified
—
Desconto
—

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
As métricas aparecerão assim que os limites de privacidade e volume de dados forem atingidos.

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra Qwen Flash no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar qwen-flash com uma mensagem em /v1/responses. Exiba a resposta, latência e custo.

Casos de uso

Indicado para
  • Raciocínio
  • Sumarização em massa

    Condense milhares de artigos, transcrições de chamadas ou avaliações em resumos curtos, com o mesmo prompt aplicado a cada item.

  • Transformação de conteúdo

    Converta texto entre tons, idiomas ou formatos, como transformar notas em um e-mail polido ou uma tabela em prosa.

  • Assistentes de chat leves

    Dê suporte a um bot de FAQ ou assistente no aplicativo onde as respostas são curtas e o tempo de resposta importa mais do que a nuance.

  • Perguntas e respostas sobre documentos longos

    Cole um manual longo ou conjunto de políticas no prompt e responda às perguntas da equipe diretamente a partir dele.

Exemplos de prompt

Reescreva a seguinte descrição de produto em um tom amigável, com no máximo 60 palavras, e mantenha o número do modelo inalterado.

Resuma esta transcrição de reunião em decisões, itens de ação com responsáveis e perguntas não resolvidas.

Usando apenas o texto da política acima, responda: um contratado pode solicitar reembolso de despesas de viagem? Cite a cláusula que você usou.

Este modelo tem preço condicional. Totais mensais de tokens sozinhos não produzem uma estimativa confiável; use o preço detalhado para a especificação da requisição, cache e janela aplicável.

FAQ

Para que o Qwen Flash é melhor?

Tarefas de texto cotidianas de alto volume: resumos, reescritas, transformações de estilo de tradução e assistentes simples. É a camada rápida e barata da linha Qwen, portanto, use-a quando o rendimento for importante e a tarefa não exigir raciocínio profundo.

Como o Qwen Flash é diferente do Qwen Plus?

O Flash é a camada orientada para velocidade e o Plus é a equilibrada. O Plus oferece análise e escrita mais fortes; o Flash realiza trabalhos simples de forma mais rápida e barata. Comece no Flash e mova tarefas específicas para o Plus se as respostas não forem satisfatórias.

O Qwen Flash suporta o modo de pensamento?

Sim. O pensamento pode ser ativado para solicitações que precisam de raciocínio passo a passo e desativado para as simples. A documentação da Alibaba lista o modo de pensamento como suportado para este modelo.

O Qwen Flash pode processar imagens ou chamar ferramentas?

Não. É um modelo de entrada e saída de texto sem entrada de imagem ou chamada de ferramentas. Escolha um modelo de visão Qwen ou outra família se a solicitação exigir qualquer um dos dois.

O Qwen Flash é uma boa escolha para um novo projeto?

Pipelines existentes podem continuar nele, e ele permanece utilizável para trabalhos estáveis de alto volume. Para uma nova construção, a Alibaba aponta para as gerações mais novas Qwen3, portanto, compare-o primeiro com o Qwen3.8 Flash.

Quanto custa o Qwen Flash?

No TokenLab, Qwen Flash custa Entrada $0.05 / Saída $0.40 Por 1M Token. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual a janela de contexto e o limite de saída do Qwen Flash?

O Qwen Flash aceita até 997.952 tokens de contexto e gera até 32.768 tokens por resposta.

Qual endpoint o Qwen Flash deve usar?

Use https://api.tokenlab.sh/v1/responses para Qwen Flash. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o Qwen Flash suporta?

Qwen Flash suporta Texto para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar Qwen Flash

Fontes

Revisado em 2 de out. de 2026

Mais da série Qwen

Modelos relacionados