Alibaba: Qwen Flash
qwen-flash- Entrada / Salida
- $0.05 / $0.40
- Contexto
- 998K
- Salida máxima
- 32K
- Modalidades
- Chat
- Capacidades
- Caché de promptsRazonamiento
Sobre Qwen Flash
Qwen Flash es el modelo de texto general rápido y de bajo costo de Alibaba en la línea Qwen, destinado a trabajos de alto volumen como resúmenes, reescritura y asistentes simples. Se sitúa por debajo de Qwen Plus y Qwen Max en capacidad y es el primero a probar cuando el volumen importa más que la profundidad. Alibaba lo enumera entre sus nombres Qwen heredados, recomendando las nuevas generaciones Qwen3 para proyectos nuevos.
Puntos fuertes
- Resumir y reformatear grandes cantidades de texto con baja latencia por solicitud.
- Mantener un documento fuente extenso disponible en la conversación mientras se resume o responde.
- Un modo de pensamiento opcional le permite dedicar razonamiento solo a las solicitudes que lo necesitan.
- El almacenamiento en caché de prompts reduce el trabajo repetitivo cuando se reutiliza un prompt del sistema o un documento largo.
Cuándo buscar otra opción
- Solo entrada de texto, sin llamadas a herramientas.
- La profundidad de razonamiento y la calidad de escritura están por detrás de Qwen Plus y Qwen Max en tareas de análisis complejo.
- Alibaba lo enumera como un nombre heredado, por lo que un modelo Qwen3 actual podría adaptarse mejor a una nueva construcción.
Primeros pasos
Crear clave API
Genera una clave en Console y úsala con cualquier modelo de la plataforma.
Envía tu primera solicitud
Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.
Texto a textoResponses APIPOST/v1/responsesFormato de API:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "qwen-flash", "input": "Hello!" }'
Precios
El precio de TokenLab se aplica a Verified, que es más económico en la mayoría de los modelos. El precio oficial corresponde a la tarifa del fabricante y se aplica a la ruta Official, que es más fiable. Auto cobra según la ruta que complete la solicitud.
Entrada tokens <= 125K
Por 1M Token- Precio Official
- Entrada $0.05 / Salida $0.40 / Lectura de caché $0.01 / Escritura de caché $0.0625 / Texto Entrada $0.05 / Texto Salida $0.40
- Official
- Entrada $0.05 / Salida $0.40 / Lectura de caché $0.01 / Escritura de caché $0.0625 / Texto Entrada $0.05 / Texto Salida $0.40
- Descuento
- —
Entrada tokens <= 250K
Por 1M Token- Precio Official
- Entrada $0.05 / Salida $0.40 / Lectura de caché $0.01 / Escritura de caché $0.0625 / Texto Entrada $0.05 / Texto Salida $0.40
- Official
- Entrada $0.05 / Salida $0.40 / Lectura de caché $0.01 / Escritura de caché $0.0625 / Texto Entrada $0.05 / Texto Salida $0.40
- Descuento
- —
Entrada tokens <= 1M
Por 1M Token- Precio Official
- Entrada $0.25 / Salida $2.00 / Lectura de caché $0.05 / Escritura de caché $0.3125 / Texto Entrada $0.25 / Texto Salida $2.00
- Official
- Entrada $0.25 / Salida $2.00 / Lectura de caché $0.05 / Escritura de caché $0.3125 / Texto Entrada $0.25 / Texto Salida $2.00
- Descuento
- —
Lectura de caché
- Precio Official
- $0.01
- Official
- $0.01
- Descuento
- —
Escritura de caché
- Precio Official
- $0.0625
- Official
- $0.0625
- Descuento
- —
| Precio OfficialPor 1M Token | OfficialPor 1M Token | Descuento | |
|---|---|---|---|
| Entrada tokens <= 125K | Entrada $0.05 / Salida $0.40 / Lectura de caché $0.01 / Escritura de caché $0.0625 / Texto Entrada $0.05 / Texto Salida $0.40 | Entrada $0.05 / Salida $0.40 / Lectura de caché $0.01 / Escritura de caché $0.0625 / Texto Entrada $0.05 / Texto Salida $0.40 | — |
| Entrada tokens <= 250K | Entrada $0.05 / Salida $0.40 / Lectura de caché $0.01 / Escritura de caché $0.0625 / Texto Entrada $0.05 / Texto Salida $0.40 | Entrada $0.05 / Salida $0.40 / Lectura de caché $0.01 / Escritura de caché $0.0625 / Texto Entrada $0.05 / Texto Salida $0.40 | — |
| Entrada tokens <= 1M | Entrada $0.25 / Salida $2.00 / Lectura de caché $0.05 / Escritura de caché $0.3125 / Texto Entrada $0.25 / Texto Salida $2.00 | Entrada $0.25 / Salida $2.00 / Lectura de caché $0.05 / Escritura de caché $0.3125 / Texto Entrada $0.25 / Texto Salida $2.00 | — |
| Precios de caché de prompt | |||
| Lectura de caché | $0.01 | $0.01 | — |
| Escritura de caché | $0.0625 | $0.0625 | — |
Uso y actividad
La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.
Uso y disponibilidad
Últimas 24 horas- Solicitudes
- Tasa de éxito
- Latencia P95
- Total de tokens
Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.
Abrir en Console
Abre Qwen Flash en Console con un prompt listo para editar o enviar.
Ayúdame a probar qwen-flash con un mensaje breve en /v1/responses. Muestra la respuesta, la latencia y el coste.
Casos de uso
Ideal para- Razonamiento
Resumen masivo
Condense miles de artículos, transcripciones de llamadas o reseñas en resúmenes cortos, aplicando el mismo prompt a cada elemento.
Transformación de contenido
Convierta texto entre tonos, idiomas o formatos, como convertir notas en un correo electrónico pulido o una tabla en prosa.
Asistentes de chat ligeros
Soporte un bot de preguntas frecuentes o un asistente en la aplicación donde las respuestas son cortas y el tiempo de respuesta importa más que los matices.
Preguntas y respuestas sobre documentos largos
Pegue un manual largo o un conjunto de políticas en el prompt y responda las preguntas del personal directamente desde él.
Ejemplos de prompts
Reescriba la siguiente descripción del producto en un tono amable, máximo 60 palabras, y mantenga el número de modelo sin cambios.
Resuma esta transcripción de la reunión en decisiones, elementos de acción con responsables y preguntas sin resolver.
Utilizando solo el texto de la política anterior, responda: ¿puede un contratista reclamar gastos de viaje? Cite la cláusula que utilizó.
Este modelo tiene precio condicional. Los totales mensuales de tokens por sí solos no producen una estimación fiable; use el precio detallado según la especificación de la solicitud, la caché y la ventana aplicable.
FAQ
¿Para qué es mejor Qwen Flash?
Tareas de texto cotidianas de alto volumen: resúmenes, reescrituras, transformaciones de estilo de traducción y asistentes simples. Es el nivel rápido y económico de la línea Qwen, así que úselo cuando el rendimiento importe y la tarea no requiera un razonamiento profundo.
¿En qué se diferencia Qwen Flash de Qwen Plus?
Flash es el nivel orientado a la velocidad y Plus es el equilibrado. Plus ofrece un análisis y una escritura más sólidos; Flash realiza trabajos simples de forma más rápida y económica. Comience con Flash y mueva tareas específicas a Plus si las respuestas no son suficientes.
¿Qwen Flash admite el modo de pensamiento?
Sí. El pensamiento se puede activar para solicitudes que necesitan un razonamiento paso a paso y desactivar para las simples. La documentación de Alibaba enumera el modo de pensamiento como compatible con este modelo.
¿Puede Qwen Flash tomar imágenes o llamar a herramientas?
No. Es un modelo de entrada y salida de texto sin entrada de imagen ni llamadas a herramientas. Elija un modelo de visión Qwen u otra familia si la solicitud requiere alguna de estas funciones.
¿Es Qwen Flash una buena opción para un proyecto nuevo?
Las canalizaciones existentes pueden permanecer en él, y sigue siendo utilizable para trabajos estables de alto volumen. Para una construcción nueva, Alibaba señala las generaciones más nuevas de Qwen3, así que compárelo primero con Qwen3.8 Flash.
¿Cuánto cuesta Qwen Flash?
En TokenLab, Qwen Flash cuesta Entrada $0.05 / Salida $0.40 Por 1M Token. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.
¿Cuál es la ventana de contexto y el límite de salida de Qwen Flash?
Qwen Flash admite hasta 997.952 tokens de contexto y genera hasta 32.768 tokens por respuesta.
¿Qué endpoint debe usar Qwen Flash?
Utiliza https://api.tokenlab.sh/v1/responses para Qwen Flash. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.
¿Qué operaciones soporta Qwen Flash?
Qwen Flash admite Texto a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.
Comparar Qwen Flash
Fuentes
Revisado el 2 oct 2026