Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

Alibaba: Qwen3.5-Flash

Qwen3.5 Flash es la opción orientada a la eficiencia para el trabajo de texto de contexto largo en la línea 3.5. Puede admitir resúmenes y pasos repetidos de procesamiento de documentos donde la misma fuente grande debe consultarse a lo largo de una tarea.
Comparar modelos
qwen3.5-flash
DisponibleAlibabaChat
Entrada / Salida
$0.10 / $0.40
Contexto
992K
Salida máxima
64K
Modalidades
Chat
Capacidades
Caché de prompts

Sobre Qwen3.5-Flash

Qwen3.5-Flash es el nivel alojado más ligero de la familia Qwen3.5 de Alibaba, diseñado para un procesamiento de texto más rápido y económico que Qwen3.5-Plus. Cuenta con un contexto muy amplio y almacenamiento en caché de prompts, lo que resulta adecuado para resúmenes y pasadas repetidas sobre la misma fuente extensa. Comparte la amplia cobertura lingüística de la familia.

Puntos fuertes

  • El almacenamiento en caché de prompts ayuda a la consulta repetida de una fuente extensa.
  • Optimizado para ofrecer mayor velocidad que el nivel Plus.
  • Comparte la cobertura de 201 idiomas de la familia Qwen3.5.
  • Adecuado para pasos de canalización como resumir o etiquetar.

Cuándo buscar otra opción

  • Qwen3.5-Plus es mejor para análisis más complejos.
  • Solo acepta texto, por lo que no puede reemplazar a un modelo de visión.
  • Más antiguo que Qwen3.8-Flash, el cual reporta resultados de codificación agéntica.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Texto a textoResponses API
    POST/v1/responses
    Formato de API:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "qwen3.5-flash",
        "input": "Hello!"
      }'

Precios

El precio de TokenLab se aplica a Verified, que es más económico en la mayoría de los modelos. El precio oficial corresponde a la tarifa del fabricante y se aplica a la ruta Official, que es más fiable. Auto cobra según la ruta que complete la solicitud.

Entrada tokens <= 125K

Por 1M Token
Precio Official
Entrada $0.10 / Salida $0.40 / Lectura de caché $0.01 / Escritura de caché $0.125 / Texto Entrada $0.10 / Texto Salida $0.40
Official
Entrada $0.10 / Salida $0.40 / Lectura de caché $0.01 / Escritura de caché $0.125 / Texto Entrada $0.10 / Texto Salida $0.40
Descuento
—

Entrada tokens <= 250K

Por 1M Token
Precio Official
Entrada $0.10 / Salida $0.40 / Lectura de caché $0.01 / Escritura de caché $0.125 / Texto Entrada $0.10 / Texto Salida $0.40
Official
Entrada $0.10 / Salida $0.40 / Lectura de caché $0.01 / Escritura de caché $0.125 / Texto Entrada $0.10 / Texto Salida $0.40
Descuento
—

Entrada tokens <= 1M

Por 1M Token
Precio Official
Entrada $0.10 / Salida $0.40 / Lectura de caché $0.01 / Escritura de caché $0.125 / Texto Entrada $0.10 / Texto Salida $0.40
Official
Entrada $0.10 / Salida $0.40 / Lectura de caché $0.01 / Escritura de caché $0.125 / Texto Entrada $0.10 / Texto Salida $0.40
Descuento
—
Precios de caché de prompt

Lectura de caché

Precio Official
$0.01
Official
$0.01
Descuento
—

Escritura de caché

Precio Official
$0.125
Official
$0.125
Descuento
—

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Las métricas aparecerán una vez que se alcancen los umbrales de privacidad y volumen de datos.

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre Qwen3.5-Flash en Console con un prompt listo para editar o enviar.

Ayúdame a probar qwen3.5-flash con un mensaje breve en /v1/responses. Muestra la respuesta, la latencia y el coste.

Casos de uso

  • Resumen por lotes

    Condense informes largos en una canalización nocturna, con la misma fuente extensa almacenada en caché a través de las secciones sobre las que consulta.

  • Etiquetado y enrutamiento de documentos

    Etiquete textos largos por tema, urgencia o propietario y devuelva el resultado en un formato fijo que el código posterior pueda analizar.

  • Preguntas y respuestas repetidas sobre una fuente

    Almacene en caché un manual o política una vez y realice muchas preguntas sobre él sin pagar por reprocesar todo el texto en cada turno.

  • Limpieza de borradores

    Corrija la gramática, el tono y la estructura en borradores largos manteniendo intactas las afirmaciones y cifras del autor.

Ejemplos de prompts

Resume cada sección de este manual en dos líneas.

Etiqueta este ticket con el área de producto y la urgencia, y devuelve un JSON.

Responde preguntas sobre la política adjunta; responde 'no mencionado' si no está presente.

Este modelo tiene precio condicional. Los totales mensuales de tokens por sí solos no producen una estimación fiable; use el precio detallado según la especificación de la solicitud, la caché y la ventana aplicable.

FAQ

¿Qué es exactamente Qwen3.5-Flash?

Es el nivel alojado más ligero de la familia Qwen3.5 de Alibaba, orientado al procesamiento rápido de textos largos. Se sitúa por debajo de Qwen3.5-Plus en potencia y está destinado a pasos documentales rutinarios y repetidos.

¿Cuándo debería elegir Flash en lugar de Qwen3.5-Plus?

Elija Flash cuando la velocidad y el costo sean más importantes que la profundidad, como en resúmenes masivos, etiquetado o preguntas y respuestas sobre una fuente fija. Cambie a Plus cuando las respuestas requieran un análisis más cuidadoso a través de muchos pasajes.

¿Qwen3.5-Flash admite el almacenamiento en caché de prompts?

Sí. El almacenamiento en caché de prompts ayuda cuando la misma fuente extensa se envía una y otra vez, como en pasos repetidos de procesamiento de documentos donde solo cambia la pregunta entre llamadas.

¿Puede Qwen3.5-Flash leer imágenes?

No. Qwen3.5-Flash solo acepta texto. Utilice Qwen3.8-Flash, Qwen3.7-Plus o Qwen3-VL Plus cuando las capturas de pantalla, escaneos o gráficos formen parte de la tarea, y envíe el texto extraído a este modelo en su lugar.

¿Existe un modelo Flash más nuevo de Alibaba?

Sí. Qwen3.8-Flash es un modelo multimodal de mezcla de expertos más reciente, orientado a la codificación agéntica y al trabajo de agentes a largo plazo. Mantenga Qwen3.5-Flash para canalizaciones de texto plano que ya funcionan bien.

¿Cuánto cuesta Qwen3.5-Flash?

En TokenLab, Qwen3.5-Flash cuesta Entrada $0.10 / Salida $0.40 Por 1M Token. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Cuál es la ventana de contexto y el límite de salida de Qwen3.5-Flash?

Qwen3.5-Flash admite hasta 991.808 tokens de contexto y genera hasta 65.536 tokens por respuesta.

¿Qué endpoint debe usar Qwen3.5-Flash?

Utiliza https://api.tokenlab.sh/v1/responses para Qwen3.5-Flash. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta Qwen3.5-Flash?

Qwen3.5-Flash admite Texto a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar Qwen3.5-Flash

Fuentes

Revisado el 2 oct 2026

Más de Qwen 3 / QwQ

Modelos relacionados