Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

DeepSeek: DeepSeek V4 Flash

DeepSeek V4 Flash maneja conversaciones de texto largas y trabajo asistido por herramientas. Su contexto de un millón de tokens es útil cuando un asistente necesita razonar sobre una colección sustancial de documentos o mantener una base de código grande a la vista.
Comparar modelos
deepseek-v4-flash
DisponibleDeepSeekChat
Entrada / Salida
$0.15 / $0.60
Contexto
1M
Lanzado
24 abr 2026
Salida máxima
384K
Modalidades
VisiónChat
Capacidades
Uso de herramientasCaché de promptsRazonamiento

Sobre DeepSeek V4 Flash

DeepSeek V4 Flash es el modelo más pequeño de la generación V4 de DeepSeek, un modelo de lenguaje de mezcla de expertos (MoE) de pesos abiertos con 284B de parámetros totales y 13B de parámetros activos. DeepSeek lo posiciona para ofrecer velocidad y bajo coste de servicio, manteniendo un razonamiento cercano al de V4 Pro. Funciona en modos de razonamiento y sin razonamiento, llama a herramientas, almacena prompts en caché y responde en JSON bajo petición. Es un modelo de texto.

Puntos fuertes

  • DeepSeek informa que su razonamiento iguala estrechamente al de V4 Pro y que se mantiene firme en tareas básicas de agente, con un recuento de parámetros activos mucho menor.
  • El razonamiento puede activarse por solicitud con esfuerzo bajo, alto o máximo, por lo que un solo modelo cubre respuestas rápidas y resolución de problemas más lenta.
  • Una ventana de contexto muy larga permite a un asistente mantener una gran base de código o una colección sustancial de documentos a la vista durante una conversación.
  • Es compatible con llamadas a herramientas, salida JSON estructurada y almacenamiento en caché de prompts, lo que ayuda en bucles de agente largos que reenvían las mismas instrucciones.

Cuándo buscar otra opción

  • Es un modelo de texto, por lo que el trabajo que involucre capturas de pantalla o diagramas corresponde a DeepSeek V4.1 Flash o a la variante vision-exp.
  • DeepSeek dice que V4 Pro lidera en benchmarks de programación agente y conocimiento general, por lo que las tareas de programación e investigación más difíciles se ajustan mejor a Pro.
  • En el modo de razonamiento, el texto de razonamiento se devuelve por separado y debe reenviarse en los turnos de herramientas posteriores, lo cual debe ser gestionado por el código del agente.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Texto a textoResponses API
    POST/v1/responses
    Formato de API:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "deepseek-v4-flash",
        "input": "Hello!"
      }'

Precios

El precio de TokenLab se aplica a Verified, que es más económico en la mayoría de los modelos. El precio oficial corresponde a la tarifa del fabricante y se aplica a la ruta Official, que es más fiable. Auto cobra según la ruta que complete la solicitud.

Franja tarifaria · Horas valle

Por 1M Token
Precio Official
Entrada $0.15 / Salida $0.60 / Lectura de caché $0.003
Official
Entrada $0.15 / Salida $0.60 / Lectura de caché $0.003
Descuento
—

Franja tarifaria · Horas punta

Por 1M Token
Precio Official
Entrada $0.30 / Salida $1.20 / Lectura de caché $0.006
Official
Entrada $0.30 / Salida $1.20 / Lectura de caché $0.006
Descuento
—
Precios de caché de prompt

Lectura de caché

Precio Official
$0.003
Official
$0.003
Descuento
—

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Tasa de éxito 30 días
99,5%
Solicitudes 30 días
100+
Última actividad
hace 16 horas

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre DeepSeek V4 Flash en Console con un prompt listo para editar o enviar.

Ayúdame a probar deepseek-v4-flash con un mensaje breve en /v1/responses. Muestra la respuesta, la latencia y el coste.

Casos de uso

Ideal para
  • Razonamiento
  • Visión
  • Pasos de agente de alto volumen

    Úsalo para las muchas pequeñas decisiones dentro de un bucle de agente, como elegir una herramienta, leer su resultado y planificar la siguiente llamada, donde el tiempo de respuesta y el coste se acumulan.

  • Preguntas sobre todo el repositorio

    Pega una gran base de código o un conjunto de documentos en el contexto largo y pregunta dónde se implementa un comportamiento o qué archivos tocaría un cambio.

  • Extracción estructurada

    Convierte contratos, tickets o registros en JSON que siga un esquema, con el razonamiento desactivado para que cada registro se devuelva rápidamente.

  • Reemplazo directo para nombres antiguos de DeepSeek

    Apunta los clientes existentes que usaban los nombres retirados chat y reasoner a deepseek-v4-flash, luego elige el modo de razonamiento o sin razonamiento por solicitud.

Ejemplos de prompts

A continuación se muestra la fuente completa de nuestro servicio de facturación. ¿Qué módulos leen el campo de estado de la factura y qué se rompe si añado un nuevo estado?

Extrae cada fecha de renovación, periodo de notificación y comisión de cancelación de estos cinco contratos y devuelve un array JSON que coincida con este esquema.

Puedes llamar a search_docs y open_ticket. Un usuario informa que los webhooks dejaron de llegar ayer. Investiga con las herramientas y luego resume la causa probable.

Este modelo tiene precio condicional. Los totales mensuales de tokens por sí solos no producen una estimación fiable; use el precio detallado según la especificación de la solicitud, la caché y la ventana aplicable.

FAQ

¿Cuál es la diferencia entre DeepSeek V4 Flash y V4 Pro?

Flash es el modelo más pequeño, con 13B de parámetros activos frente a los 49B de Pro. DeepSeek dice que Flash razona casi tan bien como Pro y lo iguala en tareas de agente simples, mientras que Pro es más fuerte en programación agente y conocimiento general. Empieza con Flash y traslada una tarea a Pro cuando falle.

¿Es compatible DeepSeek V4 Flash con el modo de razonamiento?

Sí. Activa el razonamiento en la solicitud y elige un esfuerzo de razonamiento bajo, alto o máximo; el alto es el predeterminado. El razonamiento llega en un campo separado, y las conversaciones que usan herramientas deben reenviarlo en cada turno siguiente. Deja el razonamiento desactivado para respuestas cortas y sensibles a la latencia.

¿Puede DeepSeek V4 Flash leer imágenes?

No. Es un modelo de texto: entra texto y sale texto. DeepSeek V4.1 Flash y la variante V4 Flash vision-exp son modelos separados que entienden imágenes, así que usa uno de ellos cuando el prompt incluya capturas de pantalla o diagramas.

¿Para qué es útil el contexto largo?

Permite que una solicitud contenga todo un repositorio o un conjunto de documentos, de modo que el modelo pueda responder dónde se implementa un comportamiento o qué archivos toca un cambio sin necesidad de recuperación intermedia. Combínalo con el almacenamiento en caché de prompts cuando el mismo material se envíe repetidamente.

¿Qué pasó con los nombres antiguos deepseek-chat y deepseek-reasoner?

DeepSeek los descontinuó el 24 de julio de 2026. Durante la transición, se asignaron a V4 Flash en modos de razonamiento y sin razonamiento. El código nuevo debe llamar a deepseek-v4-flash y configurar la opción de razonamiento, en lugar de depender de nombres separados para cada modo.

¿Cuánto cuesta DeepSeek V4 Flash?

En TokenLab, DeepSeek V4 Flash cuesta Entrada $0.15 / Salida $0.60 Por 1M Token. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Cuál es la ventana de contexto y el límite de salida de DeepSeek V4 Flash?

DeepSeek V4 Flash admite hasta 1.000.000 tokens de contexto y genera hasta 384.000 tokens por respuesta.

¿Qué endpoint debe usar DeepSeek V4 Flash?

Utiliza https://api.tokenlab.sh/v1/responses para DeepSeek V4 Flash. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta DeepSeek V4 Flash?

DeepSeek V4 Flash admite Texto a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar DeepSeek V4 Flash

Guías con DeepSeek V4 Flash

Fuentes

Revisado el 2 oct 2026

Más de DeepSeek V4

Modelos relacionados