DeepSeek: DeepSeek V4 Flash
deepseek-v4-flash- Entrada / Salida
- $0.15 / $0.60
- Contexto
- 1M
- Lanzado
- 24 abr 2026
- Salida máxima
- 384K
- Modalidades
- VisiónChat
- Capacidades
- Uso de herramientasCaché de promptsRazonamiento
Sobre DeepSeek V4 Flash
DeepSeek V4 Flash es el modelo más pequeño de la generación V4 de DeepSeek, un modelo de lenguaje de mezcla de expertos (MoE) de pesos abiertos con 284B de parámetros totales y 13B de parámetros activos. DeepSeek lo posiciona para ofrecer velocidad y bajo coste de servicio, manteniendo un razonamiento cercano al de V4 Pro. Funciona en modos de razonamiento y sin razonamiento, llama a herramientas, almacena prompts en caché y responde en JSON bajo petición. Es un modelo de texto.
Puntos fuertes
- DeepSeek informa que su razonamiento iguala estrechamente al de V4 Pro y que se mantiene firme en tareas básicas de agente, con un recuento de parámetros activos mucho menor.
- El razonamiento puede activarse por solicitud con esfuerzo bajo, alto o máximo, por lo que un solo modelo cubre respuestas rápidas y resolución de problemas más lenta.
- Una ventana de contexto muy larga permite a un asistente mantener una gran base de código o una colección sustancial de documentos a la vista durante una conversación.
- Es compatible con llamadas a herramientas, salida JSON estructurada y almacenamiento en caché de prompts, lo que ayuda en bucles de agente largos que reenvían las mismas instrucciones.
Cuándo buscar otra opción
- Es un modelo de texto, por lo que el trabajo que involucre capturas de pantalla o diagramas corresponde a DeepSeek V4.1 Flash o a la variante vision-exp.
- DeepSeek dice que V4 Pro lidera en benchmarks de programación agente y conocimiento general, por lo que las tareas de programación e investigación más difíciles se ajustan mejor a Pro.
- En el modo de razonamiento, el texto de razonamiento se devuelve por separado y debe reenviarse en los turnos de herramientas posteriores, lo cual debe ser gestionado por el código del agente.
Primeros pasos
Crear clave API
Genera una clave en Console y úsala con cualquier modelo de la plataforma.
Envía tu primera solicitud
Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.
Texto a textoResponses APIPOST/v1/responsesFormato de API:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "deepseek-v4-flash", "input": "Hello!" }'
Precios
El precio de TokenLab se aplica a Verified, que es más económico en la mayoría de los modelos. El precio oficial corresponde a la tarifa del fabricante y se aplica a la ruta Official, que es más fiable. Auto cobra según la ruta que complete la solicitud.
Franja tarifaria · Horas valle
Por 1M Token- Precio Official
- Entrada $0.15 / Salida $0.60 / Lectura de caché $0.003
- Official
- Entrada $0.15 / Salida $0.60 / Lectura de caché $0.003
- Descuento
- —
Franja tarifaria · Horas punta
Por 1M Token- Precio Official
- Entrada $0.30 / Salida $1.20 / Lectura de caché $0.006
- Official
- Entrada $0.30 / Salida $1.20 / Lectura de caché $0.006
- Descuento
- —
Lectura de caché
- Precio Official
- $0.003
- Official
- $0.003
- Descuento
- —
| Precio OfficialPor 1M Token | OfficialPor 1M Token | Descuento | |
|---|---|---|---|
| Franja tarifaria · Horas valle | Entrada $0.15 / Salida $0.60 / Lectura de caché $0.003 | Entrada $0.15 / Salida $0.60 / Lectura de caché $0.003 | — |
| Franja tarifaria · Horas punta | Entrada $0.30 / Salida $1.20 / Lectura de caché $0.006 | Entrada $0.30 / Salida $1.20 / Lectura de caché $0.006 | — |
| Precios de caché de prompt | |||
| Lectura de caché | $0.003 | $0.003 | — |
Uso y actividad
La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.
Uso y disponibilidad
Últimas 24 horas- Solicitudes
- Tasa de éxito
- Latencia P95
- Total de tokens
- Tasa de éxito 30 días
- 99,5%
- Solicitudes 30 días
- 100+
- Última actividad
- hace 16 horas
Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.
Abrir en Console
Abre DeepSeek V4 Flash en Console con un prompt listo para editar o enviar.
Ayúdame a probar deepseek-v4-flash con un mensaje breve en /v1/responses. Muestra la respuesta, la latencia y el coste.
Casos de uso
Ideal para- Razonamiento
- Visión
Pasos de agente de alto volumen
Úsalo para las muchas pequeñas decisiones dentro de un bucle de agente, como elegir una herramienta, leer su resultado y planificar la siguiente llamada, donde el tiempo de respuesta y el coste se acumulan.
Preguntas sobre todo el repositorio
Pega una gran base de código o un conjunto de documentos en el contexto largo y pregunta dónde se implementa un comportamiento o qué archivos tocaría un cambio.
Extracción estructurada
Convierte contratos, tickets o registros en JSON que siga un esquema, con el razonamiento desactivado para que cada registro se devuelva rápidamente.
Reemplazo directo para nombres antiguos de DeepSeek
Apunta los clientes existentes que usaban los nombres retirados chat y reasoner a deepseek-v4-flash, luego elige el modo de razonamiento o sin razonamiento por solicitud.
Ejemplos de prompts
A continuación se muestra la fuente completa de nuestro servicio de facturación. ¿Qué módulos leen el campo de estado de la factura y qué se rompe si añado un nuevo estado?
Extrae cada fecha de renovación, periodo de notificación y comisión de cancelación de estos cinco contratos y devuelve un array JSON que coincida con este esquema.
Puedes llamar a search_docs y open_ticket. Un usuario informa que los webhooks dejaron de llegar ayer. Investiga con las herramientas y luego resume la causa probable.
Este modelo tiene precio condicional. Los totales mensuales de tokens por sí solos no producen una estimación fiable; use el precio detallado según la especificación de la solicitud, la caché y la ventana aplicable.
FAQ
¿Cuál es la diferencia entre DeepSeek V4 Flash y V4 Pro?
Flash es el modelo más pequeño, con 13B de parámetros activos frente a los 49B de Pro. DeepSeek dice que Flash razona casi tan bien como Pro y lo iguala en tareas de agente simples, mientras que Pro es más fuerte en programación agente y conocimiento general. Empieza con Flash y traslada una tarea a Pro cuando falle.
¿Es compatible DeepSeek V4 Flash con el modo de razonamiento?
Sí. Activa el razonamiento en la solicitud y elige un esfuerzo de razonamiento bajo, alto o máximo; el alto es el predeterminado. El razonamiento llega en un campo separado, y las conversaciones que usan herramientas deben reenviarlo en cada turno siguiente. Deja el razonamiento desactivado para respuestas cortas y sensibles a la latencia.
¿Puede DeepSeek V4 Flash leer imágenes?
No. Es un modelo de texto: entra texto y sale texto. DeepSeek V4.1 Flash y la variante V4 Flash vision-exp son modelos separados que entienden imágenes, así que usa uno de ellos cuando el prompt incluya capturas de pantalla o diagramas.
¿Para qué es útil el contexto largo?
Permite que una solicitud contenga todo un repositorio o un conjunto de documentos, de modo que el modelo pueda responder dónde se implementa un comportamiento o qué archivos toca un cambio sin necesidad de recuperación intermedia. Combínalo con el almacenamiento en caché de prompts cuando el mismo material se envíe repetidamente.
¿Qué pasó con los nombres antiguos deepseek-chat y deepseek-reasoner?
DeepSeek los descontinuó el 24 de julio de 2026. Durante la transición, se asignaron a V4 Flash en modos de razonamiento y sin razonamiento. El código nuevo debe llamar a deepseek-v4-flash y configurar la opción de razonamiento, en lugar de depender de nombres separados para cada modo.
¿Cuánto cuesta DeepSeek V4 Flash?
En TokenLab, DeepSeek V4 Flash cuesta Entrada $0.15 / Salida $0.60 Por 1M Token. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.
¿Cuál es la ventana de contexto y el límite de salida de DeepSeek V4 Flash?
DeepSeek V4 Flash admite hasta 1.000.000 tokens de contexto y genera hasta 384.000 tokens por respuesta.
¿Qué endpoint debe usar DeepSeek V4 Flash?
Utiliza https://api.tokenlab.sh/v1/responses para DeepSeek V4 Flash. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.
¿Qué operaciones soporta DeepSeek V4 Flash?
DeepSeek V4 Flash admite Texto a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.
Comparar DeepSeek V4 Flash
Guías con DeepSeek V4 Flash
Fuentes
Revisado el 2 oct 2026