DeepSeek: DeepSeek V4 Flash
deepseek-v4-flash- Entrada / Saída
- $0.15 / $0.60
- Contexto
- 1M
- Lançado
- 24 de abr. de 2026
- Saída máxima
- 384K
- Modalidades
- VisãoChat
- Capacidades
- Uso de ferramentasCache de promptsRaciocínio
Sobre o DeepSeek V4 Flash
O DeepSeek V4 Flash é o modelo menor da geração V4 da DeepSeek, um modelo de linguagem de mistura de especialistas (MoE) de pesos abertos com 284B de parâmetros totais e 13B de parâmetros ativos. A DeepSeek o posiciona para velocidade e baixo custo de serviço, mantendo o raciocínio próximo ao V4 Pro. Ele é executado em modos de raciocínio e sem raciocínio, chama ferramentas, armazena prompts em cache e responde em JSON mediante solicitação. É um modelo de texto.
Pontos fortes
- A DeepSeek relata que seu raciocínio corresponde estreitamente ao V4 Pro e que ele se mantém em tarefas básicas de agente, com uma contagem de parâmetros ativos muito menor.
- O raciocínio pode ser ativado por solicitação com esforço baixo, alto ou máximo, portanto, um modelo cobre respostas rápidas e resolução de problemas mais lenta.
- Uma janela de contexto muito longa permite que um assistente mantenha uma grande base de código ou uma coleção substancial de documentos à vista durante uma conversa.
- Ele suporta chamadas de ferramentas, saída JSON estruturada e cache de prompt, o que ajuda em loops de agente longos que reenviem as mesmas instruções.
Quando usar outro modelo
- É um modelo de texto, portanto, o trabalho que envolve capturas de tela ou diagramas pertence ao DeepSeek V4.1 Flash ou à variante vision-exp.
- A DeepSeek diz que o V4 Pro lidera em benchmarks de codificação agente e conhecimento de mundo, portanto, as tarefas de codificação e pesquisa mais difíceis se adaptam melhor ao Pro.
- No modo de raciocínio, o texto de raciocínio retorna separadamente e deve ser enviado de volta em turnos de ferramentas posteriores, o que o código do agente deve manipular.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
Texto para textoResponses APIPOST/v1/responsesFormato da API:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "deepseek-v4-flash", "input": "Hello!" }'
Preço
O preço TokenLab aplica-se ao Verified, que é mais barato na maioria dos modelos. O preço oficial segue a tabela do criador e aplica-se à rota Official, que é mais confiável. O modo Auto cobra pela rota que finalizar o seu pedido.
Faixa tarifária · Horário fora de pico
Por 1M Token- Preço oficial
- Entrada $0.15 / Saída $0.60 / Leitura de cache $0.003
- Official
- Entrada $0.15 / Saída $0.60 / Leitura de cache $0.003
- Desconto
- —
Faixa tarifária · Horário de pico
Por 1M Token- Preço oficial
- Entrada $0.30 / Saída $1.20 / Leitura de cache $0.006
- Official
- Entrada $0.30 / Saída $1.20 / Leitura de cache $0.006
- Desconto
- —
Leitura de cache
- Preço oficial
- $0.003
- Official
- $0.003
- Desconto
- —
| Preço oficialPor 1M Token | OfficialPor 1M Token | Desconto | |
|---|---|---|---|
| Faixa tarifária · Horário fora de pico | Entrada $0.15 / Saída $0.60 / Leitura de cache $0.003 | Entrada $0.15 / Saída $0.60 / Leitura de cache $0.003 | — |
| Faixa tarifária · Horário de pico | Entrada $0.30 / Saída $1.20 / Leitura de cache $0.006 | Entrada $0.30 / Saída $1.20 / Leitura de cache $0.006 | — |
| Preços de cache de prompt | |||
| Leitura de cache | $0.003 | $0.003 | — |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
- Taxa de sucesso em 30 dias
- 99,5%
- Requisições em 30 dias
- 100+
- Última atividade
- há 12 horas
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Abrir no Console
Abra DeepSeek V4 Flash no Console com um prompt pronto para editar ou enviar.
Ajude-me a testar deepseek-v4-flash com uma mensagem em /v1/responses. Exiba a resposta, latência e custo.
Casos de uso
Indicado para- Raciocínio
- Visão
Etapas de agente de alto volume
Use-o para as muitas pequenas decisões dentro de um loop de agente, como escolher uma ferramenta, ler seu resultado e planejar a próxima chamada, onde o tempo de resposta e o custo se acumulam.
Perguntas sobre todo o repositório
Cole uma grande base de código ou uma pilha de documentos no contexto longo e pergunte onde um comportamento é implementado ou quais arquivos uma alteração afetaria.
Extração estruturada
Transforme contratos, tickets ou logs em JSON que segue um esquema, com o raciocínio desativado para que cada registro retorne rapidamente.
Substituição direta para nomes antigos da DeepSeek
Aponte clientes existentes que usavam os nomes aposentados chat e reasoner para o deepseek-v4-flash e, em seguida, escolha o modo de raciocínio ou sem raciocínio por solicitação.
Exemplos de prompt
A fonte completa do nosso serviço de faturamento segue abaixo. Quais módulos leem o campo de status da fatura e o que quebra se eu adicionar um novo status?
Extraia todas as datas de renovação, períodos de aviso prévio e taxas de cancelamento destes cinco contratos e retorne um array JSON que corresponda a este esquema.
Você pode chamar search_docs e open_ticket. Um usuário relata que os webhooks pararam de chegar ontem. Investigue com as ferramentas e, em seguida, resuma a causa provável.
Este modelo tem preço condicional. Totais mensais de tokens sozinhos não produzem uma estimativa confiável; use o preço detalhado para a especificação da requisição, cache e janela aplicável.
FAQ
Qual é a diferença entre o DeepSeek V4 Flash e o V4 Pro?
O Flash é o modelo menor, com 13B de parâmetros ativos contra 49B do Pro. A DeepSeek diz que o Flash raciocina quase tão bem quanto o Pro e o iguala em tarefas simples de agente, enquanto o Pro é mais forte em codificação agente e conhecimento de mundo. Comece no Flash e mova uma tarefa para o Pro quando ela falhar.
O DeepSeek V4 Flash suporta modo de raciocínio?
Sim. Ative o raciocínio na solicitação e escolha esforço de raciocínio baixo, alto ou máximo; alto é o padrão. O raciocínio chega em um campo separado, e conversas que usam ferramentas devem enviá-lo de volta em cada turno seguinte. Deixe o raciocínio desativado para respostas curtas e sensíveis à latência.
O DeepSeek V4 Flash pode ler imagens?
Não. É um modelo de texto: o texto entra e o texto sai. O DeepSeek V4.1 Flash e a variante V4 Flash vision-exp são modelos separados que entendem imagens, portanto, use um deles quando o prompt incluir capturas de tela ou diagramas.
Para que o contexto longo é útil?
Ele permite que uma solicitação carregue um repositório inteiro ou uma pilha de documentos, para que o modelo possa responder onde um comportamento é implementado ou quais arquivos uma alteração afeta sem necessidade de recuperação intermediária. Combine-o com cache de prompt quando o mesmo material for enviado repetidamente.
O que aconteceu com os nomes antigos deepseek-chat e deepseek-reasoner?
A DeepSeek os descontinuou em 24 de julho de 2026. Durante a transição, eles foram mapeados para o V4 Flash nos modos com e sem raciocínio. O novo código deve chamar deepseek-v4-flash e definir a opção de raciocínio, em vez de depender de nomes separados para cada modo.
Quanto custa o DeepSeek V4 Flash?
No TokenLab, DeepSeek V4 Flash custa Entrada $0.15 / Saída $0.60 Por 1M Token. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.
Qual a janela de contexto e o limite de saída do DeepSeek V4 Flash?
O DeepSeek V4 Flash aceita até 1.000.000 tokens de contexto e gera até 384.000 tokens por resposta.
Qual endpoint o DeepSeek V4 Flash deve usar?
Use https://api.tokenlab.sh/v1/responses para DeepSeek V4 Flash. O exemplo de requisição abaixo mostra o formato de código correspondente.
Quais operações o DeepSeek V4 Flash suporta?
DeepSeek V4 Flash suporta Texto para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.
Comparar DeepSeek V4 Flash
Guias com DeepSeek V4 Flash
Fontes
Revisado em 2 de out. de 2026