Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

DeepSeek: DeepSeek V4 Flash

O DeepSeek V4 Flash lida com longas conversas de texto e trabalho assistido por ferramentas. Seu contexto de um milhão de tokens é útil quando um assistente precisa raciocinar sobre uma coleção substancial de documentos ou manter uma grande base de código em vista.
Comparar modelos
deepseek-v4-flash
DisponívelDeepSeekChat
Entrada / Saída
$0.15 / $0.60
Contexto
1M
Lançado
24 de abr. de 2026
Saída máxima
384K
Modalidades
VisãoChat
Capacidades
Uso de ferramentasCache de promptsRaciocínio

Sobre o DeepSeek V4 Flash

O DeepSeek V4 Flash é o modelo menor da geração V4 da DeepSeek, um modelo de linguagem de mistura de especialistas (MoE) de pesos abertos com 284B de parâmetros totais e 13B de parâmetros ativos. A DeepSeek o posiciona para velocidade e baixo custo de serviço, mantendo o raciocínio próximo ao V4 Pro. Ele é executado em modos de raciocínio e sem raciocínio, chama ferramentas, armazena prompts em cache e responde em JSON mediante solicitação. É um modelo de texto.

Pontos fortes

  • A DeepSeek relata que seu raciocínio corresponde estreitamente ao V4 Pro e que ele se mantém em tarefas básicas de agente, com uma contagem de parâmetros ativos muito menor.
  • O raciocínio pode ser ativado por solicitação com esforço baixo, alto ou máximo, portanto, um modelo cobre respostas rápidas e resolução de problemas mais lenta.
  • Uma janela de contexto muito longa permite que um assistente mantenha uma grande base de código ou uma coleção substancial de documentos à vista durante uma conversa.
  • Ele suporta chamadas de ferramentas, saída JSON estruturada e cache de prompt, o que ajuda em loops de agente longos que reenviem as mesmas instruções.

Quando usar outro modelo

  • É um modelo de texto, portanto, o trabalho que envolve capturas de tela ou diagramas pertence ao DeepSeek V4.1 Flash ou à variante vision-exp.
  • A DeepSeek diz que o V4 Pro lidera em benchmarks de codificação agente e conhecimento de mundo, portanto, as tarefas de codificação e pesquisa mais difíceis se adaptam melhor ao Pro.
  • No modo de raciocínio, o texto de raciocínio retorna separadamente e deve ser enviado de volta em turnos de ferramentas posteriores, o que o código do agente deve manipular.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Texto para textoResponses API
    POST/v1/responses
    Formato da API:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "deepseek-v4-flash",
        "input": "Hello!"
      }'

Preço

O preço TokenLab aplica-se ao Verified, que é mais barato na maioria dos modelos. O preço oficial segue a tabela do criador e aplica-se à rota Official, que é mais confiável. O modo Auto cobra pela rota que finalizar o seu pedido.

Faixa tarifária · Horário fora de pico

Por 1M Token
Preço oficial
Entrada $0.15 / Saída $0.60 / Leitura de cache $0.003
Official
Entrada $0.15 / Saída $0.60 / Leitura de cache $0.003
Desconto
—

Faixa tarifária · Horário de pico

Por 1M Token
Preço oficial
Entrada $0.30 / Saída $1.20 / Leitura de cache $0.006
Official
Entrada $0.30 / Saída $1.20 / Leitura de cache $0.006
Desconto
—
Preços de cache de prompt

Leitura de cache

Preço oficial
$0.003
Official
$0.003
Desconto
—

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
Taxa de sucesso em 30 dias
99,5%
Requisições em 30 dias
100+
Última atividade
há 12 horas

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra DeepSeek V4 Flash no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar deepseek-v4-flash com uma mensagem em /v1/responses. Exiba a resposta, latência e custo.

Casos de uso

Indicado para
  • Raciocínio
  • Visão
  • Etapas de agente de alto volume

    Use-o para as muitas pequenas decisões dentro de um loop de agente, como escolher uma ferramenta, ler seu resultado e planejar a próxima chamada, onde o tempo de resposta e o custo se acumulam.

  • Perguntas sobre todo o repositório

    Cole uma grande base de código ou uma pilha de documentos no contexto longo e pergunte onde um comportamento é implementado ou quais arquivos uma alteração afetaria.

  • Extração estruturada

    Transforme contratos, tickets ou logs em JSON que segue um esquema, com o raciocínio desativado para que cada registro retorne rapidamente.

  • Substituição direta para nomes antigos da DeepSeek

    Aponte clientes existentes que usavam os nomes aposentados chat e reasoner para o deepseek-v4-flash e, em seguida, escolha o modo de raciocínio ou sem raciocínio por solicitação.

Exemplos de prompt

A fonte completa do nosso serviço de faturamento segue abaixo. Quais módulos leem o campo de status da fatura e o que quebra se eu adicionar um novo status?

Extraia todas as datas de renovação, períodos de aviso prévio e taxas de cancelamento destes cinco contratos e retorne um array JSON que corresponda a este esquema.

Você pode chamar search_docs e open_ticket. Um usuário relata que os webhooks pararam de chegar ontem. Investigue com as ferramentas e, em seguida, resuma a causa provável.

Este modelo tem preço condicional. Totais mensais de tokens sozinhos não produzem uma estimativa confiável; use o preço detalhado para a especificação da requisição, cache e janela aplicável.

FAQ

Qual é a diferença entre o DeepSeek V4 Flash e o V4 Pro?

O Flash é o modelo menor, com 13B de parâmetros ativos contra 49B do Pro. A DeepSeek diz que o Flash raciocina quase tão bem quanto o Pro e o iguala em tarefas simples de agente, enquanto o Pro é mais forte em codificação agente e conhecimento de mundo. Comece no Flash e mova uma tarefa para o Pro quando ela falhar.

O DeepSeek V4 Flash suporta modo de raciocínio?

Sim. Ative o raciocínio na solicitação e escolha esforço de raciocínio baixo, alto ou máximo; alto é o padrão. O raciocínio chega em um campo separado, e conversas que usam ferramentas devem enviá-lo de volta em cada turno seguinte. Deixe o raciocínio desativado para respostas curtas e sensíveis à latência.

O DeepSeek V4 Flash pode ler imagens?

Não. É um modelo de texto: o texto entra e o texto sai. O DeepSeek V4.1 Flash e a variante V4 Flash vision-exp são modelos separados que entendem imagens, portanto, use um deles quando o prompt incluir capturas de tela ou diagramas.

Para que o contexto longo é útil?

Ele permite que uma solicitação carregue um repositório inteiro ou uma pilha de documentos, para que o modelo possa responder onde um comportamento é implementado ou quais arquivos uma alteração afeta sem necessidade de recuperação intermediária. Combine-o com cache de prompt quando o mesmo material for enviado repetidamente.

O que aconteceu com os nomes antigos deepseek-chat e deepseek-reasoner?

A DeepSeek os descontinuou em 24 de julho de 2026. Durante a transição, eles foram mapeados para o V4 Flash nos modos com e sem raciocínio. O novo código deve chamar deepseek-v4-flash e definir a opção de raciocínio, em vez de depender de nomes separados para cada modo.

Quanto custa o DeepSeek V4 Flash?

No TokenLab, DeepSeek V4 Flash custa Entrada $0.15 / Saída $0.60 Por 1M Token. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual a janela de contexto e o limite de saída do DeepSeek V4 Flash?

O DeepSeek V4 Flash aceita até 1.000.000 tokens de contexto e gera até 384.000 tokens por resposta.

Qual endpoint o DeepSeek V4 Flash deve usar?

Use https://api.tokenlab.sh/v1/responses para DeepSeek V4 Flash. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o DeepSeek V4 Flash suporta?

DeepSeek V4 Flash suporta Texto para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar DeepSeek V4 Flash

Guias com DeepSeek V4 Flash

Fontes

Revisado em 2 de out. de 2026

Mais da série DeepSeek V4

Modelos relacionados