각 요청에 대해 Auto, TokenLab Verified 또는 Official를 선택할 수 있으며, 가격은 사전에 표시됩니다.새로운 기능 확인하기

DeepSeek: DeepSeek V4 Flash

DeepSeek V4 Flash는 긴 텍스트 대화와 도구 지원 작업을 처리합니다. 100만 토큰 컨텍스트는 어시스턴트가 방대한 문서 모음을 추론하거나 대규모 코드베이스를 전체적으로 파악해야 할 때 유용합니다.
모델 비교
deepseek-v4-flash
사용 가능DeepSeek채팅
입력 / 출력
$0.15 / $0.60
컨텍스트
1M
출시일
2026년 4월 24일
최대 출력
384K
모달리티
비전채팅
기능
도구 사용프롬프트 캐시추론

DeepSeek V4 Flash 소개

DeepSeek V4 Flash는 DeepSeek V4 세대의 소형 모델로, 총 284B 파라미터와 13B 활성 파라미터를 가진 오픈 웨이트 혼합 전문가(MoE) 언어 모델입니다. DeepSeek은 이 모델을 V4 Pro에 근접한 추론 능력을 유지하면서 속도와 낮은 서비스 비용을 위해 설계했습니다. 사고 모드와 일반 모드에서 실행되며, 도구 호출, 프롬프트 캐싱, 요청 시 JSON 답변 기능을 제공합니다. 텍스트 전용 모델입니다.

강점

  • DeepSeek은 이 모델의 추론 능력이 V4 Pro와 거의 일치하며, 훨씬 적은 활성 파라미터 수로도 기본적인 에이전트 작업을 수행한다고 보고합니다.
  • 사고 모드는 요청별로 낮음, 높음, 최대 노력 수준으로 전환할 수 있어, 빠른 답변부터 복잡한 문제 해결까지 하나의 모델로 처리 가능합니다.
  • 매우 긴 컨텍스트 윈도우를 통해 어시스턴트가 대화 전반에 걸쳐 대규모 코드베이스나 방대한 문서 모음을 유지할 수 있습니다.
  • 도구 호출, 구조화된 JSON 출력 및 프롬프트 캐싱을 지원하여 동일한 지침을 반복해서 보내야 하는 긴 에이전트 루프에 도움이 됩니다.

다른 모델이 필요한 경우

  • 텍스트 전용 모델이므로 스크린샷이나 다이어그램이 포함된 작업은 DeepSeek V4.1 Flash 또는 vision-exp 변형 모델을 사용해야 합니다.
  • DeepSeek은 V4 Pro가 에이전트 코딩 벤치마크와 일반 지식 분야에서 앞서 있다고 밝히고 있으므로, 가장 어려운 코딩 및 연구 작업에는 Pro 모델이 더 적합합니다.
  • 사고 모드에서는 추론 텍스트가 별도로 반환되며 이후 도구 사용 단계에서 다시 전달되어야 하므로, 에이전트 코드에서 이를 처리해야 합니다.

시작하기

  1. API 키 만들기

    Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.

  2. 첫 번째 요청 보내기

    사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.

    텍스트-텍스트Responses API
    POST/v1/responses
    API 형식:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "deepseek-v4-flash",
        "input": "Hello!"
      }'

가격 책정

Verified는 TokenLab 가격이 적용되어 대부분의 모델에서 더 저렴합니다. Official은 제조사가 책정한 공식 가격으로 더 안정적인 경로를 제공합니다. Auto는 요청을 완료한 경로의 가격으로 자동 청구합니다.

요금 시간대 · 비피크 시간대

1M Token 당
Official 가격
입력 $0.15 / 출력 $0.60 / 캐시 읽기 $0.003
Official
입력 $0.15 / 출력 $0.60 / 캐시 읽기 $0.003
할인
—

요금 시간대 · 피크 시간대

1M Token 당
Official 가격
입력 $0.30 / 출력 $1.20 / 캐시 읽기 $0.006
Official
입력 $0.30 / 출력 $1.20 / 캐시 읽기 $0.006
할인
—
프롬프트 캐시 가격

캐시 읽기

Official 가격
$0.003
Official
$0.003
할인
—

사용량 및 활동

성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.

사용량 및 가용성

지난 24시간
요청
성공률
P95 지연 시간
총 토큰
모델 성능
30일 성공률
99.5%
30일 요청 수
100+
마지막 활동
10시간 전

데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.

Console에서 열기

Console에서 DeepSeek V4 Flash을 열고 프롬프트를 수정하거나 전송하세요.

/v1/responses에서 deepseek-v4-flash로 짧은 메시지를 테스트합니다. 응답, 지연 시간, 비용을 확인하세요.

사용 사례

적합한 용도
  • 추론
  • 비전
  • 대량의 에이전트 단계

    도구 선택, 결과 읽기, 다음 호출 계획 등 에이전트 루프 내의 수많은 작은 결정에 사용하세요. 응답 시간과 비용 효율성이 중요할 때 적합합니다.

  • 전체 저장소 관련 질문

    대규모 코드베이스나 문서 뭉치를 긴 컨텍스트에 붙여넣고 특정 동작이 어디에 구현되어 있는지, 또는 변경 사항이 어떤 파일에 영향을 미치는지 질문하세요.

  • 구조화된 데이터 추출

    계약서, 티켓 또는 로그를 스키마에 맞는 JSON으로 변환하세요. 사고 모드를 끄면 각 레코드를 빠르게 반환받을 수 있습니다.

  • 기존 DeepSeek 명칭을 대체하는 드롭인 교체

    기존에 은퇴한 chat 및 reasoner 명칭을 사용하던 클라이언트를 deepseek-v4-flash로 연결하고, 요청별로 사고 모드 여부를 선택하세요.

프롬프트 예제

청구 서비스의 전체 소스 코드가 아래와 같습니다. 어떤 모듈이 송장 상태 필드를 읽으며, 새로운 상태를 추가하면 무엇이 중단되나요?

이 다섯 개의 계약서에서 모든 갱신 날짜, 통지 기간, 해지 수수료를 추출하여 이 스키마와 일치하는 하나의 JSON 배열로 반환하세요.

search_docs와 open_ticket을 호출할 수 있습니다. 사용자가 어제부터 웹훅이 도착하지 않는다고 보고했습니다. 도구를 사용하여 조사하고 원인을 요약하세요.

이 모델은 조건부 요금제입니다. 월간 토큰 총량만으로는 신뢰할 수 있는 견적을 낼 수 없습니다. 요청 사양, 캐시, 해당 시간대에 맞는 상세 요금을 사용하세요.

FAQ

DeepSeek V4 Flash와 V4 Pro의 차이점은 무엇인가요?

Flash는 13B 활성 파라미터를 가진 소형 모델이고, Pro는 49B 파라미터를 가집니다. DeepSeek에 따르면 Flash는 Pro와 거의 대등한 추론 능력을 갖추고 단순 에이전트 작업에서 동일한 성능을 보이지만, Pro는 에이전트 코딩과 일반 지식 분야에서 더 강력합니다. Flash로 시작하고 작업이 실패할 경우 Pro로 전환하세요.

DeepSeek V4 Flash는 사고(thinking) 모드를 지원하나요?

네. 요청 시 사고 모드를 활성화하고 낮음, 높음, 최대 추론 노력 수준을 선택할 수 있습니다(기본값은 높음). 추론 결과는 별도의 필드로 제공되며, 도구를 사용하는 대화에서는 이어지는 각 단계마다 이를 다시 전송해야 합니다. 지연 시간에 민감한 짧은 답변에는 사고 모드를 끄십시오.

DeepSeek V4 Flash가 이미지를 읽을 수 있나요?

아니요. 텍스트 전용 모델이므로 텍스트를 입력받아 텍스트를 출력합니다. DeepSeek V4.1 Flash와 V4 Flash vision-exp 변형 모델은 이미지를 이해할 수 있는 별도의 모델이므로, 프롬프트에 스크린샷이나 다이어그램이 포함된 경우 해당 모델을 사용하십시오.

긴 컨텍스트는 어떤 용도로 유용한가요?

하나의 요청에 전체 저장소나 방대한 문서를 담을 수 있어, 중간에 검색 과정 없이도 특정 동작이 어디에 구현되었는지 또는 변경 사항이 어떤 파일에 영향을 주는지 모델이 답변할 수 있게 합니다. 동일한 자료를 반복적으로 보낼 때는 프롬프트 캐싱과 함께 사용하세요.

기존 deepseek-chat 및 deepseek-reasoner 명칭은 어떻게 되었나요?

DeepSeek은 2026년 7월 24일에 해당 명칭을 중단했습니다. 전환 기간 동안 이들은 사고 모드 여부에 따라 V4 Flash로 매핑되었습니다. 새로운 코드는 각 모드별로 별도의 명칭을 사용하는 대신 deepseek-v4-flash를 호출하고 사고 옵션을 설정해야 합니다.

DeepSeek V4 Flash 의 가격은 얼마인가요?

TokenLab 에서 DeepSeek V4 Flash 은 입력 $0.15 / 출력 $0.60 1M Token 당 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.

DeepSeek V4 Flash의 컨텍스트 윈도우와 출력 제한은 어떻게 되나요?

DeepSeek V4 Flash은 최대 1,000,000 토큰의 컨텍스트를 지원하며, 한 번의 응답으로 최대 384,000 토큰까지 출력합니다.

DeepSeek V4 Flash 은 어떤 엔드포인트를 써야 하나요?

DeepSeek V4 Flash에 대해 https://api.tokenlab.sh/v1/responses를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.

DeepSeek V4 Flash 은 어떤 오퍼레이션을 지원하나요?

DeepSeek V4 Flash은(는) 텍스트-텍스트을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.

DeepSeek V4 Flash 비교하기

DeepSeek V4 Flash 활용 가이드

출처

2026. 10. 2. 검토 완료

DeepSeek V4의 다른 모델

관련 모델