각 요청에 대해 Auto, TokenLab Verified 또는 Official를 선택할 수 있으며, 가격은 사전에 표시됩니다.새로운 기능 확인하기

Alibaba: Qwen3.5-Flash

Qwen3.5 Flash는 3.5 라인업에서 긴 컨텍스트 텍스트 작업을 위한 효율성 중심 옵션입니다. 작업 전반에 걸쳐 동일한 대규모 소스를 참조해야 하는 요약 및 반복적인 문서 처리 단계를 지원할 수 있습니다.
모델 비교
qwen3.5-flash
사용 가능Alibaba채팅
입력 / 출력
$0.10 / $0.40
컨텍스트
992K
최대 출력
64K
모달리티
채팅
기능
프롬프트 캐시

Qwen3.5-Flash 소개

Qwen3.5-Flash는 Alibaba Qwen3.5 제품군의 경량 호스팅 티어로, Qwen3.5-Plus보다 빠르고 저렴한 텍스트 처리를 위해 구축되었습니다. 매우 큰 컨텍스트와 프롬프트 캐싱 기능을 갖추고 있어 요약 작업이나 동일한 대용량 소스에 대한 반복적인 처리에 적합합니다. 또한 해당 제품군이 가진 광범위한 언어 지원 범위를 공유합니다.

강점

  • 프롬프트 캐싱은 하나의 대용량 소스를 반복적으로 참조할 때 유용합니다.
  • Plus 티어보다 속도에 최적화되어 있습니다.
  • Qwen3.5 제품군의 201개 언어 지원 범위를 공유합니다.
  • 요약이나 태깅과 같은 파이프라인 단계에 적합합니다.

다른 모델이 필요한 경우

  • Qwen3.5-Plus는 더 복잡한 분석 작업에 더 뛰어납니다.
  • 텍스트 전용 모델이므로 비전 모델을 대체할 수 없습니다.
  • 에이전트 코딩 결과를 보고하는 Qwen3.8-Flash보다 이전 모델입니다.

시작하기

  1. API 키 만들기

    Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.

  2. 첫 번째 요청 보내기

    사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.

    텍스트-텍스트Responses API
    POST/v1/responses
    API 형식:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "qwen3.5-flash",
        "input": "Hello!"
      }'

가격 책정

Verified는 TokenLab 가격이 적용되어 대부분의 모델에서 더 저렴합니다. Official은 제조사가 책정한 공식 가격으로 더 안정적인 경로를 제공합니다. Auto는 요청을 완료한 경로의 가격으로 자동 청구합니다.

입력 토큰 <= 125K

1M Token 당
Official 가격
입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40
Official
입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40
할인
—

입력 토큰 <= 250K

1M Token 당
Official 가격
입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40
Official
입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40
할인
—

입력 토큰 <= 1M

1M Token 당
Official 가격
입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40
Official
입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40
할인
—
프롬프트 캐시 가격

캐시 읽기

Official 가격
$0.01
Official
$0.01
할인
—

캐시 쓰기

Official 가격
$0.125
Official
$0.125
할인
—

사용량 및 활동

성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.

사용량 및 가용성

지난 24시간
요청
성공률
P95 지연 시간
총 토큰
모델 성능
개인정보 보호 및 데이터 볼륨 임계값이 충족되면 메트릭이 표시됩니다.

데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.

Console에서 열기

Console에서 Qwen3.5-Flash을 열고 프롬프트를 수정하거나 전송하세요.

/v1/responses에서 qwen3.5-flash로 짧은 메시지를 테스트합니다. 응답, 지연 시간, 비용을 확인하세요.

사용 사례

  • 일괄 요약

    야간 파이프라인에서 긴 보고서를 요약할 때, 질문하는 섹션 전반에 걸쳐 동일한 대용량 소스를 캐싱하여 처리합니다.

  • 문서 태깅 및 라우팅

    긴 텍스트를 주제, 긴급도, 담당자별로 분류하고 후속 코드가 파싱할 수 있는 고정된 형식으로 결과를 반환합니다.

  • 단일 소스에 대한 반복적인 질의응답

    매뉴얼이나 정책을 한 번 캐싱해두면, 매번 전체 텍스트를 재처리하는 비용 없이 여러 번 질문할 수 있습니다.

  • 초안 정리

    작성자의 주장과 수치는 그대로 유지하면서 긴 초안의 문법, 어조, 구조를 수정합니다.

프롬프트 예제

이 핸드북의 각 섹션을 두 줄로 요약하세요.

이 티켓에 제품 영역과 긴급도를 태그하고 JSON 형식으로 반환하세요.

붙여넣은 정책에 대해 질문에 답하세요. 내용이 없으면 '언급되지 않음'이라고 답변하세요.

이 모델은 조건부 요금제입니다. 월간 토큰 총량만으로는 신뢰할 수 있는 견적을 낼 수 없습니다. 요청 사양, 캐시, 해당 시간대에 맞는 상세 요금을 사용하세요.

FAQ

Qwen3.5-Flash란 정확히 무엇인가요?

Alibaba Qwen3.5 제품군의 경량 호스팅 티어로, 긴 텍스트의 빠른 처리를 목표로 합니다. 성능 면에서는 Qwen3.5-Plus보다 아래 단계이며, 반복적이고 일상적인 문서 처리 단계에 적합합니다.

Qwen3.5-Plus 대신 Flash를 선택해야 하는 경우는 언제인가요?

대량 요약, 태깅, 고정된 소스에 대한 질의응답처럼 깊이보다 속도와 비용이 중요할 때 Flash를 선택하세요. 여러 구절에 걸쳐 더 세심한 분석이 필요한 답변이 필요할 때는 Plus 모델로 전환하세요.

Qwen3.5-Flash는 프롬프트 캐싱을 지원하나요?

네. 프롬프트 캐싱은 동일한 긴 소스를 반복적으로 보낼 때 유용하며, 호출 간에 질문만 변경되는 반복적인 문서 처리 단계에서 효과적입니다.

Qwen3.5-Flash가 이미지를 읽을 수 있나요?

아니요. Qwen3.5-Flash는 텍스트만 처리합니다. 스크린샷, 스캔본, 차트 등이 작업에 포함된 경우 Qwen3.8-Flash, Qwen3.7-Plus 또는 Qwen3-VL Plus를 사용하고, 추출된 텍스트를 이 모델로 보내세요.

Alibaba에서 나온 더 최신 Flash 모델이 있나요?

네. Qwen3.8-Flash는 에이전트 코딩 및 장기 호라이즌 에이전트 작업을 목표로 하는 최신 멀티모달 전문가 혼합(MoE) 모델입니다. 이미 잘 작동하는 일반 텍스트 파이프라인에는 Qwen3.5-Flash를 계속 사용하세요.

Qwen3.5-Flash 의 가격은 얼마인가요?

TokenLab 에서 Qwen3.5-Flash 은 입력 $0.10 / 출력 $0.40 1M Token 당 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.

Qwen3.5-Flash의 컨텍스트 윈도우와 출력 제한은 어떻게 되나요?

Qwen3.5-Flash은 최대 991,808 토큰의 컨텍스트를 지원하며, 한 번의 응답으로 최대 65,536 토큰까지 출력합니다.

Qwen3.5-Flash 은 어떤 엔드포인트를 써야 하나요?

Qwen3.5-Flash에 대해 https://api.tokenlab.sh/v1/responses를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.

Qwen3.5-Flash 은 어떤 오퍼레이션을 지원하나요?

Qwen3.5-Flash은(는) 텍스트-텍스트을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.

Qwen3.5-Flash 비교하기

출처

2026. 10. 2. 검토 완료

Qwen 3 / QwQ의 다른 모델

관련 모델