Alibaba: Qwen3.5-Flash
qwen3.5-flash- 입력 / 출력
- $0.10 / $0.40
- 컨텍스트
- 992K
- 최대 출력
- 64K
- 모달리티
- 채팅
- 기능
- 프롬프트 캐시
Qwen3.5-Flash 소개
Qwen3.5-Flash는 Alibaba Qwen3.5 제품군의 경량 호스팅 티어로, Qwen3.5-Plus보다 빠르고 저렴한 텍스트 처리를 위해 구축되었습니다. 매우 큰 컨텍스트와 프롬프트 캐싱 기능을 갖추고 있어 요약 작업이나 동일한 대용량 소스에 대한 반복적인 처리에 적합합니다. 또한 해당 제품군이 가진 광범위한 언어 지원 범위를 공유합니다.
강점
- 프롬프트 캐싱은 하나의 대용량 소스를 반복적으로 참조할 때 유용합니다.
- Plus 티어보다 속도에 최적화되어 있습니다.
- Qwen3.5 제품군의 201개 언어 지원 범위를 공유합니다.
- 요약이나 태깅과 같은 파이프라인 단계에 적합합니다.
다른 모델이 필요한 경우
- Qwen3.5-Plus는 더 복잡한 분석 작업에 더 뛰어납니다.
- 텍스트 전용 모델이므로 비전 모델을 대체할 수 없습니다.
- 에이전트 코딩 결과를 보고하는 Qwen3.8-Flash보다 이전 모델입니다.
시작하기
API 키 만들기
Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.
첫 번째 요청 보내기
사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.
텍스트-텍스트Responses APIPOST/v1/responsesAPI 형식:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "qwen3.5-flash", "input": "Hello!" }'
가격 책정
Verified는 TokenLab 가격이 적용되어 대부분의 모델에서 더 저렴합니다. Official은 제조사가 책정한 공식 가격으로 더 안정적인 경로를 제공합니다. Auto는 요청을 완료한 경로의 가격으로 자동 청구합니다.
입력 토큰 <= 125K
1M Token 당- Official 가격
- 입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40
- Official
- 입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40
- 할인
- —
입력 토큰 <= 250K
1M Token 당- Official 가격
- 입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40
- Official
- 입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40
- 할인
- —
입력 토큰 <= 1M
1M Token 당- Official 가격
- 입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40
- Official
- 입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40
- 할인
- —
캐시 읽기
- Official 가격
- $0.01
- Official
- $0.01
- 할인
- —
캐시 쓰기
- Official 가격
- $0.125
- Official
- $0.125
- 할인
- —
| Official 가격1M Token 당 | Official1M Token 당 | 할인 | |
|---|---|---|---|
| 입력 토큰 <= 125K | 입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40 | 입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40 | — |
| 입력 토큰 <= 250K | 입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40 | 입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40 | — |
| 입력 토큰 <= 1M | 입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40 | 입력 $0.10 / 출력 $0.40 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125 / 텍스트 입력 $0.10 / 텍스트 출력 $0.40 | — |
| 프롬프트 캐시 가격 | |||
| 캐시 읽기 | $0.01 | $0.01 | — |
| 캐시 쓰기 | $0.125 | $0.125 | — |
사용량 및 활동
성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.
사용량 및 가용성
지난 24시간- 요청
- 성공률
- P95 지연 시간
- 총 토큰
데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.
Console에서 열기
Console에서 Qwen3.5-Flash을 열고 프롬프트를 수정하거나 전송하세요.
/v1/responses에서 qwen3.5-flash로 짧은 메시지를 테스트합니다. 응답, 지연 시간, 비용을 확인하세요.
사용 사례
일괄 요약
야간 파이프라인에서 긴 보고서를 요약할 때, 질문하는 섹션 전반에 걸쳐 동일한 대용량 소스를 캐싱하여 처리합니다.
문서 태깅 및 라우팅
긴 텍스트를 주제, 긴급도, 담당자별로 분류하고 후속 코드가 파싱할 수 있는 고정된 형식으로 결과를 반환합니다.
단일 소스에 대한 반복적인 질의응답
매뉴얼이나 정책을 한 번 캐싱해두면, 매번 전체 텍스트를 재처리하는 비용 없이 여러 번 질문할 수 있습니다.
초안 정리
작성자의 주장과 수치는 그대로 유지하면서 긴 초안의 문법, 어조, 구조를 수정합니다.
프롬프트 예제
이 핸드북의 각 섹션을 두 줄로 요약하세요.
이 티켓에 제품 영역과 긴급도를 태그하고 JSON 형식으로 반환하세요.
붙여넣은 정책에 대해 질문에 답하세요. 내용이 없으면 '언급되지 않음'이라고 답변하세요.
이 모델은 조건부 요금제입니다. 월간 토큰 총량만으로는 신뢰할 수 있는 견적을 낼 수 없습니다. 요청 사양, 캐시, 해당 시간대에 맞는 상세 요금을 사용하세요.
FAQ
Qwen3.5-Flash란 정확히 무엇인가요?
Alibaba Qwen3.5 제품군의 경량 호스팅 티어로, 긴 텍스트의 빠른 처리를 목표로 합니다. 성능 면에서는 Qwen3.5-Plus보다 아래 단계이며, 반복적이고 일상적인 문서 처리 단계에 적합합니다.
Qwen3.5-Plus 대신 Flash를 선택해야 하는 경우는 언제인가요?
대량 요약, 태깅, 고정된 소스에 대한 질의응답처럼 깊이보다 속도와 비용이 중요할 때 Flash를 선택하세요. 여러 구절에 걸쳐 더 세심한 분석이 필요한 답변이 필요할 때는 Plus 모델로 전환하세요.
Qwen3.5-Flash는 프롬프트 캐싱을 지원하나요?
네. 프롬프트 캐싱은 동일한 긴 소스를 반복적으로 보낼 때 유용하며, 호출 간에 질문만 변경되는 반복적인 문서 처리 단계에서 효과적입니다.
Qwen3.5-Flash가 이미지를 읽을 수 있나요?
아니요. Qwen3.5-Flash는 텍스트만 처리합니다. 스크린샷, 스캔본, 차트 등이 작업에 포함된 경우 Qwen3.8-Flash, Qwen3.7-Plus 또는 Qwen3-VL Plus를 사용하고, 추출된 텍스트를 이 모델로 보내세요.
Alibaba에서 나온 더 최신 Flash 모델이 있나요?
네. Qwen3.8-Flash는 에이전트 코딩 및 장기 호라이즌 에이전트 작업을 목표로 하는 최신 멀티모달 전문가 혼합(MoE) 모델입니다. 이미 잘 작동하는 일반 텍스트 파이프라인에는 Qwen3.5-Flash를 계속 사용하세요.
Qwen3.5-Flash 의 가격은 얼마인가요?
TokenLab 에서 Qwen3.5-Flash 은 입력 $0.10 / 출력 $0.40 1M Token 당 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.
Qwen3.5-Flash의 컨텍스트 윈도우와 출력 제한은 어떻게 되나요?
Qwen3.5-Flash은 최대 991,808 토큰의 컨텍스트를 지원하며, 한 번의 응답으로 최대 65,536 토큰까지 출력합니다.
Qwen3.5-Flash 은 어떤 엔드포인트를 써야 하나요?
Qwen3.5-Flash에 대해 https://api.tokenlab.sh/v1/responses를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.
Qwen3.5-Flash 은 어떤 오퍼레이션을 지원하나요?
Qwen3.5-Flash은(는) 텍스트-텍스트을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.
Qwen3.5-Flash 비교하기
출처
2026. 10. 2. 검토 완료