각 요청에 대해 Auto, TokenLab Verified 또는 Official를 선택할 수 있으며, 가격은 사전에 표시됩니다.새로운 기능 확인하기

Google: Gemini 3.5 Flash-Lite

Gemini 3.5 Flash-Lite는 짧은 응답 시간을 요구하는 대량 작업에 최적화되어 있습니다. 반복적으로 실행되며 텍스트 및 시각적 입력의 효율적인 처리가 필요한 문서 처리, 추출 및 소규모 에이전트 작업에 고려해 보십시오.
모델 비교
gemini-3.5-flash-lite
사용 가능Google채팅입력 캐싱 시 90% 할인
입력 / 출력-50%
$0.30 / $2.50$0.15 / $1.25
컨텍스트
1M
출시일
2026년 7월 21일
최대 출력
64K
모달리티
비전채팅
기능
도구 사용프롬프트 캐시

Gemini 3.5 Flash-Lite 소개

Gemini 3.5 Flash-Lite는 2026년 7월에 출시된 3.5 세대 중 가장 빠르고 비용 효율적인 Google 모델입니다. 문서 처리, 데이터 추출, 반복적인 소규모 에이전트 작업 등 짧은 응답 시간이 중요한 대량 작업에 최적화되어 있습니다. 텍스트와 이미지를 읽고, 도구를 호출하며, 스키마가 지정된 JSON을 반환하고 컨텍스트를 캐싱합니다. Google은 현재 신규 프로젝트에 이 모델을 권장합니다.

강점

  • 수천 번 반복되는 작업에서 짧은 응답 시간을 내도록 설계되었습니다.
  • 문서 및 스크린샷 처리를 위해 텍스트와 이미지를 함께 처리합니다.
  • 스키마가 지정된 JSON은 추출 결과의 일관성을 유지합니다.
  • 함수 호출을 통해 조회나 라우팅과 같은 작은 에이전트 단계를 실행할 수 있습니다.

다른 모델이 필요한 경우

  • 긴 코딩 세션과 복잡한 엔터프라이즈 워크플로우는 3.8 Flash나 3.1 Pro에 적합합니다.
  • 밀도가 높거나 모호한 문서에서는 더 큰 Flash 모델이 포착하는 세부 사항을 놓칠 수 있습니다.

시작하기

  1. API 키 만들기

    Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.

  2. 첫 번째 요청 보내기

    사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.

    텍스트-텍스트Gemini API
    POST/v1beta/models/gemini-3.5-flash-lite:generateContent
    API 형식:
    curl "https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash-lite:generateContent" \
      -H "Content-Type: application/json" \
      -H "x-goog-api-key: sk-xxx" \
      -d '{
        "contents": [
          {"role": "user", "parts": [{"text": "Hello!"}]}
        ]
      }'

가격 책정

Verified는 TokenLab 가격이 적용되어 대부분의 모델에서 더 저렴합니다. Official은 제조사가 책정한 공식 가격으로 더 안정적인 경로를 제공합니다. Auto는 요청을 완료한 경로의 가격으로 자동 청구합니다.

기본 사양

1M Token 당
Official 가격
입력 $0.30 / 출력 $2.50 / 캐시 읽기 $0.03
TokenLab 가격
입력 $0.15 / 출력 $1.25 / 캐시 읽기 $0.015
할인
-50%
프롬프트 캐시 가격

캐시 읽기

Official 가격
$0.03
TokenLab 가격
$0.015
할인
-50%

사용량 및 활동

성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.

사용량 및 가용성

지난 24시간
요청
성공률
P95 지연 시간
총 토큰
모델 성능
30일 성공률
99.7%
7일 중앙값 지연시간
1.9 sn=346
7일 P95 지연시간
7 sn=346
30일 요청 수
100+
마지막 활동
19시간 전

데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.

Console에서 열기

Console에서 Gemini 3.5 Flash-Lite을 열고 프롬프트를 수정하거나 전송하세요.

/v1beta/models/gemini-3.5-flash-lite:generateContent에서 gemini-3.5-flash-lite로 짧은 메시지를 테스트합니다. 응답, 지연 시간, 비용을 확인하세요.

사용 사례

적합한 용도
  • 비전
  • 문서 파이프라인

    계약서, 송장, 보고서를 대규모로 구조화된 필드로 변환하여 들어오는 모든 파일에 대해 검증된 JSON 레코드를 작성하세요.

  • 문의 분류(Triage)

    사람이나 더 큰 모델이 확인하기 전에 들어오는 티켓이나 메시지를 주제와 긴급도에 따라 분류하세요.

  • 소규모 에이전트

    주문 조회나 일정 변경과 같이 각 단계가 작고 루프가 자주 반복되는 좁은 범위의 도구 루프 작업을 실행하세요.

  • 시각적 검사

    업로드된 사진이 눈에 보이는 라벨이나 올바른 방향과 같은 간단한 규칙을 충족하는지 확인하세요.

프롬프트 예제

이 송장의 모든 항목을 설명, 수량, 단위 금액이 포함된 JSON으로 추출하세요.

이 티켓의 긴급도를 낮음, 중간, 높음으로 평가하고 그 이유를 한 문장으로 제시하세요.

이 제품 사진에 포장 라벨이 명확하게 보이는지 확인하세요. 예 또는 아니오로 답하고 그 이유를 설명하세요.

이 모델은 조건부 요금제입니다. 월간 토큰 총량만으로는 신뢰할 수 있는 견적을 낼 수 없습니다. 요청 사양, 캐시, 해당 시간대에 맞는 상세 요금을 사용하세요.

FAQ

Gemini 3.5 Flash-Lite의 용도는 무엇인가요?

추출, 분류, 라우팅, 간단한 멀티모달 검사와 같은 빠르고 반복적인 단순 작업입니다. 3.5 제품군 중 경제적인 모델로, 깊이보다는 응답 속도를 위해 제작되었습니다.

Gemini 3.1 Flash-Lite보다 최신 모델인가요?

네. 더 이후 세대이며, Google은 신규 프로젝트에 권장되는 경량 모델로 이 모델을 제시합니다. 기존 3.1 Flash-Lite는 기존 통합을 위해 계속 사용할 수 있습니다.

이미지를 읽을 수 있나요?

네, 요청 시 텍스트와 함께 이미지를 포함할 수 있으며, 답변은 일반 텍스트나 구조화된 JSON으로 반환되어 사진 검사 및 스캔 문서 추출에 적합합니다.

언제 이 모델이 부족한가요?

지속적인 추론, 신중한 장문 분석, 또는 몇 시간씩 걸리는 코딩 작업이 필요할 때입니다. 그러한 경우에는 Gemini 3.8 Flash나 3.1 Pro를 사용하세요.

Gemini 3.5 Flash-Lite 의 가격은 얼마인가요?

TokenLab 에서 Gemini 3.5 Flash-Lite 은 입력 $0.15 / 출력 $1.25 1M Token 당 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.

Gemini 3.5 Flash-Lite의 컨텍스트 윈도우와 출력 제한은 어떻게 되나요?

Gemini 3.5 Flash-Lite은 최대 1,048,576 토큰의 컨텍스트를 지원하며, 한 번의 응답으로 최대 65,536 토큰까지 출력합니다.

Gemini 3.5 Flash-Lite 은 어떤 엔드포인트를 써야 하나요?

Gemini 3.5 Flash-Lite에 대해 https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash-lite:generateContent를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.

Gemini 3.5 Flash-Lite 은 어떤 오퍼레이션을 지원하나요?

Gemini 3.5 Flash-Lite은(는) 텍스트-텍스트을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.

Gemini 3.5 Flash-Lite 비교하기

출처

2026. 10. 2. 검토 완료

Gemini 3의 다른 모델

관련 모델