모델 문자열이 변경되어 404 오류를 마주하는 것은 에이전트 루프를 시작하는 아주 좋지 않은 방식입니다. Gemini 3.5 Flash API는 빠른 에이전트 루프에 연결할 가치가 충분하지만, 반드시 실시간 모델 목록에서 정확한 gemini-3.5-flash 모델 ID를 확인한 후에 진행해야 합니다. Google Cloud는 Gemini 3.5 Flash의 표준 Global 티어 가격을 100만 입력 토큰당 $1.50, 100만 텍스트 출력 토큰당 $9.00로 책정하고 있으며, Flex/Batch 가격은 입력 $0.75, 출력 $4.50입니다. 소스에서도 동일한 함정을 확인했습니다. 오늘 작동하는 모델 ID가 내일 404 오류를 일으킬 수 있습니다. 온라인상의 가격표는 검증된 공급업체 가격과 교차 검증되지 않은 디렉토리 목록이 혼재되어 있는 경우가 많습니다. 이 가이드에서는 현재 검증 가능한 내용과 그렇지 않은 내용을 다루며, 모델 ID가 변경되어도 중단되지 않는 에이전트 루프를 구축하는 방법을 설명합니다.
주요 요약
- Google Cloud의 Agent Platform 가격 페이지에는 Gemini 3.5 Flash가 표준 Global 티어 기준 100만 입력 토큰당 $1.50, 100만 출력 토큰당 $9.00로 명시되어 있으며, 이는 새로고침 시점의 TokenLab 디렉토리 목록과 일치합니다.
- 고정해야 할 정확한 모델 문자열은
gemini-3.5-flash입니다. Google의 Gemini API 모델 페이지에서는 이를 안정적인 모델의 예시로 나열하고 있습니다. 하지만 배포 전에는 반드시 실시간 모델 목록을 통해 다시 확인하십시오. - TokenLab의 통합 API를 통해 라우팅하면 공급업체별 SDK 문자열을 하드코딩할 필요가 없습니다. TokenLab은 안정적인 모델 슬러그를 현재 유효한 기본 식별자에 매핑합니다.
- 아래 표의 경쟁사 가격(GPT-5.5, Claude Sonnet 5, DeepSeek V4 Flash)은 TokenLab 디렉토리에서만 가져온 것입니다. 이 리뷰에서는 해당 모델에 대한 독립적인 공급업체 가격 페이지가 제공되지 않았으므로, 예산을 책정하기 전에 OpenAI, Anthropic, DeepSeek에 직접 확인하십시오.
- 벤치마크된 지연 시간 수치(첫 토큰 생성 시간, 전체 5단계 루프 지속 시간)는 독립적으로 소싱되지 않았으므로 여기에 인용하지 않았습니다. 간접적인 수치를 인용하기보다 직접 루프를 구현하여 단계별 p50/p95를 측정하십시오.
- 에이전트 루프에서는 일반적으로 출력 토큰이 비용을 주도합니다. Gemini 3.5 Flash의 출력 요금($9.00/M)은 입력 요금($1.50/M)의 6배이므로, 프롬프트 길이를 줄이는 것보다
max_output_tokens를 제한하는 것이 더 중요합니다.
소스 스냅샷
| 소스 | 포함 내용 | 관찰 날짜 |
|---|---|---|
| Google Cloud Agent Platform 가격 | Gemini 3.5 Flash 표준, 캐시된 입력 및 Flex/Batch 토큰 가격 | 2026-07-08 |
| Google Gemini API 모델 페이지 | 안정적인 모델 명명 지침; gemini-3.5-flash가 안정적인 모델 예시로 나열됨 |
2026-07-08 |
| TokenLab 모델 및 가격 디렉토리 | Google, Anthropic, OpenAI, DeepSeek 전반의 gemini-3.5-flash 및 경쟁 모델에 대한 토큰당 가격 |
2026-07-08 |
Google Cloud의 Gemini Enterprise Agent Platform은 Gemini Developer API 가격 페이지와 별도로 Gemini 3.5 Flash에 대한 자체 가격 일정을 나열합니다. 표준 Global 요금은 100만 입력 토큰당 $1.50, 100만 텍스트 출력 토큰당 $9.00입니다. Flex/Batch Global 요금은 입력 $0.75, 출력 $4.50으로 낮아집니다. 표준 티어의 캐시된 입력은 100만 토큰당 $0.15입니다. 이는 Gemini 3.5 Flash가 자리 표시자나 미리보기 라벨이 아닌, Google Cloud의 엔터프라이즈 에이전트 워크로드를 위해 가격이 책정된 안정적이고 일반적으로 사용 가능한 모델이라는 직접적인 증거입니다. 여러 기사의 비용을 비교하는 독자는 수치를 상호 교환 가능한 것으로 취급하기 전에 어떤 가격 페이지에서 요금을 가져왔는지 확인해야 합니다.
Gemini 3.5 Flash API 모델 및 비용 비교
아래의 모든 수치는 TokenLab 디렉토리 목록입니다. '공급업체에 확인'으로 표시된 행은 이 리뷰를 위해 제공된 독립적인 인용 자료가 없습니다.
| 모델 | 공급업체 | 컨텍스트 윈도우 | 입력 $/M 토큰 | 출력 $/M 토큰 | 참고 |
|---|---|---|---|---|---|
| gemini-3.5-flash | 1,048,576 | $1.50 | $9.00 | TokenLab 디렉토리; Google의 실시간 가격 페이지와 대조 확인 | |
| gemini-3.1-flash-lite | n/a | $0.25 | $1.50 | TokenLab 디렉토리 | |
| gemini-3-pro-image | n/a | $2.00 | $12.00 | TokenLab 디렉토리, 이미지 티어; 텍스트 에이전트 대체용으로 사용 금지 | |
| gpt-5 | OpenAI | n/a | $1.25 | $10.00 | TokenLab 디렉토리 |
| gpt-5.5 | OpenAI | 1,050,000 | $5.00 | $30.00 | TokenLab 디렉토리 - OpenAI에 확인 |
| claude-sonnet-5 | Anthropic | 1,000,000 | $2.00 | $10.00 | TokenLab 디렉토리 - Anthropic에 확인 |
| claude-haiku-4-5 | Anthropic | n/a | $1.00 | $5.00 | TokenLab 디렉토리 |
| deepseek-v4-flash | DeepSeek | 1,048,576 | $0.09 | $0.18 | TokenLab 디렉토리 - DeepSeek에 확인 |
작은 도구 호출(tool-calling)을 많이 수행하는 에이전트 루프의 경우, 토큰당 단가가 가장 저렴한 것이 항상 작업당 가장 저렴한 것은 아닙니다. 재시도가 적거나 추론 과정이 짧은 모델이 더 낮은 표시 가격을 가진 모델보다 효율적일 수 있습니다. 토큰당 비용이 아닌 완료된 작업당 비용을 측정하십시오.
Gemini 3.5 Flash API 구현 단계
코드를 작성하기 전에 모델 ID를 확인하십시오. 새로고침 시점에 고정해야 할 모델 ID는
gemini-3.5-flash였으며, Google의 모델 문서에도 안정적인 모델 예시로 나열되어 있습니다. 배포 전에는 여전히 공급업체의 모델 목록 엔드포인트를 호출하거나 TokenLab의 디렉토리를 확인하십시오. 이것이 'SDK 오류 발생' 문제를 해결하는 방법입니다. 호출 시점에 해당 문자열이 존재하지 않았기 때문입니다. 잘못된 식별자는 어떤 재시도 로직으로도 해결할 수 없습니다. 예를 들어, 소스에서는 해당 실패 모드를 직접 설명합니다.원시 공급업체 SDK 대신 통합 엔드포인트를 통해 라우팅하십시오. TokenLab(또는 유사한 게이트웨이)을 사용하면 애플리케이션 코드가 안정적인 슬러그를 참조하고, 게이트웨이가 이를 공급업체의 현재 유효한 식별자로 해석합니다. 이렇게 하면 에이전트 루프가 공급업체 측의 모델 이름 변경이나 지원 중단으로부터 분리됩니다.
명시적인 단계와 계측(instrumentation)을 사용하여 루프를 구축하십시오:
# 예시 구조일 뿐입니다 - 배포 전 게이트웨이의 현재 문서와
# 정확한 엔드포인트/모델 필드를 확인하십시오.
import time
def agent_loop(task):
timings = {}
t0 = time.time()
plan = call_model(model="gemini-3.5-flash", prompt=build_plan_prompt(task))
timings["plan"] = time.time() - t0
t0 = time.time()
context = retrieve_context(plan)
timings["retrieve"] = time.time() - t0
t0 = time.time()
tool_result = call_tool(plan, context)
timings["tool_call"] = time.time() - t0
t0 = time.time()
synthesis = call_model(
model="gemini-3.5-flash",
prompt=build_synthesis_prompt(tool_result),
max_output_tokens=512,
)
timings["synthesize"] = time.time() - t0
t0 = time.time()
response = format_response(synthesis)
timings["respond"] = time.time() - t0
return response, timings
당사의 파이프라인에서는 실행당 timings를 기록하고 대표적인 작업 배치에 걸쳐 자체적인 p50/p95를 계산합니다. 네트워크 상태, 프롬프트 길이, 공급업체 부하에 따라 수치가 변하므로 다른 사람의 환경에서 가져온 고정된 '루프당 N초' 수치를 신뢰하거나 게시하지 마십시오.
출력 토큰을 의도적으로 제한하십시오. 위 디렉토리 가격에 따르면
gemini-3.5-flash의 출력 토큰 비용은 입력 토큰의 약 6배입니다. 가격 산정을 테스트해 보았습니다. 모델이 길게 실행되도록 두지 말고 단계별로max_output_tokens를 설정하십시오. 이는 장황한 답변이 흔한 합성(synthesis) 단계에서 가장 중요합니다.폴백(fallback) 체인을 추가하십시오. 보조 모델(예: 비용 효율을 위해
gemini-3.1-flash-lite또는 완전히 다른 공급업체)을 구성하여 단일 모델의 중단이나 지원 중단이 전체 에이전트를 마비시키지 않도록 하십시오.
TokenLab을 사용해야 하는 경우
- 불안정한 공급업체 문자열 대신 안정적인 모델 슬러그를 원할 때. TokenLab의 디렉토리 방식을 사용하면 공급업체가 모델 이름을 변경하거나 지원을 중단할 때마다 코드를 다시 작성할 필요가 없습니다. Google의 Veo 3.0 종료가 2026년 6월 30일로 예정된 것은 이러한 위험을 보여줍니다.
- 모델 교체를 평가할 때마다 4개의 개별 가격 페이지를 수동으로 확인하는 대신, 공급업체를 결정하기 전에 여러 공급업체의 비용을 한곳에서 비교해야 할 때.
- 다중 공급업체 폴백 로직을 실행 중이며, 4개의 개별 SDK 통합을 유지하는 대신 Google, Anthropic, OpenAI, DeepSeek 모델 전반에서 일관된 요청/응답 형태를 원할 때.
관련 읽기 자료
FAQ
gemini-3.5-flash는 Google SDK에 직접 호출할 수 있는 유효한 모델 ID인가요?
그렇게 가정하지 마십시오. 배포 전 Google의 현재 모델 목록과 대조하여 확인하십시오. 모델 ID 문자열은 변경될 수 있으며, 미리보기/GA 상태는 시간이 지남에 따라 바뀝니다. TokenLab을 통해 라우팅하는 경우 게이트웨이가 이 매핑을 처리합니다.
비교 표의 경쟁사 가격은 어디서 가져온 것인가요?
TokenLab 디렉토리 목록입니다. 이 기사의 Veo 비디오 가격만이 독립적으로 날짜가 지정된 Google 소스(2026-07-08 관찰)를 추적합니다. GPT-5.5, Claude Sonnet 5, DeepSeek V4 Flash 가격은 독립적인 인용 자료가 제공되지 않았으므로, 고객 대상 비용 견적에 이 수치를 사용하기 전에 각 공급업체에 확인하십시오.
5단계 Gemini 3.5 Flash 에이전트 루프는 얼마나 빠른가요?
이 기사를 위해 독립적으로 소싱된 벤치마크 수치가 없으므로 여기에 포함하지 않았습니다. 간접적인 수치에 의존하기보다 직접 루프를 구현(위의 코드 샘플 참조)하여 환경 내의 실제 p50/p95 지연 시간을 측정하십시오.
사용 중인 모델이 프로젝트 도중에 지원 중단되면 어떻게 되나요?
이것이 바로 Google의 Veo 3.0 종료(2026년 6월 30일)가 보여주는 시나리오입니다. 폴백 체인을 구축하고, 가능하면 업데이트된 모델 슬러그를 유지하는 게이트웨이를 통해 라우팅하여 지원 중단 시 코드 재작성이 필요 없도록 하십시오.
TokenLab API 키를 생성하여 배포 전에 현재 모델 ID를 비교하십시오.
출처
2026-07-08 기준 가격
- Google AI Gemini API pricing2026-07-08 기준 확인
- Google Cloud Agent Platform pricing2026-07-08 기준 확인
- Google Gemini API models2026-07-08 기준 확인
- TokenLab model directory2026-07-07 기준 확인



