에이전트 파이프라인에서 토큰당 비용이 가장 저렴한 모델이 작업 완료당 비용까지 가장 저렴한 경우는 드뭅니다. 에이전트를 위한 최고의 가성비 AI 모델을 테스트했을 때, 도구 호출(tool call), JSON 복구, 사고의 연쇄(chain-of-thought) 스크래치에서 발생하는 출력 토큰이 비용의 대부분을 차지했습니다. DeepSeek V4 Flash, Gemini 3.5 Flash, Claude Sonnet 5, GPT-5.5, GLM-5.2, Laguna XS 2.1이 현재 논의 가능한 SSOT(Single Source of Truth) 예시입니다. 아래의 TokenLab 카탈로그 가격은 2026년 9월 19일 기준으로 관찰된 것이며, 외부 가격은 날짜가 명시되지 않았으므로 제공업체의 확인이 필요합니다. 새로 고침 시점에 해당 경로에 대한 제어된 TTFT, 초당 토큰 수 또는 재시도율 데이터셋을 사용할 수 없었기 때문에 지연 시간 벤치마크는 게시하지 않습니다. 이 내용을 비용 및 실패 모드에 대한 단기 목록으로 활용하고, 실제 루프에서 지연 시간을 직접 벤치마킹하십시오.
핵심 요약
- 출력 비용이 입력 비용보다 에이전트 지출을 더 많이 유발합니다. 에이전트는 턴당 소비하는 토큰보다 도구 호출, 재시도, JSON을 통해 훨씬 더 많은 토큰을 생성합니다.
- TokenLab 카탈로그 가격이 있는 현재 SSOT 예시 중, DeepSeek V4 Flash는 MTok당 입력 $0.147 / 출력 $0.294로 여기서 검증할 수 있는 가장 낮은 출력 비용 모델입니다.
- 모델 이름 충돌은 실제로 존재합니다. DeepSeek V4 Flash는 TokenLab 카탈로그의 $0.147/$0.294와 외부 목록의 $0.09/$0.18라는 두 가지 가격대로 나타납니다.
- 비디오 및 이미지 생성 가격(PixVerse, fal, Black Forest Labs)은 LLM 토큰 가격의 근거가 아닙니다. 이를 텍스트 에이전트 비용의 인용 자료로 사용해서는 안 되며, 아래에서 별도로 분리했습니다.
- Claude Sonnet 5, GLM-5.2, Kimi K2.7 Code, Qwen3.7 Plus 등에 대한 외부 비교 가격은 날짜가 명시된 공개 소스 URL이 부족합니다. 예산을 책정하기 전에 각 제공업체의 자체 가격 페이지에서 확인하십시오.
- 토큰당 가장 저렴한 모델이 자동으로 작업당 가장 저렴한 모델이 되지는 않습니다. 도구 호출에 실패하거나 JSON을 잘라내는 모델은 재시도를 유발하여 절감 효과를 상쇄합니다.
소스 스냅샷 및 실패 모드
| 소스 | 콘텐츠 유형 | 관찰 날짜 | 본 기사와의 관련성 |
|---|---|---|---|
| PixVerse 플랫폼 문서 (docs.platform.pixverse.ai) | 비디오 생성 가격 | 2026-07-08 | LLM 주장용으로 사용되지 않음 - 비디오 전용, 투명성을 위해 포함 |
| fal PixVerse V6 모델 페이지 (fal.ai/pixverse-v6) | 비디오 생성 가격 | 2026-07-08 | LLM 주장용으로 사용되지 않음 - 비디오 전용 |
| Black Forest Labs 가격 문서 (docs.bfl.ml) | 이미지 생성 가격 | 2026-07-08 | LLM 주장용으로 사용되지 않음 - 이미지 전용 |
| TokenLab 내부 모델 카탈로그 | 자사 LLM 및 미디어 가격 | 2026-09-19 | 아래 모든 TokenLab 카탈로그 가격의 주요 출처 |
| 개별 제공업체 가격 페이지 (OpenAI, Anthropic, Google, DeepSeek, Moonshot, Qwen, MiniMax, Z.ai) | LLM 가격 | 본 데이터셋에 날짜 없음 | 공개 예산 책정 전 독립적으로 검증해야 함 |
PixVerse, fal, BFL 소스는 더 광범위한 미디어 가격 조사 중에 수집되었기 때문에 연구 세트에 포함되었습니다. 이들은 초당 비디오 과금 및 이미지당 크레딧 비용을 설명하며, 토큰당 LLM 가격과는 무관합니다. 독자들이 왜 이들을 제외했는지 알 수 있도록 여기에 나열합니다. LLM 관련 주장에는 사용하지 않습니다.
당사의 파이프라인에서는 토큰 지출과 함께 도구 호출 재시도율, 잘린 JSON, 누락된 도구 호출, 환각된 함수 인수를 기록합니다. 새로 고침 시점에 이 정확한 경로에 대한 제어된 재시도율 데이터셋이 없으므로 비율을 게시할 수 없습니다. 예를 들어, 도구 호출의 15%를 실패하는 $0.05/MTok 모델은 2%를 실패하는 $1/MTok 모델보다 재시도 비용이 더 많이 들 수 있습니다. 정가가 아닌 이러한 실패 모드 계산이 저가형 모델 선택의 기준이 되어야 합니다.
에이전트를 위한 최고의 가성비 AI 모델 비교
아래의 모든 가격은 2026년 9월 19일에 관찰된 TokenLab의 자사 카탈로그 목록(토큰당, $/MTok 단위)입니다. 이는 본 기사의 LLM 에이전트 비용 주장에 대한 올바른 근거입니다.
| 모델 | 제공업체 | 입력 $/MTok | 출력 $/MTok | 에이전트 적합성 |
|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | $0.147 | $0.294 | TokenLab 카탈로그 중 가장 저렴한 출력 중심 SSOT 옵션; 외부 견적 비교 전 정확한 모델 ID 확인 필요 |
| Gemini 3.5 Flash | $1.50 | $9.00 | 멀티모달 에이전트 단계 (이미지 + 텍스트 도구 사용) | |
| Claude Sonnet 5 | Anthropic | $2.00 | $10.00 | 에이전트 출력의 최종 검증/QA 단계용 |
| GPT-5.5 | OpenAI | $5.00 | $30.00 | 복잡한 계획 또는 모호한 도구 선택 시 대체용 |
| Claude Opus 4.8 | Anthropic | $5.00 | $25.00 | 플래그십 비교용; 에이전트 루프 내에서는 거의 사용되지 않음 |
| Claude Fable 5 | Anthropic | $10.00 | $50.00 | 프리미엄 상한선 |
| GLM-5.2 | Z.ai | $0.93 | $3.00 | 저비용 라우팅을 위한 오픈 웨이트 예시 |
| Kimi K2.7 Code | Moonshot AI | $0.74 | $3.50 | 코딩 에이전트 예시 |
| Qwen3.7 Plus | Alibaba/Qwen | $0.32 | $1.28 | 저비용 라우팅 예시 |
| MiniMax M3 | MiniMax | $0.30 | $1.20 | 저비용 라우팅 예시 |
| DeepSeek V4 Pro | DeepSeek | $0.441 | $0.882 | 동일 제품군 내 더 무거운 추론 하위 작업용 |
감사 연속성을 위해 아래 외부 수치를 유지하며, 각 행을 미검증 상태로 표시합니다. 예산 책정용으로 사용하지 마십시오. 정확한 세부 정보는 현재 문서와 대조하여 확인해야 합니다.
| 모델 | 제공업체 | 입력 $/MTok | 출력 $/MTok | 검증 상태 |
|---|---|---|---|---|
| DeepSeek V4 Flash (외부 목록) | DeepSeek | $0.09 | $0.18 | 위의 TokenLab 카탈로그와 다름 - 어떤 제품/티어인지 확인 필요; 소스 세트에 날짜가 명시된 URL 없음 |
| MiniMax M3 | MiniMax | $0.30 | $1.20 | 소스 세트에 날짜가 명시된 URL 없음; 제공업체 문서 확인 필요 |
| Qwen3.7 Plus | Alibaba/Qwen | $0.32 | $1.28 | 소스 세트에 날짜가 명시된 URL 없음; 제공업체 문서 확인 필요 |
| Kimi K2.7 Code | Moonshot AI | $0.74 | $3.50 | 소스 세트에 날짜가 명시된 URL 없음; 제공업체 문서 확인 필요 |
| GLM-5.2 | Z.ai | $0.93 | $3.00 | 소스 세트에 날짜가 명시된 URL 없음; 제공업체 문서 확인 필요 |
| Claude Sonnet 5 | Anthropic | $2.00 | $10.00 | 소스 세트에 날짜가 명시된 URL 없음; 제공업체 문서 확인 필요 |
| Claude Opus 4.8 | Anthropic | $5.00 | $25.00 | 소스 세트에 날짜가 명시된 URL 없음; 제공업체 문서 확인 필요 |
| GPT-5.5 Batch/Flex | OpenAI | $2.50 | $15.00 | 소스 세트에 날짜가 명시된 URL 없음; 표준 GPT-5.5 행 아님 |
| GPT-5.5 | OpenAI | $5.00 | $30.00 | 소스 세트에 날짜가 명시된 URL 없음; 제공업체 문서 확인 필요 |
| Claude Fable 5 | Anthropic | $10.00 | $50.00 | 소스 세트에 날짜가 명시된 URL 없음; 제공업체 문서 확인 필요 |
은퇴한 카탈로그 가격대는 더 이상 현재 SSOT 모델 이름과 일치하지 않습니다. 감사 연속성을 위해 숫자를 보존하지만, 제공업체의 확인 없이 이러한 이름 없는 티어로 새로운 에이전트 작업을 라우팅하지 않습니다.
| 은퇴 또는 비 SSOT 티어 | 입력 $/MTok | 출력 $/MTok | 상태 |
|---|---|---|---|
| 은퇴한 초저가 티어 | $0.05 | $0.40 | 더 이상 현재 SSOT 예시 아님; 사용 전 후속 모델 확인 |
| 은퇴한 저가형 flash-lite 티어 | $0.25 | $1.50 | 더 이상 현재 SSOT 예시 아님; Gemini 3.5 Flash 또는 DeepSeek V4 Flash로 매핑 후 확인 |
| 은퇴한 저가형 mini 티어 | $0.25 | $2.00 | 더 이상 현재 SSOT 예시 아님; Claude Sonnet 5 또는 DeepSeek V4 Flash로 매핑 후 확인 |
| 은퇴한 소규모 검증 티어 | $1.00 | $5.00 | 더 이상 현재 SSOT 예시 아님; Claude Sonnet 5로 매핑 후 확인 |
| 은퇴한 중간 티어 대체용 | $1.25 | $10.00 | 더 이상 현재 SSOT 예시 아님; GPT-5.5로 매핑 후 확인 |
| 은퇴한 프리미엄 상한선 | $15.00 | $120.00 | 더 이상 현재 SSOT 예시 아님; GPT-5.5 또는 Claude Fable 5로 매핑 후 확인 |
에이전트를 위한 최고의 가성비 AI 모델 구현 참고사항
- 단일 최저가 모델이 아닌 작업별로 에이전트 티어를 나누십시오. 라우팅, 분류, 도구 선택은 DeepSeek V4 Flash 또는 Gemini 3.5 Flash로 라우팅하십시오. 다단계 계획은 DeepSeek V4 Pro 또는 GPT-5.5로 격상하십시오. 최종 답변 검증은 Claude Sonnet 5를 예약하십시오.
- 저가형 티어에서는 출력 토큰을 공격적으로 제한하십시오. 출력 비용이 에이전트 지출을 주도하므로 DeepSeek V4 Flash 및 Gemini 3.5 Flash 호출에 엄격한 최대 토큰 제한을 설정하십시오. 격상 티어에서만 더 긴 생성을 허용하십시오.
- 호출당 비용뿐만 아니라 모델별 실패 모드를 기록하십시오. 잘린 JSON, 누락된 도구 호출, 환각된 함수 인수를 토큰 지출과 별도로 추적하십시오. 예를 들어, 도구 호출의 15%를 실패하는 $0.05/MTok 모델은 2%를 실패하는 $1/MTok 모델보다 재시도 비용이 더 많이 들 수 있습니다.
- 코드에는 별칭이 아닌 정확한 모델 ID를 고정하십시오. 위에서 보여준 이름 충돌(두 가지 다른 DeepSeek V4 Flash 가격대)을 고려하여 전체 공급업체 및 모델 문자열을 하드코딩하십시오. 각 제공업체 업데이트 시 가격을 재검증하십시오.
- 외부 가격을 분기별로 재확인하십시오. 본 기사에 날짜가 명시된 소스 URL이 없는 모든 항목은 고객 대면 비용 견적에 포함되기 전에 제공업체의 실시간 가격 페이지에서 다시 가져와야 합니다.
다음은 본 기사의 카탈로그 모델 이름을 사용하는 라우팅 스케치입니다. 정확한 TokenLab 요청 형태와 도구 호출 오류 필드는 프로덕션 사용 전 TokenLab API 문서에서 확인해야 합니다.
라우팅 스케치 (TokenLab API 계약 아님). TokenLab API 문서에서 요청 형태를 확인하십시오.
for model in ['DeepSeek V4 Flash', 'Gemini 3.5 Flash', 'Claude Sonnet 5']:
도구 호출이 누락되거나 JSON이 잘린 경우 1회 재시도
응답에 유효한 도구 호출과 유효한 JSON이 포함된 경우:
응답 반환
해당 모델의 실패 모드 기록
최종 티어 실패 후 오류 발생
이 스케치는 재시도 경계를 보여줍니다. 도구 호출 오류를 포착하고, 실패 모드를 기록한 다음, 다음 모델로 이동합니다. 프로덕션 전 현재 TokenLab API 문서에서 요청 형태와 오류 필드를 확인하십시오.
TokenLab의 에이전트 라우팅 적합성
- 단일 카탈로그로 공급업체별 계정 관리 번거로움을 줄입니다. TokenLab은 OpenAI, Google, Anthropic, DeepSeek 가격 티어를 하나의 API 및 과금 인터페이스로 노출합니다. 워크플로우 단계를 DeepSeek V4 Flash에서 Gemini 3.5 Flash로 전환하는 것은 새로운 통합이 아닌 설정 변경이 됩니다.
- 감사 가능한 자사 날짜 명시 가격. 파편화된 타사 견적과 달리 본 기사의 TokenLab 카탈로그 숫자는 2026년 9월 19일 관찰된 플랫폼 자체 목록에서 가져온 것입니다. 이것이 바로 여기에 제시된 가격들이 '반드시 검증해야 함'이라는 주의사항 없이 제공되는 이유입니다.
- 에이전트 파이프라인을 위한 내장 티어링. TokenLab은 저가형 티어와 격상 티어 모델을 나란히 호스팅하므로 DeepSeek V4 Flash, Gemini 3.5 Flash, Claude Sonnet 5 전반에 걸쳐 비용과 실패율을 A/B 테스트할 수 있습니다. 에이전트의 라우팅 로직을 재설계할 필요가 없습니다.
관련 읽기 자료
FAQ
DeepSeek V4 Flash 가격이 왜 두 개인가요?
DeepSeek V4 Flash는 소스 세트에서 TokenLab 카탈로그의 $0.147/$0.294와 외부 목록의 $0.09/$0.18라는 두 가지 가격대로 나타납니다. 모델 이름은 제공업체와 리셀러 전반에 걸쳐 재사용되고 재책정됩니다. 코드에 정확한 공급업체와 모델 ID를 고정하고, 이름만 믿지 말고 제공업체의 실시간 문서와 대조하여 재검증하십시오.
외부 참조 가격을 예산 책정에 사용할 수 있나요?
아직은 안 됩니다. 해당 행들은 소스 세트에 날짜가 명시된 소스 URL이 없으므로 제공업체의 확인이 필요하다고 표시합니다. TokenLab 카탈로그 수치가 계획의 기초이며, 외부 테이블은 최종 숫자가 아닌 자체 검증을 위한 시작점입니다. 정확한 세부 정보는 현재 문서와 대조하여 확인해야 합니다.
현재 SSOT 모델 중 프로덕션 에이전트에 가장 저렴한 모델은 무엇인가요?
TokenLab 카탈로그 가격이 있는 현재 SSOT 예시 중 출력 비용 기준으로 DeepSeek V4 Flash가 출력 MTok당 $0.294로 가장 낮습니다. 외부 목록에는 $0.18/MTok으로 나와 있지만, 해당 수치는 제공업체의 확인이 필요합니다. 특정 도구 호출 스키마에 대한 재시도율을 고려한 후 가장 저렴한 모델을 측정하십시오.
이 기사가 LLM 가격에 관한 것인데 왜 PixVerse, fal, BFL이 인용되었나요?
이들은 LLM 가격 주장에 대한 근거로 인용되지 않았습니다. 더 광범위한 연구 조사에 대한 투명성을 위해 소스 스냅샷 테이블에만 나타나며, LLM 주장에는 사용되지 않음이 명시되어 있습니다. 모델 및 비용 비교 테이블의 모든 달러 수치는 TokenLab 자체 카탈로그에서 가져왔거나 미검증으로 표시되었습니다.
도구 호출 재시도가 가장 저렴한 모델 선택을 어떻게 바꾸나요?
도구 호출에 실패하거나 JSON을 잘라내는 저가형 모델은 재시도를 유발하며, 이러한 재시도는 출력 토큰을 추가합니다. 예를 들어, 도구 호출의 15%를 실패하는 $0.05/MTok 모델은 2%를 실패하는 $1/MTok 모델보다 재시도 비용이 더 많이 들 수 있습니다. 당사의 파이프라인에서는 토큰당 비용이 아닌 모델별 재시도율을 기록하고 작업 완료당 비용을 비교합니다.
TokenLab 모델 카탈로그를 살펴보고 지금 비용 비교를 시작하십시오: TokenLab 모델 카탈로그.
출처
2026-07-07 기준 가격
- PixVerse Platform Docs2026-07-08 기준 확인
- fal PixVerse V6 model page2026-07-08 기준 확인
- Black Forest Labs pricing docs2026-07-08 기준 확인
- fal FLUX.2 model page2026-07-08 기준 확인
- Google AI Gemini API pricing2026-07-08 기준 확인
- Claude Platform pricing2026-07-08 기준 확인
- OpenAI API pricing2026-07-08 기준 확인
- DeepSeek API pricing2026-07-08 기준 확인



