배치(Batch) 추론 가격 책정은 응답 지연 시간과 낮은 토큰당 요금을 맞바꾸는 방식으로 작동합니다. 사용자가 작업을 제출하면 제공업체가 정의된 시간(보통 최대 24시간) 내에 이를 처리하며, 동기식 실시간 호출보다 저렴한 비용을 지불하게 됩니다. 이 거래가 가치 있는지는 전적으로 귀하의 워크로드가 대기 시간을 허용할 수 있는지 여부에 달려 있습니다.
이 기사에서는 OpenAI와 Google이 게시한 배치 API 문서를 기반으로 배치(비동기) 추론과 표준 동기식 API 호출을 비교하고, 비동기 경로가 실제로 제품의 비용을 절감할 수 있는 시점에 대한 의사결정 프레임워크를 제시합니다.
핵심 요약
- OpenAI와 Gemini는 모두 동기식 호출보다 할인된 요금으로 비동기 처리를 수행하는 배치 API를 제공합니다. 요금은 변경될 수 있으므로 예산을 책정하기 전에 각 제공업체의 가격 페이지에서 정확한 현재 할인율을 확인하십시오.
- 배치 추론은 즉각적인 응답이 필요한 작업이 아니라 처리 시간을 허용할 수 있는 워크로드(대량 분류, 임베딩 생성, 오프라인 평가, 데이터셋 라벨링, 백필 작업 등)에 적합합니다.
- 실시간 채팅, 코딩 에이전트, 대화형 제품 기능은 처리 시간으로 인해 실시간 사용자 상호작용에 사용할 수 없으므로 일반적으로 배치 가격 책정에 적합하지 않습니다.
- 가장 큰 누적 비용 절감은 배치 할인과 모델 선택 및 프롬프트 효율화 작업을 결합할 때 발생합니다. 다른 방법은 /models/rankings 및 AI API 비용 절감 가이드를 참조하십시오.
배치 추론의 실제 의미
동기식 API 호출은 모델이 생성을 완료하는 즉시(보통 수 초 내) 응답을 반환합니다. 사용자는 그 즉시성에 대한 토큰당 요금을 지불합니다. 배치 추론은 이 모델을 뒤집습니다. 단일 요청-응답 교환 대신 요청 파일이나 목록을 작업으로 제출합니다. 제공업체는 작업을 대기열에 넣고 관리 가능한 시간 내에 처리하며, 완료되면 결과를 검색할 수 있도록 합니다.
이는 모델 내부의 새로운 추론 기술이 아닙니다. 이는 다른 상업적 및 운영적 계약입니다. 제공업체는 귀하의 워크로드를 유휴 또는 비피크 시간대 용량에 맞춰 예약할 수 있으며, 그 대가로 즉시 처리해야 하는 요청보다 토큰당 더 낮은 요금을 청구합니다.
OpenAI와 Google 모두 각 API에 대해 이 패턴을 문서화하고 있습니다:
- OpenAI의 Batch API 레퍼런스는 업로드된 요청 파일로부터 배치 객체를 생성하고, 상태를 추적하며, 작업 완료 후 출력을 검색하는 방법을 설명합니다(platform.openai.com/docs/api-reference/batch/object).
- Google의 Gemini Batch API 문서는 유사한 모델을 설명합니다. 요청 배치를 제출하면 작업이 비동기적으로 실행되고, 처리 후 결과를 검색합니다(ai.google.dev/gemini-api/docs/batch-api).
제공업체마다 메커니즘(파일 기반 제출, 작업 객체, 상태 폴링, 출력 검색)은 약간 다르지만, 기본 형태는 일관됩니다. 지금 제출하고, 나중에 수집하며, 동기식보다 토큰당 더 적은 비용을 지불하는 것입니다. 세부 사항은 제공업체마다 다르고 변경될 수 있으므로, 귀하의 계정 및 모델에 적용되는 정확한 처리 시간과 할인율은 각 제공업체의 최신 문서를 확인하십시오.
두 가지 문서화된 배치 API의 작동 방식
기계적인 수준에서 두 제공업체 모두 유사한 수명 주기를 따릅니다:
- 요청 준비. 처리하려는 개별 추론 요청을 조립합니다. 일반적으로 파일 형식으로 구성됩니다(OpenAI는 사용자 지정 ID로 키가 지정된 요청 파일을 허용하며, Gemini는 구조화된 요청 배치를 허용합니다).
- 작업 제출. 업로드된 입력을 참조하는 배치 객체 또는 작업 리소스를 생성합니다.
- 완료 폴링 또는 대기. 작업은 제공업체가 문서화된 시간 내에 처리를 완료할 때까지 상태(대기 중, 진행 중, 완료 또는 실패)를 거칩니다.
- 출력 검색. 완료되면 출력 파일이나 결과 세트를 다운로드하거나 가져와서 ID별로 각 응답을 원래 요청과 일치시킵니다.
어떤 제공업체도 배치 작업을 즉시 처리하지 않습니다. 이것이 바로 이 가격 모델의 핵심입니다. 작업은 귀하의 일정이 아닌 제공업체의 일정에 따라 실행되며, 사용자는 더 낮은 요금을 대가로 제한된 지연 시간을 수용합니다. 귀하의 제품이 그 지연 시간을 허용할 수 없다면, 서류상 얼마나 절감할 수 있는지와 관계없이 배치 가격을 사용할 수 없습니다.
배치 가격 책정이 비용을 절감하는 경우: 의사결정 체크리스트
워크로드를 배치 엔드포인트로 라우팅하기 전에 이 체크리스트를 사용하십시오:
- 워크로드가 자연스러운 비대화형 형태인가? 데이터셋에 대한 분류 패스, 문서 말뭉치에 대한 임베딩 생성, 콘텐츠 조정 스윕 또는 야간 요약 작업 등이 적합합니다.
- 귀하의 제품이 문서화된 처리 시간을 허용할 수 있는가? 사용자나 하위 시스템이 수 초 또는 수 분 내에 결과가 필요하다면 배치는 적합하지 않습니다.
- 볼륨이 충분히 큰가? 배치 할인은 토큰당 적용되므로 절대적인 절감액은 볼륨에 비례합니다. 소량의 요청은 청구서에 큰 변화를 주지 않습니다.
- 작업이 멱등(idempotent)이거나 안전하게 재시도할 수 있는가? 배치 작업은 비동기적으로 실행되고 부분적으로 실패할 수 있으므로, 파이프라인은 하위 상태를 손상시키지 않고 재제출이나 부분 완료를 처리할 수 있어야 합니다.
- 오케스트레이션 계층이 이미 비동기 작업 폴링을 지원하는가? 이 패턴을 처음 구축하는 경우, 작업 제출, 상태 폴링 및 출력 조정에 필요한 엔지니어링 시간을 예산에 포함하십시오.
| 차원 | 동기식 API | 배치(비동기) API |
|---|---|---|
| 지연 시간 | 일반적으로 수 초 | 제공업체의 문서화된 시간 내, 수 분에서 수 시간 |
| 가격 | 표준 토큰당 요금 | 제공업체 문서에 따른 동기식 대비 할인된 토큰당 요금 |
| 적합성 | 채팅, 에이전트, 실시간 제품 기능 | 대량 분류, 임베딩, 오프라인 평가, 백필 |
| 오류 처리 | 호출 시 즉각적인 오류 | 작업 수준 상태; 배치 내 부분 실패 가능 |
| 엔지니어링 오버헤드 | 단순 요청-응답 | 작업 제출, 폴링 및 출력 검색 로직 필요 |
| 출력 순서 | 호출 순서와 일치 | 호출 순서가 아닌 사용자 지정 요청 ID로 일치 |
배치 가격 책정이 적합하지 않은 경우
배치 추론은 사람이나 하위 시스템이 응답을 기다리는 모든 경우에 적합하지 않습니다. 여기에는 다음이 포함됩니다:
- 대화형 에이전트 및 채팅 제품. 사용자는 처리 시간 이후가 아니라 수 초 내에 답변을 기대합니다.
- 코딩 어시스턴트 및 에이전트 기반 코딩 워크플로우. Claude Sonnet 5 또는 Kimi K2.7 Code와 같은 모델을 중심으로 구축된 도구는 개발자와 모델 간의 긴밀한 피드백 루프에 의존합니다. 배치를 사용하면 상호작용이 완전히 중단됩니다.
- 사용자 대상 기능을 위한 실시간 콘텐츠 생성. Nano Banana Pro 또는 Veo 3와 같은 API를 통한 주문형 이미지 또는 비디오 생성(사용자가 진행률 표시기를 보고 있는 경우)이 포함됩니다.
- 서비스 수준 지연 시간 요구 사항이 있는 모든 것. 요구 사항이 느슨하더라도(예: 1분 미만) 배치 창은 보통 초 단위가 아닌 시간 단위로 측정됩니다.
파이프라인의 일부는 실시간이고 일부는 그렇지 않다면 작업을 분리하십시오. 대화형 부분은 동기식 API를 통해 라우팅하고, 대량의 지연 허용 부분(야간 재색인, 데이터셋 재라벨링, 평가 실행)은 배치 엔드포인트로 푸시하십시오.
실용적인 요청 형태
정확한 스키마는 OpenAI의 배치 객체와 Gemini의 배치 API 간에 다르므로, 다음은 각 제공업체의 요청 형식을 그대로 복사한 것이 아니라 예시적인 형태로 이해하십시오. 구현하기 전에 현재 문서에서 정확한 필드 이름과 엔드포인트를 확인하십시오.
# 1. 각 요청에 사용자 지정 ID를 포함한 요청 파일 준비
{"custom_id": "req-001", "method": "POST", "url": "/v1/chat/completions",
"body": {"model": "your-selected-model", "messages": [{"role": "user", "content": "Classify this ticket."}]}}
{"custom_id": "req-002", "method": "POST", "url": "/v1/chat/completions",
"body": {"model": "your-selected-model", "messages": [{"role": "user", "content": "Classify this ticket."}]}}
# 2. 배치 작업 제출
POST /v1/batches
{
"input_file_id": "file-abc123",
"endpoint": "/v1/chat/completions",
"completion_window": "24h"
}
# 3. 작업 상태 폴링
GET /v1/batches/{batch_id}
# 상태 반환: queued | in_progress | completed | failed
# 4. 완료 후 출력 검색
GET /v1/files/{output_file_id}/content
# custom_id를 통해 각 응답을 원래 요청과 일치시킴
핵심 엔지니어링 패턴은 제공업체와 관계없이 동일합니다. 안정적인 ID로 요청 파일을 빌드하고, 작업을 제출하고, 완료를 폴링하고, 원래 요청 목록과 출력을 조정하십시오. 작업 자체가 성공하더라도 일부 개별 요청이 실패한 상태로 배치가 완료될 수 있으므로, 작업 수준에서의 부분 실패에 대한 재시도 로직을 구축하십시오.
배치 할인과 모델 선택 결합
배치 가격 책정은 하나의 수단일 뿐입니다. 이는 AI 모델 라우팅 벤치마크 및 AI API 비용 절감 가이드에서 다룬 모델 및 프롬프트 수준의 결정과 결합됩니다. 배치 적합성이 있으면서 DeepSeek V4 Flash, GLM-5.2 또는 Gemini 3.5 Flash와 같이 라우팅 친화적인 작업에 저비용 모델을 사용하는 워크로드는 일반적으로 두 가지 수단을 단독으로 적용할 때보다 더 큰 절대적 절감 효과를 볼 수 있습니다. 대규모 작업을 단일 모델 및 가격 계층에 커밋하기 전에, 제공업체가 라인업을 업데이트함에 따라 프론티어 모델과 저비용 모델 간의 상대적 가격이 변동되므로 /models/rankings에서 현재 모델별 가격 및 포지셔닝을 확인하십시오.
배치 지원을 구축할지 평가하는 팀의 경우 계산은 간단합니다. 지연 허용 작업에 대한 월간 토큰 볼륨을 추정하고, 동일한 볼륨에 대한 현재 동기식 지출과 문서화된 배치 할인을 비교한 다음, 작업 제출 및 폴링 로직을 구축하는 엔지니어링 비용과 비교하십시오. 볼륨이 작으면 할인이 추가된 복잡성을 상쇄하지 못할 수 있습니다.
제한 사항
이 비교는 2026년 7월 14일 기준으로 관찰된 OpenAI와 Google의 배치 API에 대한 일반적인 메커니즘을 기반으로 합니다. 정확한 할인율, 처리 시간 길이, 모델별 가용성 및 파일 형식 요구 사항은 제공업체별로 다르며 시간이 지남에 따라 변경되므로 여기에 고정된 수치로 명시하지 않았습니다. 예산을 책정하거나 구축하기 전에 각 제공업체의 문서에서 현재 배치 가격 및 약관을 직접 확인하십시오. 이 기사는 모든 모델 제공업체의 배치 지원을 다루지는 않습니다. 계획을 세우기 전에 선택한 모델과 공급업체가 배치 엔드포인트를 게시하는지 확인하십시오.
FAQ
배치 추론은 동기식 호출보다 얼마나 저렴합니까? OpenAI와 Google 모두 표준 동기식 요금 대비 배치 처리에 대한 할인을 문서화하고 있지만, 정확한 비율은 제공업체와 시기에 따라 다릅니다. 비용을 추정하기 전에 귀하의 제공업체 및 모델에 대한 현재 가격 페이지를 확인하십시오.
배치 작업이 처리 시간 내에 완료되지 않으면 어떻게 됩니까? 제공업체 문서는 작업 상태(대기 중, 진행 중, 완료 및 실패 등)를 설명합니다. 완료 시간을 초과하는 작업을 처리하는 방법은 제공업체마다 다르고 변경될 수 있으므로 각 제공업체의 문서를 검토하십시오.
실시간 채팅 기능에 배치 추론을 사용할 수 있습니까? 아니요. 배치 작업은 수 분에서 수 시간까지 걸릴 수 있는 시간 내에 비동기적으로 처리되므로, 사용자나 시스템이 즉각적인 응답을 기다리는 워크로드에는 적합하지 않습니다. 대화형 기능에는 동기식 API를 사용하고, 지연을 허용하는 대용량 작업에 배치 엔드포인트를 예약하십시오.
배치 가격 책정이 귀하의 워크로드에 적합한지 평가 중이라면, 현재 모델별 요금과 순위를 비교한 다음, 작업 제출 및 폴링 로직에 엔지니어링 시간을 투자하기 전에 위 체크리스트에 따라 지연 허용 작업을 매핑해 보십시오.
출처
2026-07-14 기준 가격
- Gemini Batch API2026-07-14 기준 확인
- OpenAI Batch API reference2026-07-14 기준 확인
- TokenLab model rankings2026-07-14 기준 확인



