Harga inferensi batch bekerja dengan menukar latensi respons dengan tarif per-token yang lebih rendah: Anda mengirimkan pekerjaan, penyedia memprosesnya dalam jendela waktu yang ditentukan (biasanya hingga 24 jam), dan Anda membayar lebih sedikit daripada panggilan sinkron waktu nyata. Apakah pertukaran tersebut sepadan atau tidak, sepenuhnya bergantung pada apakah beban kerja Anda dapat menoleransi waktu tunggu tersebut.
Artikel ini membandingkan inferensi batch (asinkron) dengan panggilan API sinkron standar, berdasarkan dokumentasi API batch yang diterbitkan oleh OpenAI dan Google, serta menyusun kerangka kerja keputusan tentang kapan jalur asinkron benar-benar menghemat biaya untuk produk Anda.
Poin Penting
- OpenAI dan Gemini sama-sama menerbitkan API batch yang menerima pekerjaan untuk pemrosesan asinkron dengan tarif diskon dibandingkan panggilan sinkron; konfirmasikan persentase diskon yang tepat saat ini di halaman harga masing-masing penyedia sebelum membuat anggaran, karena tarif dapat berubah.
- Inferensi batch cocok untuk beban kerja yang menoleransi jendela penyelesaian alih-alih membutuhkan respons segera: klasifikasi massal, pembuatan embedding, evaluasi offline, pelabelan dataset, dan pekerjaan backfill.
- Obrolan waktu nyata, agen pengodean, dan fitur produk interaktif umumnya tidak cocok dengan harga batch, karena jendela pemrosesan membuatnya tidak dapat digunakan untuk interaksi pengguna secara langsung.
- Penghematan kumulatif terbesar biasanya berasal dari penggabungan diskon batch dengan pemilihan model dan upaya efisiensi prompt; lihat /models/rankings dan panduan pengurangan biaya API AI untuk tuas lainnya.
Apa Arti Sebenarnya dari Inferensi Batch
Panggilan API sinkron mengembalikan respons segera setelah model selesai menghasilkannya, biasanya dalam hitungan detik. Anda membayar tarif per-token yang terikat pada kesegeraan tersebut. Inferensi batch membalikkan model tersebut: alih-alih pertukaran permintaan-respons tunggal, Anda mengirimkan file atau daftar permintaan sebagai sebuah pekerjaan. Penyedia mengantrekan pekerjaan tersebut, memprosesnya selama jendela waktu yang mereka kendalikan, dan membuat hasilnya tersedia untuk Anda ambil setelah selesai.
Ini bukan teknik inferensi baru di dalam model. Ini adalah kontrak komersial dan operasional yang berbeda. Penyedia mendapatkan kesempatan untuk menjadwalkan beban kerja Anda terhadap kapasitas cadangan atau di luar jam sibuk, dan sebagai gantinya mengenakan biaya per token yang lebih rendah daripada untuk permintaan yang harus dilayani secara instan.
Baik OpenAI maupun Google mendokumentasikan pola ini untuk API mereka masing-masing:
- Referensi Batch API OpenAI menjelaskan cara membuat objek batch dari file permintaan yang diunggah, melacak statusnya, dan mengambil output setelah pekerjaan selesai (platform.openai.com/docs/api-reference/batch/object).
- Dokumentasi Gemini Batch API Google menjelaskan model yang sebanding: kirimkan batch permintaan, pekerjaan berjalan secara asinkron, dan hasil diambil setelah pemrosesan (ai.google.dev/gemini-api/docs/batch-api).
Mekanismenya sedikit berbeda antar penyedia (pengiriman berbasis file, objek pekerjaan, polling status, pengambilan output), tetapi bentuk dasarnya konsisten: kirim sekarang, ambil nanti, bayar lebih sedikit per token daripada ekuivalen sinkronnya. Periksa dokumentasi terbaru setiap penyedia untuk jendela pemrosesan dan tingkat diskon yang tepat yang berlaku untuk akun dan model Anda, karena detail ini spesifik untuk penyedia dan dapat berubah sewaktu-waktu.
Cara Kerja Dua API Batch yang Didokumentasikan
Pada tingkat mekanis, kedua penyedia mengikuti siklus hidup yang serupa:
- Siapkan permintaan. Anda mengumpulkan permintaan inferensi individu yang ingin diproses, biasanya diformat sebagai file (OpenAI menerima file permintaan yang diberi kunci oleh ID kustom; Gemini menerima batch permintaan terstruktur).
- Kirim pekerjaan. Anda membuat objek batch atau sumber daya pekerjaan yang mereferensikan input yang Anda unggah.
- Polling atau tunggu penyelesaian. Pekerjaan bergerak melalui status (diantrekan, sedang diproses, selesai, atau gagal) hingga penyedia selesai memproses dalam jendela waktu yang didokumentasikan.
- Ambil output. Setelah selesai, Anda mengunduh atau mengambil file output atau kumpulan hasil, mencocokkan setiap respons kembali ke permintaan aslinya berdasarkan ID.
Tidak ada penyedia yang memproses pekerjaan batch secara instan. Itulah inti dari model harga ini: pekerjaan berjalan sesuai jadwal penyedia, bukan jadwal Anda, dan Anda menerima penundaan terbatas sebagai ganti tarif yang lebih rendah. Jika produk Anda tidak dapat menoleransi penundaan tersebut, harga batch tidak tersedia untuk Anda terlepas dari seberapa besar penghematan yang Anda dapatkan di atas kertas.
Kapan Harga Batch Menghemat Uang: Daftar Periksa Keputusan
Gunakan daftar periksa ini sebelum merutekan beban kerja ke endpoint batch:
- Apakah beban kerja memiliki bentuk non-interaktif yang alami? Klasifikasi melewati dataset, pembuatan embedding untuk korpus dokumen, penyapuan moderasi konten, atau pekerjaan peringkasan malam hari, semuanya cocok.
- Bisakah produk Anda menoleransi jendela pemrosesan yang didokumentasikan? Jika pengguna atau sistem hilir membutuhkan hasil dalam hitungan detik atau menit, batch tidak cocok.
- Apakah volumenya cukup besar untuk diperhitungkan? Diskon batch berlaku per token, jadi penghematan absolut berskala dengan volume. Segelintir permintaan tidak akan mengubah tagihan Anda secara berarti.
- Apakah tugas tersebut idempoten atau dapat dicoba ulang dengan aman? Karena pekerjaan batch berjalan secara asinkron dan dapat gagal sebagian, pipeline Anda perlu menangani pengiriman ulang atau penyelesaian sebagian tanpa merusak status hilir.
- Apakah lapisan orkestrasi Anda sudah mendukung polling pekerjaan asinkron? Jika Anda membangun pola ini untuk pertama kalinya, anggarkan waktu rekayasa untuk pengiriman pekerjaan, polling status, dan rekonsiliasi output.
| Dimensi | API Sinkron | API Batch (asinkron) |
|---|---|---|
| Latensi | Detik, biasanya | Menit hingga jam, dibatasi oleh jendela yang didokumentasikan penyedia |
| Harga | Tarif per-token standar | Tarif per-token diskon dibandingkan sinkron, per dokumentasi penyedia |
| Kecocokan terbaik | Obrolan, agen, fitur produk langsung | Klasifikasi massal, embedding, evaluasi offline, backfill |
| Penanganan kegagalan | Kesalahan segera pada panggilan | Status tingkat pekerjaan; kegagalan sebagian mungkin terjadi dalam batch |
| Overhead rekayasa | Permintaan-respons sederhana | Memerlukan logika pengiriman pekerjaan, polling, dan pengambilan output |
| Pengurutan output | Cocok dengan urutan panggilan | Dicocokkan dengan ID permintaan kustom, bukan urutan panggilan |
Kapan Harga Batch Tidak Cocok
Inferensi batch tidak cocok untuk apa pun di mana seseorang atau sistem hilir menunggu respons. Ini termasuk:
- Agen percakapan dan produk obrolan. Pengguna mengharapkan balasan dalam hitungan detik, bukan setelah jendela pemrosesan.
- Asisten pengodean dan alur kerja pengodean agen. Alat yang dibangun di sekitar model seperti Claude Sonnet 5 atau Kimi K2.7 Code bergantung pada loop umpan balik yang ketat antara pengembang dan model; pembatchan akan merusak interaksi sepenuhnya.
- Pembuatan konten waktu nyata untuk fitur yang menghadap pengguna, termasuk pembuatan gambar atau video sesuai permintaan melalui API seperti Nano Banana Pro atau Veo 3, di mana pengguna melihat indikator kemajuan.
- Apa pun dengan persyaratan latensi tingkat layanan, meskipun persyaratan tersebut longgar (katakanlah, di bawah satu menit). Jendela batch biasanya diukur dalam jam, bukan detik.
Jika bagian dari pipeline Anda bersifat waktu nyata dan sebagian tidak, bagi pekerjaannya. Rutekan bagian interaktif melalui API sinkron dan dorong bagian massal yang toleran terhadap penundaan (pengindeksan ulang malam hari, pelabelan ulang dataset, evaluasi) ke endpoint batch.
Bentuk Permintaan Praktis
Skema yang tepat berbeda antara objek batch OpenAI dan API batch Gemini, jadi anggaplah berikut ini sebagai bentuk ilustratif daripada salinan literal dari format permintaan penyedia mana pun. Konfirmasikan nama bidang dan endpoint yang tepat terhadap dokumentasi saat ini sebelum Anda menerapkan ini.
# 1. Siapkan file permintaan, masing-masing dengan ID kustom
{"custom_id": "req-001", "method": "POST", "url": "/v1/chat/completions",
"body": {"model": "your-selected-model", "messages": [{"role": "user", "content": "Classify this ticket."}]}}
{"custom_id": "req-002", "method": "POST", "url": "/v1/chat/completions",
"body": {"model": "your-selected-model", "messages": [{"role": "user", "content": "Classify this ticket."}]}}
# 2. Kirim pekerjaan batch
POST /v1/batches
{
"input_file_id": "file-abc123",
"endpoint": "/v1/chat/completions",
"completion_window": "24h"
}
# 3. Polling status pekerjaan
GET /v1/batches/{batch_id}
# mengembalikan status: queued | in_progress | completed | failed
# 4. Ambil output setelah selesai
GET /v1/files/{output_file_id}/content
# cocokkan setiap respons kembali ke permintaannya berdasarkan custom_id
Pola rekayasa intinya sama terlepas dari penyedianya: buat file permintaan Anda dengan ID yang stabil, kirim pekerjaan, polling untuk penyelesaian, dan rekonsiliasi output terhadap daftar permintaan asli Anda. Bangun logika coba ulang di sekitar kegagalan sebagian pada tingkat pekerjaan, karena batch dapat selesai dengan beberapa permintaan individu gagal meskipun pekerjaan itu sendiri berhasil.
Menggabungkan Diskon Batch dengan Pemilihan Model
Harga batch adalah salah satu tuas. Ini digabungkan dengan, alih-alih menggantikan, keputusan tingkat model dan prompt yang dibahas dalam tolok ukur perutean model AI dan panduan pengurangan biaya API AI. Beban kerja yang memenuhi syarat untuk batch dan dilayani oleh model berbiaya lebih rendah, seperti DeepSeek V4 Flash, GLM-5.2, atau Gemini 3.5 Flash untuk tugas yang ramah perutean, biasanya akan melihat penghematan absolut yang lebih besar daripada menerapkan salah satu tuas saja. Sebelum melakukan pekerjaan massal besar ke satu model dan tingkat harga, periksa harga dan pemosisian per-model saat ini di /models/rankings, karena harga relatif antara model frontier dan model berbiaya rendah bergeser saat penyedia memperbarui jajaran produk mereka.
Bagi tim yang mengevaluasi apakah akan membangun dukungan batch atau tidak, perhitungannya mudah: estimasikan volume token bulanan Anda untuk tugas yang toleran terhadap penundaan, bandingkan diskon batch yang didokumentasikan terhadap pengeluaran sinkron Anda saat ini untuk volume yang sama, dan timbang itu terhadap biaya rekayasa untuk membangun logika pengiriman pekerjaan dan polling. Jika volumenya kecil, diskon mungkin tidak menutupi kompleksitas tambahan.
Batasan
Perbandingan ini didasarkan pada mekanisme umum yang didokumentasikan oleh OpenAI dan Google untuk API batch mereka sebagaimana diamati pada 2026-07-14. Persentase diskon yang tepat, panjang jendela pemrosesan, ketersediaan per-model, dan persyaratan format file bersifat spesifik untuk penyedia, berubah seiring waktu, dan tidak dinyatakan kembali di sini sebagai angka tetap. Verifikasi harga dan ketentuan batch saat ini langsung terhadap dokumentasi masing-masing penyedia sebelum membuat anggaran atau membangun. Artikel ini juga tidak mencakup dukungan batch dari setiap penyedia model; periksa apakah model dan vendor pilihan Anda menerbitkan endpoint batch sama sekali sebelum merencanakan di sekitarnya.
FAQ
Seberapa murah inferensi batch dibandingkan panggilan sinkron? Baik OpenAI maupun Google mendokumentasikan diskon untuk pemrosesan batch relatif terhadap tarif sinkron standar mereka, tetapi persentase yang tepat bersifat spesifik untuk penyedia dan waktu. Periksa halaman harga saat ini untuk penyedia dan model Anda sebelum mengestimasi penghematan.
Apa yang terjadi jika pekerjaan batch saya tidak selesai dalam jendela pemrosesan? Dokumentasi penyedia menjelaskan status pekerjaan (seperti diantrekan, sedang diproses, selesai, dan gagal). Tinjau dokumentasi masing-masing penyedia tentang bagaimana mereka menangani pekerjaan yang melebihi jendela penyelesaian, karena perilaku dapat berbeda menurut penyedia dan dapat berubah.
Bisakah saya menggunakan inferensi batch untuk fitur obrolan waktu nyata? Tidak. Pekerjaan batch diproses secara asinkron dalam jendela yang dapat berlangsung dari menit hingga berjam-jam, yang membuatnya tidak cocok untuk beban kerja apa pun di mana pengguna atau sistem menunggu respons segera. Gunakan API sinkron untuk fitur interaktif dan cadangkan endpoint batch untuk tugas bervolume tinggi yang toleran terhadap penundaan.
Jika Anda mengevaluasi apakah harga batch sesuai dengan beban kerja Anda, bandingkan tarif dan peringkat per-model saat ini, lalu mulailah dengan memetakan pekerjaan Anda yang toleran terhadap penundaan terhadap daftar periksa di atas sebelum Anda berkomitmen pada waktu rekayasa untuk logika pengiriman pekerjaan dan polling.
Sumber
Harga diamati pada 2026-07-14
- Gemini Batch APIDiamati pada 2026-07-14
- OpenAI Batch API referenceDiamati pada 2026-07-14
- TokenLab model rankingsDiamati pada 2026-07-14



