Mendapatkan error 404 karena string model berubah adalah cara yang buruk untuk memulai loop agen. API Gemini 3.5 Flash layak untuk diintegrasikan ke dalam loop agen yang cepat, tetapi hanya setelah Anda mengonfirmasi ID model gemini-3.5-flash yang tepat terhadap daftar model yang aktif. Google Cloud mencantumkan Gemini 3.5 Flash seharga $1,50 per 1 juta token input dan $9,00 per 1 juta token output teks pada tier Global standar, dengan harga Flex/Batch sebesar $0,75 untuk input dan $4,50 untuk output. Kami melihat jebakan yang sama pada sumbernya: ID model yang berfungsi hari ini bisa menghasilkan error 404 besok. Tabel harga daring sering kali mencampurkan harga vendor yang terkonfirmasi dengan daftar direktori yang belum diperiksa silang. Panduan ini membahas apa yang dapat diverifikasi saat ini, apa yang tidak, dan cara membangun loop agen yang tidak rusak saat ID model berubah.
Poin Penting
- Halaman harga Agent Platform Google Cloud mencantumkan Gemini 3.5 Flash seharga $1,50/juta token input dan $9,00/juta token output pada tier Global standar, sesuai dengan daftar direktori TokenLab pada saat penyegaran.
- String model yang tepat untuk dipin adalah
gemini-3.5-flash; halaman model API Gemini Google mencantumkannya sebagai contoh model yang stabil. Tetap konfirmasikan melalui daftar model yang aktif sebelum melakukan deployment. - Melakukan routing melalui API terpadu TokenLab berarti Anda tidak perlu melakukan hardcode string SDK khusus penyedia; TokenLab memetakan slug model yang stabil ke pengenal dasar mana pun yang saat ini valid.
- Harga kompetitor dalam tabel di bawah (GPT-5.5, Claude Sonnet 5, DeepSeek V4 Flash) hanya berasal dari direktori TokenLab. Tidak ada halaman harga vendor independen yang disediakan untuk model-model ini dalam ulasan ini — verifikasi langsung dengan OpenAI, Anthropic, dan DeepSeek sebelum membuat anggaran berdasarkan harga tersebut.
- Tidak ada angka latensi yang di-benchmark (time-to-first-token, durasi loop 5 langkah penuh) yang dikutip di sini karena tidak ada yang bersumber secara independen. Instrumentasikan loop Anda sendiri dan ukur p50/p95 per langkah daripada mengutip angka pihak kedua.
- Dalam loop agen, token output biasanya mendominasi pengeluaran — tarif output Gemini 3.5 Flash ($9,00/juta) adalah 6x lipat dari tarif inputnya ($1,50/juta), jadi membatasi
max_output_tokenslebih penting daripada memangkas panjang prompt.
Snapshot Sumber
| Sumber | Apa yang dicakup | Tanggal pengamatan |
|---|---|---|
| Harga Google Cloud Agent Platform | Harga token Gemini 3.5 Flash standar, cached-input, dan Flex/Batch | 2026-07-08 |
| Halaman model Google Gemini API | Panduan penamaan model stabil; gemini-3.5-flash terdaftar sebagai contoh model stabil |
2026-07-08 |
| Direktori model & harga TokenLab | Harga per-token untuk gemini-3.5-flash dan model kompetitor di Google, Anthropic, OpenAI, dan DeepSeek |
2026-07-08 |
Gemini Enterprise Agent Platform dari Google Cloud mencantumkan Gemini 3.5 Flash pada jadwal harganya sendiri, terpisah dari halaman harga Gemini Developer API. Tarif Global standar adalah $1,50 per 1 juta token input dan $9,00 per 1 juta token output teks. Tarif Global Flex/Batch turun menjadi $0,75 untuk input dan $4,50 untuk output. Cached input pada tier standar adalah $0,15 per 1 juta token. Ini adalah bukti langsung bahwa Gemini 3.5 Flash adalah model yang stabil dan tersedia secara umum yang diberi harga untuk beban kerja agen perusahaan di Google Cloud, bukan label placeholder atau pratinjau. Pembaca yang membandingkan biaya di seluruh artikel harus memeriksa halaman harga mana yang digunakan untuk mengambil tarif sebelum menganggap angka tersebut dapat dipertukarkan.
Perbandingan Model Dan Biaya Untuk API Gemini 3.5 Flash
Semua angka di bawah ini adalah daftar direktori TokenLab. Baris yang ditandai 'verifikasi dengan vendor' tidak memiliki kutipan independen yang disediakan untuk ulasan ini.
| Model | Penyedia | Context window | Input $/M token | Output $/M token | Catatan |
|---|---|---|---|---|---|
| gemini-3.5-flash | 1.048.576 | $1,50 | $9,00 | Direktori TokenLab; verifikasi terhadap halaman harga aktif Google | |
| gemini-3.1-flash-lite | n/a | $0,25 | $1,50 | Direktori TokenLab | |
| gemini-3-pro-image | n/a | $2,00 | $12,00 | Direktori TokenLab, tier gambar; jangan gunakan sebagai pengganti agen teks | |
| gpt-5 | OpenAI | n/a | $1,25 | $10,00 | Direktori TokenLab |
| gpt-5.5 | OpenAI | 1.050.000 | $5,00 | $30,00 | Direktori TokenLab - verifikasi dengan OpenAI |
| claude-sonnet-5 | Anthropic | 1.000.000 | $2,00 | $10,00 | Direktori TokenLab - verifikasi dengan Anthropic |
| claude-haiku-4-5 | Anthropic | n/a | $1,00 | $5,00 | Direktori TokenLab |
| deepseek-v4-flash | DeepSeek | 1.048.576 | $0,09 | $0,18 | Direktori TokenLab - verifikasi dengan DeepSeek |
Untuk loop agen yang melakukan banyak giliran pemanggilan alat (tool-calling) kecil, tarif per-token termurah tidak selalu menjadi tarif per-tugas termurah — model yang membutuhkan lebih sedikit percobaan ulang atau jejak penalaran yang lebih pendek bisa mengalahkan harga stiker yang lebih rendah. Ukur biaya per tugas yang diselesaikan, bukan hanya biaya per token.
Langkah Implementasi Untuk API Gemini 3.5 Flash
Konfirmasikan ID model sebelum menulis kode. Pada saat penyegaran, ID model yang harus dipin adalah
gemini-3.5-flash, dan dokumentasi model Google mencantumkannya sebagai contoh model stabil. Tetap panggil endpoint daftar-model penyedia Anda atau periksa direktori TokenLab sebelum deployment. Ini adalah perbaikan untuk masalah 'SDK memberikan error': string tersebut tidak ada pada saat pemanggilan. Tidak ada logika percobaan ulang yang dapat memperbaiki pengenal yang salah. Sebagai contoh, sumber tersebut menjelaskan mode kegagalan itu secara langsung.Lakukan routing melalui endpoint terpadu alih-alih SDK penyedia mentah. Menggunakan TokenLab (atau gateway serupa) berarti kode aplikasi Anda merujuk pada slug yang stabil, dan gateway menyelesaikannya ke pengenal valid penyedia saat ini. Ini memisahkan loop agen Anda dari penggantian nama atau penghentian model di sisi penyedia.
Bangun loop dengan langkah-langkah dan instrumentasi yang eksplisit:
# Struktur ilustratif saja - konfirmasikan endpoint/model yang tepat
# terhadap dokumentasi terkini gateway Anda sebelum melakukan deployment.
import time
def agent_loop(task):
timings = {}
t0 = time.time()
plan = call_model(model="gemini-3.5-flash", prompt=build_plan_prompt(task))
timings["plan"] = time.time() - t0
t0 = time.time()
context = retrieve_context(plan)
timings["retrieve"] = time.time() - t0
t0 = time.time()
tool_result = call_tool(plan, context)
timings["tool_call"] = time.time() - t0
t0 = time.time()
synthesis = call_model(
model="gemini-3.5-flash",
prompt=build_synthesis_prompt(tool_result),
max_output_tokens=512,
)
timings["synthesize"] = time.time() - t0
t0 = time.time()
response = format_response(synthesis)
timings["respond"] = time.time() - t0
return response, timings
Dalam pipeline kami, kami mencatat timings per eksekusi dan menghitung p50/p95 kami sendiri di seluruh batch tugas yang representatif. Jangan mempublikasikan atau mengandalkan angka 'N detik per loop' tetap yang diambil dari lingkungan orang lain — kondisi jaringan, panjang prompt, dan beban penyedia semuanya mengubah angka-angka ini.
Batasi token output dengan sengaja. Token output berharga sekitar 6x lipat dari token input untuk
gemini-3.5-flashsesuai harga direktori di atas. Kami menguji perhitungan harganya. Aturmax_output_tokensper langkah daripada membiarkan model berjalan lama. Ini paling penting pada langkah sintesis di mana jawaban yang bertele-tele sering terjadi.Tambahkan rantai fallback. Konfigurasikan model sekunder (misalnya,
gemini-3.1-flash-liteuntuk biaya, atau penyedia yang sama sekali berbeda) agar satu pemadaman atau penghentian model tidak melumpuhkan seluruh agen Anda.
Kapan Menggunakan TokenLab
- Anda menginginkan slug model yang stabil alih-alih string penyedia yang rapuh. Pendekatan direktori TokenLab berarti kode Anda tidak perlu ditulis ulang setiap kali penyedia mengganti nama atau menghentikan model. Penutupan Veo 3.0 milik Google sendiri dijadwalkan pada 30 Juni 2026, yang menunjukkan risikonya.
- Anda memerlukan satu tempat untuk membandingkan biaya di seluruh penyedia sebelum berkomitmen pada vendor, alih-alih memeriksa empat halaman harga terpisah secara manual setiap kali Anda mengevaluasi pertukaran model.
- Anda menjalankan logika fallback multi-penyedia dan menginginkan bentuk request/response yang konsisten di seluruh model Google, Anthropic, OpenAI, dan DeepSeek alih-alih memelihara empat integrasi SDK yang terpisah.
Bacaan Terkait
FAQ
Apakah gemini-3.5-flash adalah ID model valid yang bisa saya panggil langsung ke SDK Google?
Jangan berasumsi demikian. Konfirmasikan terhadap daftar model Google saat ini sebelum melakukan deployment — string ID model berubah, dan status pratinjau/GA bergeser seiring waktu. Jika Anda melakukan routing melalui TokenLab, gateway menangani pemetaan ini untuk Anda.
Dari mana asal harga kompetitor dalam tabel perbandingan?
Itu adalah daftar direktori TokenLab. Hanya harga video Veo dalam artikel ini yang merujuk pada sumber Google yang bertanggal independen (diamati 2026-07-08). Harga GPT-5.5, Claude Sonnet 5, dan DeepSeek V4 Flash di sini tidak memiliki kutipan independen yang disediakan — verifikasi dengan setiap vendor sebelum menggunakan angka-angka ini dalam estimasi biaya yang menghadap pelanggan.
Seberapa cepat loop agen Gemini 3.5 Flash 5 langkah?
Tidak ada angka benchmark yang disertakan di sini karena tidak ada yang bersumber secara independen untuk artikel ini. Instrumentasikan loop Anda sendiri (lihat contoh kode di atas) dan ukur latensi p50/p95 aktual di lingkungan Anda daripada mengandalkan angka pihak kedua.
Apa yang terjadi jika model yang saya gunakan dihentikan di tengah proyek?
Ini adalah skenario yang tepat yang diilustrasikan oleh penutupan Veo 3.0 Google (30 Juni 2026). Bangun rantai fallback dan, jika memungkinkan, lakukan routing melalui gateway yang memelihara slug model yang diperbarui sehingga penghentian tidak memerlukan penulisan ulang kode.
Buat kunci API TokenLab untuk membandingkan ID model saat ini sebelum Anda melakukan deployment.
Sumber
Harga diamati pada 2026-07-08
- Google AI Gemini API pricingDiamati pada 2026-07-08
- Google Cloud Agent Platform pricingDiamati pada 2026-07-08
- Google Gemini API modelsDiamati pada 2026-07-08
- TokenLab model directoryDiamati pada 2026-07-07



