Pilih Auto, TokenLab Verified, atau Official untuk setiap permintaan, dengan harga yang ditampilkan di awal.Lihat yang baru

API Gemini 3.5 Flash untuk Agent Loop yang Cepat

·19 September 2026·7 menit baca·Diperbarui 26 September 2026·1533 tampilan
#pemrograman#api ai#TokenLab
API Gemini 3.5 Flash untuk Agent Loop yang Cepat

Mendapatkan error 404 karena string model berubah adalah cara yang buruk untuk memulai loop agen. API Gemini 3.5 Flash layak untuk diintegrasikan ke dalam loop agen yang cepat, tetapi hanya setelah Anda mengonfirmasi ID model gemini-3.5-flash yang tepat terhadap daftar model yang aktif. Google Cloud mencantumkan Gemini 3.5 Flash seharga $1,50 per 1 juta token input dan $9,00 per 1 juta token output teks pada tier Global standar, dengan harga Flex/Batch sebesar $0,75 untuk input dan $4,50 untuk output. Kami melihat jebakan yang sama pada sumbernya: ID model yang berfungsi hari ini bisa menghasilkan error 404 besok. Tabel harga daring sering kali mencampurkan harga vendor yang terkonfirmasi dengan daftar direktori yang belum diperiksa silang. Panduan ini membahas apa yang dapat diverifikasi saat ini, apa yang tidak, dan cara membangun loop agen yang tidak rusak saat ID model berubah.

Poin Penting

  • Halaman harga Agent Platform Google Cloud mencantumkan Gemini 3.5 Flash seharga $1,50/juta token input dan $9,00/juta token output pada tier Global standar, sesuai dengan daftar direktori TokenLab pada saat penyegaran.
  • String model yang tepat untuk dipin adalah gemini-3.5-flash; halaman model API Gemini Google mencantumkannya sebagai contoh model yang stabil. Tetap konfirmasikan melalui daftar model yang aktif sebelum melakukan deployment.
  • Melakukan routing melalui API terpadu TokenLab berarti Anda tidak perlu melakukan hardcode string SDK khusus penyedia; TokenLab memetakan slug model yang stabil ke pengenal dasar mana pun yang saat ini valid.
  • Harga kompetitor dalam tabel di bawah (GPT-5.5, Claude Sonnet 5, DeepSeek V4 Flash) hanya berasal dari direktori TokenLab. Tidak ada halaman harga vendor independen yang disediakan untuk model-model ini dalam ulasan ini — verifikasi langsung dengan OpenAI, Anthropic, dan DeepSeek sebelum membuat anggaran berdasarkan harga tersebut.
  • Tidak ada angka latensi yang di-benchmark (time-to-first-token, durasi loop 5 langkah penuh) yang dikutip di sini karena tidak ada yang bersumber secara independen. Instrumentasikan loop Anda sendiri dan ukur p50/p95 per langkah daripada mengutip angka pihak kedua.
  • Dalam loop agen, token output biasanya mendominasi pengeluaran — tarif output Gemini 3.5 Flash ($9,00/juta) adalah 6x lipat dari tarif inputnya ($1,50/juta), jadi membatasi max_output_tokens lebih penting daripada memangkas panjang prompt.

Snapshot Sumber

Sumber Apa yang dicakup Tanggal pengamatan
Harga Google Cloud Agent Platform Harga token Gemini 3.5 Flash standar, cached-input, dan Flex/Batch 2026-07-08
Halaman model Google Gemini API Panduan penamaan model stabil; gemini-3.5-flash terdaftar sebagai contoh model stabil 2026-07-08
Direktori model & harga TokenLab Harga per-token untuk gemini-3.5-flash dan model kompetitor di Google, Anthropic, OpenAI, dan DeepSeek 2026-07-08

Gemini Enterprise Agent Platform dari Google Cloud mencantumkan Gemini 3.5 Flash pada jadwal harganya sendiri, terpisah dari halaman harga Gemini Developer API. Tarif Global standar adalah $1,50 per 1 juta token input dan $9,00 per 1 juta token output teks. Tarif Global Flex/Batch turun menjadi $0,75 untuk input dan $4,50 untuk output. Cached input pada tier standar adalah $0,15 per 1 juta token. Ini adalah bukti langsung bahwa Gemini 3.5 Flash adalah model yang stabil dan tersedia secara umum yang diberi harga untuk beban kerja agen perusahaan di Google Cloud, bukan label placeholder atau pratinjau. Pembaca yang membandingkan biaya di seluruh artikel harus memeriksa halaman harga mana yang digunakan untuk mengambil tarif sebelum menganggap angka tersebut dapat dipertukarkan.

Perbandingan Model Dan Biaya Untuk API Gemini 3.5 Flash

Semua angka di bawah ini adalah daftar direktori TokenLab. Baris yang ditandai 'verifikasi dengan vendor' tidak memiliki kutipan independen yang disediakan untuk ulasan ini.

Model Penyedia Context window Input $/M token Output $/M token Catatan
gemini-3.5-flash Google 1.048.576 $1,50 $9,00 Direktori TokenLab; verifikasi terhadap halaman harga aktif Google
gemini-3.1-flash-lite Google n/a $0,25 $1,50 Direktori TokenLab
gemini-3-pro-image Google n/a $2,00 $12,00 Direktori TokenLab, tier gambar; jangan gunakan sebagai pengganti agen teks
gpt-5 OpenAI n/a $1,25 $10,00 Direktori TokenLab
gpt-5.5 OpenAI 1.050.000 $5,00 $30,00 Direktori TokenLab - verifikasi dengan OpenAI
claude-sonnet-5 Anthropic 1.000.000 $2,00 $10,00 Direktori TokenLab - verifikasi dengan Anthropic
claude-haiku-4-5 Anthropic n/a $1,00 $5,00 Direktori TokenLab
deepseek-v4-flash DeepSeek 1.048.576 $0,09 $0,18 Direktori TokenLab - verifikasi dengan DeepSeek

Untuk loop agen yang melakukan banyak giliran pemanggilan alat (tool-calling) kecil, tarif per-token termurah tidak selalu menjadi tarif per-tugas termurah — model yang membutuhkan lebih sedikit percobaan ulang atau jejak penalaran yang lebih pendek bisa mengalahkan harga stiker yang lebih rendah. Ukur biaya per tugas yang diselesaikan, bukan hanya biaya per token.

Langkah Implementasi Untuk API Gemini 3.5 Flash

  1. Konfirmasikan ID model sebelum menulis kode. Pada saat penyegaran, ID model yang harus dipin adalah gemini-3.5-flash, dan dokumentasi model Google mencantumkannya sebagai contoh model stabil. Tetap panggil endpoint daftar-model penyedia Anda atau periksa direktori TokenLab sebelum deployment. Ini adalah perbaikan untuk masalah 'SDK memberikan error': string tersebut tidak ada pada saat pemanggilan. Tidak ada logika percobaan ulang yang dapat memperbaiki pengenal yang salah. Sebagai contoh, sumber tersebut menjelaskan mode kegagalan itu secara langsung.

  2. Lakukan routing melalui endpoint terpadu alih-alih SDK penyedia mentah. Menggunakan TokenLab (atau gateway serupa) berarti kode aplikasi Anda merujuk pada slug yang stabil, dan gateway menyelesaikannya ke pengenal valid penyedia saat ini. Ini memisahkan loop agen Anda dari penggantian nama atau penghentian model di sisi penyedia.

  3. Bangun loop dengan langkah-langkah dan instrumentasi yang eksplisit:

# Struktur ilustratif saja - konfirmasikan endpoint/model yang tepat
# terhadap dokumentasi terkini gateway Anda sebelum melakukan deployment.
import time

def agent_loop(task):
    timings = {}

    t0 = time.time()
    plan = call_model(model="gemini-3.5-flash", prompt=build_plan_prompt(task))
    timings["plan"] = time.time() - t0

    t0 = time.time()
    context = retrieve_context(plan)
    timings["retrieve"] = time.time() - t0

    t0 = time.time()
    tool_result = call_tool(plan, context)
    timings["tool_call"] = time.time() - t0

    t0 = time.time()
    synthesis = call_model(
        model="gemini-3.5-flash",
        prompt=build_synthesis_prompt(tool_result),
        max_output_tokens=512,
    )
    timings["synthesize"] = time.time() - t0

    t0 = time.time()
    response = format_response(synthesis)
    timings["respond"] = time.time() - t0

    return response, timings

Dalam pipeline kami, kami mencatat timings per eksekusi dan menghitung p50/p95 kami sendiri di seluruh batch tugas yang representatif. Jangan mempublikasikan atau mengandalkan angka 'N detik per loop' tetap yang diambil dari lingkungan orang lain — kondisi jaringan, panjang prompt, dan beban penyedia semuanya mengubah angka-angka ini.

  1. Batasi token output dengan sengaja. Token output berharga sekitar 6x lipat dari token input untuk gemini-3.5-flash sesuai harga direktori di atas. Kami menguji perhitungan harganya. Atur max_output_tokens per langkah daripada membiarkan model berjalan lama. Ini paling penting pada langkah sintesis di mana jawaban yang bertele-tele sering terjadi.

  2. Tambahkan rantai fallback. Konfigurasikan model sekunder (misalnya, gemini-3.1-flash-lite untuk biaya, atau penyedia yang sama sekali berbeda) agar satu pemadaman atau penghentian model tidak melumpuhkan seluruh agen Anda.

Kapan Menggunakan TokenLab

  • Anda menginginkan slug model yang stabil alih-alih string penyedia yang rapuh. Pendekatan direktori TokenLab berarti kode Anda tidak perlu ditulis ulang setiap kali penyedia mengganti nama atau menghentikan model. Penutupan Veo 3.0 milik Google sendiri dijadwalkan pada 30 Juni 2026, yang menunjukkan risikonya.
  • Anda memerlukan satu tempat untuk membandingkan biaya di seluruh penyedia sebelum berkomitmen pada vendor, alih-alih memeriksa empat halaman harga terpisah secara manual setiap kali Anda mengevaluasi pertukaran model.
  • Anda menjalankan logika fallback multi-penyedia dan menginginkan bentuk request/response yang konsisten di seluruh model Google, Anthropic, OpenAI, dan DeepSeek alih-alih memelihara empat integrasi SDK yang terpisah.

Bacaan Terkait

FAQ

Apakah gemini-3.5-flash adalah ID model valid yang bisa saya panggil langsung ke SDK Google?

Jangan berasumsi demikian. Konfirmasikan terhadap daftar model Google saat ini sebelum melakukan deployment — string ID model berubah, dan status pratinjau/GA bergeser seiring waktu. Jika Anda melakukan routing melalui TokenLab, gateway menangani pemetaan ini untuk Anda.

Dari mana asal harga kompetitor dalam tabel perbandingan?

Itu adalah daftar direktori TokenLab. Hanya harga video Veo dalam artikel ini yang merujuk pada sumber Google yang bertanggal independen (diamati 2026-07-08). Harga GPT-5.5, Claude Sonnet 5, dan DeepSeek V4 Flash di sini tidak memiliki kutipan independen yang disediakan — verifikasi dengan setiap vendor sebelum menggunakan angka-angka ini dalam estimasi biaya yang menghadap pelanggan.

Seberapa cepat loop agen Gemini 3.5 Flash 5 langkah?

Tidak ada angka benchmark yang disertakan di sini karena tidak ada yang bersumber secara independen untuk artikel ini. Instrumentasikan loop Anda sendiri (lihat contoh kode di atas) dan ukur latensi p50/p95 aktual di lingkungan Anda daripada mengandalkan angka pihak kedua.

Apa yang terjadi jika model yang saya gunakan dihentikan di tengah proyek?

Ini adalah skenario yang tepat yang diilustrasikan oleh penutupan Veo 3.0 Google (30 Juni 2026). Bangun rantai fallback dan, jika memungkinkan, lakukan routing melalui gateway yang memelihara slug model yang diperbarui sehingga penghentian tidak memerlukan penulisan ulang kode.

Buat kunci API TokenLab untuk membandingkan ID model saat ini sebelum Anda melakukan deployment.

Sumber

Harga diamati pada 2026-07-08

Model terkait

Model yang baru dirilis

Bangun dengan model dalam panduan ini

Bandingkan harga, uji rute, dan ubah riset menjadi panggilan API yang berjalan.