Google: Gemini 3.1 Flash-Lite
gemini-3.1-flash-lite- Masukan / Keluaran-50%
- $0.25 / $1.50$0.125 / $0.75
- Konteks
- 1M
- Dirilis
- 7 Mei 2026
- Output maksimal
- 64K
- Modalitas
- VisiObrolan
- Kapabilitas
- Penggunaan toolCache Prompt
Tentang Gemini 3.1 Flash-Lite
Gemini 3.1 Flash-Lite adalah model latensi rendah dan berbiaya rendah dari Google dalam lini Gemini 3.1, yang dibangun untuk beban kerja multimodal dan agen bervolume tinggi. Google menggambarkannya sebagai performa kelas perbatasan yang menyaingi model yang lebih besar dengan sebagian kecil dari biayanya. Model ini membaca teks dan gambar, memanggil alat, mengembalikan JSON terikat skema, dan mendukung penembolokan konteks, serta berada di bawah tingkat Flash dalam hal kemampuan.
Kelebihan
- Waktu respons yang singkat membuatnya cocok untuk fitur interaktif di mana setiap panggilan harus kembali dengan cepat.
- Gambar dan teks dimasukkan ke dalam permintaan yang sama, yang cocok untuk pemrosesan kuitansi, formulir, dan tangkapan layar.
- Output JSON terikat skema menghilangkan kebutuhan untuk penguraian teks bebas yang rentan kesalahan.
- Pemanggilan alat dan dukungan penembolokan konteks memungkinkan langkah-langkah agen yang berulang dan serupa dalam skala besar.
Kapan harus beralih
- Untuk agen pengodean yang panjang dan melibatkan banyak langkah, model Flash dan Pro bekerja lebih baik daripada model Lite.
- Ini bukan model yang mengutamakan penalaran; matematika sulit atau perencanaan mendalam lebih baik dikirim ke Gemini 3.1 Pro.
Memulai
Buat API key
Buat kunci di Console, gunakan untuk semua model di platform.
Kirim permintaan pertama Anda
Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.
Teks ke teksGemini APIPOST/v1beta/models/gemini-3.1-flash-lite:generateContentFormat API:curl "https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent" \ -H "Content-Type: application/json" \ -H "x-goog-api-key: sk-xxx" \ -d '{ "contents": [ {"role": "user", "parts": [{"text": "Hello!"}]} ] }'
Penetapan Harga
Harga Verified berlaku untuk Verified yang lebih murah di sebagian besar model. Harga Official adalah harga resmi dari pembuat model dan berlaku untuk rute Official yang lebih andal. Auto menagihkan biaya berdasarkan rute yang menyelesaikan permintaan.
Spesifikasi default
per 1M token- Harga Official
- Masukan $0.25 / Keluaran $1.50 / Pembacaan cache $0.025
- Harga Verified
- Masukan $0.125 / Keluaran $0.75 / Pembacaan cache $0.0125
- Diskon
- -50%
Pembacaan cache
- Harga Official
- $0.025
- Harga Verified
- $0.0125
- Diskon
- -50%
Biaya dikenakan per panggilan, hanya saat model menggunakan alat tersebut.
Pencarian web
- Harga Official
- $0.014/pencarian
- Harga Verified
- $0.007/pencarian
- Diskon
- -50%
| Harga Officialper 1M token | Harga Verifiedper 1M token | Diskon | |
|---|---|---|---|
| Spesifikasi default | Masukan $0.25 / Keluaran $1.50 / Pembacaan cache $0.025 | Masukan $0.125 / Keluaran $0.75 / Pembacaan cache $0.0125 | -50% |
| Harga cache prompt | |||
| Pembacaan cache | $0.025 | $0.0125 | -50% |
| Biaya alatBiaya dikenakan per panggilan, hanya saat model menggunakan alat tersebut. | |||
| Pencarian web | $0.014/pencarian | $0.007/pencarian | -50% |
Penggunaan & aktivitas
Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.
Penggunaan & ketersediaan
24 jam terakhir- Permintaan
- Tingkat keberhasilan
- Latensi P95
- Total token
- Tingkat keberhasilan 30 hari
- 100,0%
- Permintaan 30 hari
- 40K+
- Aktivitas terakhir
- 18 menit yang lalu
Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.
Buka di Console
Buka Gemini 3.1 Flash-Lite di Console dengan prompt siap diedit atau dikirim.
Bantu saya mencoba gemini-3.1-flash-lite dengan pesan singkat di /v1beta/models/gemini-3.1-flash-lite:generateContent. Tampilkan balasan, latensi, dan biayanya.
Skenario penggunaan
Cocok untuk- Visi
Ekstraksi massal
Tarik bidang dari ribuan faktur atau formulir dan tulis setiap hasil sebagai objek JSON yang tervalidasi.
Moderasi dan penandaan konten
Labeli unggahan dan komentar pengguna berdasarkan kebijakan tetap dengan satu baris pembenaran.
Lapisan perutean
Tentukan model spesialis atau alat mana yang harus menerima permintaan, lalu teruskan.
Asisten waktu nyata
Dukung pelengkapan otomatis, balasan cepat, atau giliran asisten suara di mana waktu tunggu yang terlihat akan merusak pengalaman pengguna.
Contoh prompt
Ekstrak vendor, tanggal, total, dan mata uang dari gambar faktur ini dan kembalikan sebagai JSON.
Tandai komentar di bawah sebagai spam, pelecehan, pertanyaan, atau pujian dan jelaskan pilihannya dalam satu kalimat.
Berdasarkan pesan pengguna ini, pilih salah satu dari: search_docs, create_ticket, answer_directly. Balas hanya dengan nama alat.
Model ini memiliki harga kondisional. Total token bulanan saja tidak dapat menghasilkan estimasi yang andal; gunakan harga detail untuk spesifikasi permintaan, cache, dan jendela waktu yang berlaku.
FAQ
Apa kegunaan terbaik Gemini 3.1 Flash-Lite?
Pekerjaan bervolume tinggi dan sensitif terhadap latensi seperti ekstraksi, klasifikasi, penandaan, perutean, dan jawaban multimodal cepat. Model ini menukar kedalaman penalaran demi kecepatan dan beban yang lebih ringan per panggilan.
Apakah model ini menerima gambar?
Ya. Teks dan gambar dapat dicampur dalam satu permintaan, sehingga model ini dapat membaca dokumen, tangkapan layar, dan foto. Jawabannya kembali sebagai teks atau sebagai JSON yang sesuai dengan skema Anda.
Bisakah model ini memanggil alat?
Ya. Pemanggilan fungsi didukung, yang memungkinkannya bertindak sebagai agen tahap pertama yang memilih alat untuk permintaan sederhana atau meneruskan kasus sulit ke model yang lebih besar.
Apa bedanya dengan Gemini 3.5 Flash-Lite?
3.5 Flash-Lite adalah generasi yang lebih baru dan yang kini disarankan Google untuk proyek baru; 3.1 Flash-Lite adalah model Lite yang lebih lama, namun tetap stabil. Uji prompt Anda sendiri pada keduanya sebelum memindahkan trafik.
Berapa biaya Gemini 3.1 Flash-Lite?
Di TokenLab, Gemini 3.1 Flash-Lite dikenakan Masukan $0.125 / Keluaran $0.75 per 1M token. Tabel harga di atas menampilkan rincian lengkap. Tarif bergantung pada unit penagihan, spesifikasi, dan penggunaan. Bandingkan kondisi yang sama dalam harga detail model; satu tarif tidak menentukan total biaya.
Berapa batas konteks dan output Gemini 3.1 Flash-Lite?
Gemini 3.1 Flash-Lite mendukung hingga 1.048.576 token konteks dan menghasilkan hingga 65.536 token per respons.
Endpoint mana yang harus digunakan Gemini 3.1 Flash-Lite?
Pakai https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent sebagai default untuk Gemini 3.1 Flash-Lite. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.
Operasi apa saja yang didukung Gemini 3.1 Flash-Lite?
Gemini 3.1 Flash-Lite mendukung Teks ke teks. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.
Bandingkan Gemini 3.1 Flash-Lite
Panduan menggunakan Gemini 3.1 Flash-Lite
Sumber
Ditinjau 2 Okt 2026