Pilih Auto, TokenLab Verified, atau Official untuk setiap permintaan, dengan harga yang ditampilkan di awal.Lihat yang baru

Google: Gemini 3.1 Flash-Lite

Model Gemini latensi rendah untuk beban kerja multimodal dan agen bervolume tinggi
Bandingkan model
gemini-3.1-flash-lite
TersediaGoogleObrolanInput cache 90% lebih hemat
Masukan / Keluaran-50%
$0.25 / $1.50$0.125 / $0.75
Konteks
1M
Dirilis
7 Mei 2026
Output maksimal
64K
Modalitas
VisiObrolan
Kapabilitas
Penggunaan toolCache Prompt

Tentang Gemini 3.1 Flash-Lite

Gemini 3.1 Flash-Lite adalah model latensi rendah dan berbiaya rendah dari Google dalam lini Gemini 3.1, yang dibangun untuk beban kerja multimodal dan agen bervolume tinggi. Google menggambarkannya sebagai performa kelas perbatasan yang menyaingi model yang lebih besar dengan sebagian kecil dari biayanya. Model ini membaca teks dan gambar, memanggil alat, mengembalikan JSON terikat skema, dan mendukung penembolokan konteks, serta berada di bawah tingkat Flash dalam hal kemampuan.

Kelebihan

  • Waktu respons yang singkat membuatnya cocok untuk fitur interaktif di mana setiap panggilan harus kembali dengan cepat.
  • Gambar dan teks dimasukkan ke dalam permintaan yang sama, yang cocok untuk pemrosesan kuitansi, formulir, dan tangkapan layar.
  • Output JSON terikat skema menghilangkan kebutuhan untuk penguraian teks bebas yang rentan kesalahan.
  • Pemanggilan alat dan dukungan penembolokan konteks memungkinkan langkah-langkah agen yang berulang dan serupa dalam skala besar.

Kapan harus beralih

  • Untuk agen pengodean yang panjang dan melibatkan banyak langkah, model Flash dan Pro bekerja lebih baik daripada model Lite.
  • Ini bukan model yang mengutamakan penalaran; matematika sulit atau perencanaan mendalam lebih baik dikirim ke Gemini 3.1 Pro.

Memulai

  1. Buat API key

    Buat kunci di Console, gunakan untuk semua model di platform.

  2. Kirim permintaan pertama Anda

    Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.

    Teks ke teksGemini API
    POST/v1beta/models/gemini-3.1-flash-lite:generateContent
    Format API:
    curl "https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent" \
      -H "Content-Type: application/json" \
      -H "x-goog-api-key: sk-xxx" \
      -d '{
        "contents": [
          {"role": "user", "parts": [{"text": "Hello!"}]}
        ]
      }'

Penetapan Harga

Harga Verified berlaku untuk Verified yang lebih murah di sebagian besar model. Harga Official adalah harga resmi dari pembuat model dan berlaku untuk rute Official yang lebih andal. Auto menagihkan biaya berdasarkan rute yang menyelesaikan permintaan.

Spesifikasi default

per 1M token
Harga Official
Masukan $0.25 / Keluaran $1.50 / Pembacaan cache $0.025
Harga Verified
Masukan $0.125 / Keluaran $0.75 / Pembacaan cache $0.0125
Diskon
-50%
Harga cache prompt

Pembacaan cache

Harga Official
$0.025
Harga Verified
$0.0125
Diskon
-50%
Biaya alat

Biaya dikenakan per panggilan, hanya saat model menggunakan alat tersebut.

Pencarian web

Harga Official
$0.014/pencarian
Harga Verified
$0.007/pencarian
Diskon
-50%

Penggunaan & aktivitas

Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.

Penggunaan & ketersediaan

24 jam terakhir
Permintaan
Tingkat keberhasilan
Latensi P95
Total token
Performa model
Tingkat keberhasilan 30 hari
100,0%
Permintaan 30 hari
40K+
Aktivitas terakhir
18 menit yang lalu

Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.

Buka di Console

Buka Gemini 3.1 Flash-Lite di Console dengan prompt siap diedit atau dikirim.

Bantu saya mencoba gemini-3.1-flash-lite dengan pesan singkat di /v1beta/models/gemini-3.1-flash-lite:generateContent. Tampilkan balasan, latensi, dan biayanya.

Skenario penggunaan

Cocok untuk
  • Visi
  • Ekstraksi massal

    Tarik bidang dari ribuan faktur atau formulir dan tulis setiap hasil sebagai objek JSON yang tervalidasi.

  • Moderasi dan penandaan konten

    Labeli unggahan dan komentar pengguna berdasarkan kebijakan tetap dengan satu baris pembenaran.

  • Lapisan perutean

    Tentukan model spesialis atau alat mana yang harus menerima permintaan, lalu teruskan.

  • Asisten waktu nyata

    Dukung pelengkapan otomatis, balasan cepat, atau giliran asisten suara di mana waktu tunggu yang terlihat akan merusak pengalaman pengguna.

Contoh prompt

Ekstrak vendor, tanggal, total, dan mata uang dari gambar faktur ini dan kembalikan sebagai JSON.

Tandai komentar di bawah sebagai spam, pelecehan, pertanyaan, atau pujian dan jelaskan pilihannya dalam satu kalimat.

Berdasarkan pesan pengguna ini, pilih salah satu dari: search_docs, create_ticket, answer_directly. Balas hanya dengan nama alat.

Model ini memiliki harga kondisional. Total token bulanan saja tidak dapat menghasilkan estimasi yang andal; gunakan harga detail untuk spesifikasi permintaan, cache, dan jendela waktu yang berlaku.

FAQ

Apa kegunaan terbaik Gemini 3.1 Flash-Lite?

Pekerjaan bervolume tinggi dan sensitif terhadap latensi seperti ekstraksi, klasifikasi, penandaan, perutean, dan jawaban multimodal cepat. Model ini menukar kedalaman penalaran demi kecepatan dan beban yang lebih ringan per panggilan.

Apakah model ini menerima gambar?

Ya. Teks dan gambar dapat dicampur dalam satu permintaan, sehingga model ini dapat membaca dokumen, tangkapan layar, dan foto. Jawabannya kembali sebagai teks atau sebagai JSON yang sesuai dengan skema Anda.

Bisakah model ini memanggil alat?

Ya. Pemanggilan fungsi didukung, yang memungkinkannya bertindak sebagai agen tahap pertama yang memilih alat untuk permintaan sederhana atau meneruskan kasus sulit ke model yang lebih besar.

Apa bedanya dengan Gemini 3.5 Flash-Lite?

3.5 Flash-Lite adalah generasi yang lebih baru dan yang kini disarankan Google untuk proyek baru; 3.1 Flash-Lite adalah model Lite yang lebih lama, namun tetap stabil. Uji prompt Anda sendiri pada keduanya sebelum memindahkan trafik.

Berapa biaya Gemini 3.1 Flash-Lite?

Di TokenLab, Gemini 3.1 Flash-Lite dikenakan Masukan $0.125 / Keluaran $0.75 per 1M token. Tabel harga di atas menampilkan rincian lengkap. Tarif bergantung pada unit penagihan, spesifikasi, dan penggunaan. Bandingkan kondisi yang sama dalam harga detail model; satu tarif tidak menentukan total biaya.

Berapa batas konteks dan output Gemini 3.1 Flash-Lite?

Gemini 3.1 Flash-Lite mendukung hingga 1.048.576 token konteks dan menghasilkan hingga 65.536 token per respons.

Endpoint mana yang harus digunakan Gemini 3.1 Flash-Lite?

Pakai https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent sebagai default untuk Gemini 3.1 Flash-Lite. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.

Operasi apa saja yang didukung Gemini 3.1 Flash-Lite?

Gemini 3.1 Flash-Lite mendukung Teks ke teks. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.

Bandingkan Gemini 3.1 Flash-Lite

Panduan menggunakan Gemini 3.1 Flash-Lite

Sumber

Ditinjau 2 Okt 2026

Lainnya dari Gemini 3

Model terkait