Google: Gemini 3.1 Flash-Lite
gemini-3.1-flash-lite- Đầu vào / Đầu ra-50%
- $0.25 / $1.50$0.125 / $0.75
- Ngữ cảnh
- 1M
- Ngày phát hành
- 7 thg 5, 2026
- Độ dài đầu ra tối đa
- 64K
- Phương thức
- Thị giácTrò chuyện
- Khả năng
- Sử dụng công cụBộ nhớ đệm Prompt
Về Gemini 3.1 Flash-Lite
Gemini 3.1 Flash-Lite là mô hình có độ trễ thấp, chi phí thấp của Google trong dòng Gemini 3.1, được xây dựng cho khối lượng công việc đa phương thức và tác vụ tác nhân (agent) lớn. Google mô tả hiệu suất đạt chuẩn tiên tiến (frontier-class) cạnh tranh với các mô hình lớn hơn với một phần nhỏ chi phí. Nó đọc văn bản và hình ảnh, gọi công cụ, trả về JSON ràng buộc theo lược đồ (schema-bound), và hỗ trợ lưu đệm ngữ cảnh (context caching), đồng thời nằm dưới tầng Flash về khả năng.
Ưu điểm
- Thời gian phản hồi ngắn làm cho nó phù hợp với các tính năng tương tác nơi mỗi lệnh gọi phải trả về kết quả nhanh chóng.
- Hình ảnh và văn bản đi vào cùng một yêu cầu, phù hợp cho việc xử lý biên lai, biểu mẫu và ảnh chụp màn hình.
- Đầu ra JSON ràng buộc theo lược đồ loại bỏ nhu cầu phân tích cú pháp mỏng manh của văn bản tự do.
- Việc gọi công cụ và lưu đệm ngữ cảnh hỗ trợ các bước tác nhân lặp đi lặp lại, tương tự ở quy mô lớn.
Khi nào nên chọn model khác
- Đối với các tác nhân mã hóa dài, nhiều bước, các mô hình Flash và Pro duy trì tốt hơn so với mô hình Lite.
- Đây không phải là mô hình ưu tiên suy luận; các bài toán khó hoặc lập kế hoạch sâu nên được gửi đến Gemini 3.1 Pro.
Bắt đầu
Tạo API key
Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.
Gửi yêu cầu đầu tiên của bạn
Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.
Văn bản sang văn bảnGemini APIPOST/v1beta/models/gemini-3.1-flash-lite:generateContentĐịnh dạng API:curl "https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent" \ -H "Content-Type: application/json" \ -H "x-goog-api-key: sk-xxx" \ -d '{ "contents": [ {"role": "user", "parts": [{"text": "Hello!"}]} ] }'
Giá
Giá Verified áp dụng cho Verified, thường rẻ hơn trên hầu hết các model. Giá Official là giá niêm yết từ nhà phát triển, áp dụng cho route Official ổn định hơn. Auto sẽ tính phí dựa trên route hoàn thành yêu cầu.
Thông số mặc định
mỗi 1M token- Giá Official
- Đầu vào $0.25 / Đầu ra $1.50 / Đọc bộ nhớ đệm $0.025
- Giá Verified
- Đầu vào $0.125 / Đầu ra $0.75 / Đọc bộ nhớ đệm $0.0125
- Giảm giá
- -50%
Đọc bộ nhớ đệm
- Giá Official
- $0.025
- Giá Verified
- $0.0125
- Giảm giá
- -50%
Phí tính theo mỗi lượt gọi khi model sử dụng công cụ.
Tìm kiếm web
- Giá Official
- $0.014/lượt tìm
- Giá Verified
- $0.007/lượt tìm
- Giảm giá
- -50%
| Giá Officialmỗi 1M token | Giá Verifiedmỗi 1M token | Giảm giá | |
|---|---|---|---|
| Thông số mặc định | Đầu vào $0.25 / Đầu ra $1.50 / Đọc bộ nhớ đệm $0.025 | Đầu vào $0.125 / Đầu ra $0.75 / Đọc bộ nhớ đệm $0.0125 | -50% |
| Giá cache của prompt | |||
| Đọc bộ nhớ đệm | $0.025 | $0.0125 | -50% |
| Phí công cụPhí tính theo mỗi lượt gọi khi model sử dụng công cụ. | |||
| Tìm kiếm web | $0.014/lượt tìm | $0.007/lượt tìm | -50% |
Sử dụng & hoạt động
Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.
Mức sử dụng & tình trạng
24 giờ qua- Yêu cầu
- Tỷ lệ thành công
- Độ trễ P95
- Tổng token
- Tỷ lệ thành công 30 ngày
- 100,0%
- Lượt yêu cầu 30 ngày
- 40K+
- Hoạt động gần nhất
- 7 phút trước
Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.
Mở trong Console
Mở Gemini 3.1 Flash-Lite trong Console để chỉnh sửa và gửi prompt ngay.
Giúp tôi thử gemini-3.1-flash-lite với tin nhắn ngắn tại /v1beta/models/gemini-3.1-flash-lite:generateContent. Hiển thị phản hồi, độ trễ và chi phí.
Tình huống sử dụng
Phù hợp cho- Thị giác
Trích xuất hàng loạt
Trích xuất các trường từ hàng nghìn hóa đơn hoặc biểu mẫu và ghi lại từng kết quả dưới dạng đối tượng JSON đã được xác thực.
Kiểm duyệt nội dung và gắn thẻ
Dán nhãn các nội dung tải lên và bình luận của người dùng dựa trên một chính sách cố định kèm theo một dòng giải thích.
Tầng định tuyến
Quyết định xem mô hình chuyên gia hoặc công cụ nào mà yêu cầu nên được chuyển đến, sau đó chuyển tiếp nó.
Trợ lý thời gian thực
Cung cấp năng lượng cho tính năng tự động hoàn thành, trả lời nhanh hoặc các lượt hội thoại của trợ lý giọng nói nơi thời gian chờ đợi có thể nhìn thấy sẽ làm tổn hại đến trải nghiệm của người sử dụng.
Ví dụ prompt
Trích xuất nhà cung cấp, ngày tháng, tổng số tiền và đơn vị tiền tệ từ hình ảnh hóa đơn này và trả về chúng dưới dạng JSON.
Gắn nhãn bình luận bên dưới là thư rác (spam), lạm dụng, câu hỏi hoặc khen ngợi và giải thích lựa chọn đó trong một câu.
Cho trước thông điệp này của người dùng, hãy chọn một trong các mục: search_docs, create_ticket, answer_directly. Chỉ trả lời bằng tên công cụ.
Mô hình này có giá theo điều kiện. Chỉ tổng token hàng tháng không thể tạo ước tính đáng tin cậy; hãy dùng bảng giá chi tiết theo thông số yêu cầu, bộ nhớ đệm và khung giờ áp dụng.
FAQ
Gemini 3.1 Flash-Lite phù hợp nhất cho việc gì?
Các công việc khối lượng lớn, nhạy cảm với độ trễ như trích xuất, phân loại, gắn thẻ, định tuyến và trả lời đa phương thức nhanh chóng. Nó đánh đổi một phần độ sâu suy luận để đổi lấy tốc độ và tải nhẹ hơn cho mỗi lần gọi.
Nó có chấp nhận hình ảnh không?
Có. Văn bản và hình ảnh có thể được kết hợp trong một yêu cầu, vì vậy nó có thể đọc tài liệu, ảnh chụp màn hình và ảnh chụp. Câu trả lời của nó được trả về dưới dạng văn bản hoặc dưới dạng JSON phù hợp với lược đồ của bạn.
Nó có thể gọi công cụ không?
Có. Việc gọi hàm (function calling) được hỗ trợ, cho phép nó đóng vai trò là tác nhân giai đoạn đầu chọn các công cụ cho các yêu cầu đơn giản hoặc chuyển tiếp các trường hợp khó đến một mô hình lớn hơn.
Nó khác biệt thế nào so với Gemini 3.5 Flash-Lite?
3.5 Flash-Lite là thế hệ mới hơn và là thế hệ mà Google hiện đang hướng các dự án mới tới; 3.1 Flash-Lite là mô hình Lite cũ hơn nhưng vẫn ổn định. Hãy kiểm tra các câu lệnh của riêng bạn trên cả hai trước khi chuyển lưu lượng truy cập.
Gemini 3.1 Flash-Lite có giá bao nhiêu?
Trên TokenLab, Gemini 3.1 Flash-Lite có giá Đầu vào $0.125 / Đầu ra $0.75 mỗi 1M token. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.
Giới hạn ngữ cảnh và đầu ra của Gemini 3.1 Flash-Lite là bao nhiêu?
Gemini 3.1 Flash-Lite hỗ trợ tối đa 1.048.576 token ngữ cảnh và trả về tối đa 65.536 token mỗi phản hồi.
Gemini 3.1 Flash-Lite nên dùng endpoint nào?
Dùng https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent làm mặc định cho Gemini 3.1 Flash-Lite. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.
Gemini 3.1 Flash-Lite hỗ trợ những thao tác nào?
Gemini 3.1 Flash-Lite hỗ trợ Văn bản sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.
So sánh Gemini 3.1 Flash-Lite
Hướng dẫn sử dụng Gemini 3.1 Flash-Lite
Nguồn
Đánh giá ngày 2 thg 10, 2026