Google: Gemini 3.5 Flash-Lite
gemini-3.5-flash-lite- Đầu vào / Đầu ra-50%
- $0.30 / $2.50$0.15 / $1.25
- Ngữ cảnh
- 1M
- Ngày phát hành
- 21 thg 7, 2026
- Độ dài đầu ra tối đa
- 64K
- Phương thức
- Thị giácTrò chuyện
- Khả năng
- Sử dụng công cụBộ nhớ đệm Prompt
Về Gemini 3.5 Flash-Lite
Gemini 3.5 Flash-Lite là mô hình nhanh nhất và hiệu quả nhất về mặt chi phí của thế hệ 3.5 do Google ra mắt vào tháng 7 năm 2026. Mô hình này nhắm đến khối lượng công việc lớn đòi hỏi thời gian phản hồi ngắn: xử lý tài liệu, trích xuất và các tác vụ tác nhân nhỏ lặp đi lặp lại. Mô hình đọc văn bản và hình ảnh, gọi công cụ, trả về JSON tuân thủ schema và lưu bộ nhớ đệm ngữ cảnh, hiện Google đang định hướng các dự án mới sử dụng mô hình này.
Ưu điểm
- Được thiết kế cho thời gian phản hồi ngắn đối với công việc lặp lại hàng nghìn lần.
- Xử lý đồng thời văn bản và hình ảnh để phục vụ việc xử lý tài liệu và ảnh chụp màn hình.
- JSON tuân thủ schema giúp đầu ra trích xuất duy trì tính nhất quán.
- Tính năng gọi hàm cho phép mô hình chạy các bước tác nhân nhỏ như tra cứu hoặc định tuyến.
Khi nào nên chọn model khác
- Các phiên lập trình dài và quy trình công việc phức tạp của doanh nghiệp thuộc về 3.8 Flash hoặc 3.1 Pro.
- Mô hình sẽ bỏ sót các chi tiết mà một mô hình Flash đầy đủ hơn có thể nắm bắt trên các tài liệu dày đặc hoặc mơ hồ.
Bắt đầu
Tạo API key
Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.
Gửi yêu cầu đầu tiên của bạn
Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.
Văn bản sang văn bảnGemini APIPOST/v1beta/models/gemini-3.5-flash-lite:generateContentĐịnh dạng API:curl "https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash-lite:generateContent" \ -H "Content-Type: application/json" \ -H "x-goog-api-key: sk-xxx" \ -d '{ "contents": [ {"role": "user", "parts": [{"text": "Hello!"}]} ] }'
Giá
Giá TokenLab áp dụng cho Verified, giúp tiết kiệm chi phí trên hầu hết các model. Giá Official là giá niêm yết từ nhà phát triển, áp dụng cho luồng Official ổn định hơn. Auto sẽ tính phí dựa trên luồng thực hiện thành công yêu cầu.
Thông số mặc định
mỗi 1M token- Giá niêm yết
- Đầu vào $0.30 / Đầu ra $2.50 / Đọc bộ nhớ đệm $0.03
- Giá TokenLab
- Đầu vào $0.15 / Đầu ra $1.25 / Đọc bộ nhớ đệm $0.015
- Giảm giá
- -50%
Đọc bộ nhớ đệm
- Giá niêm yết
- $0.03
- Giá TokenLab
- $0.015
- Giảm giá
- -50%
| Giá niêm yếtmỗi 1M token | Giá TokenLabmỗi 1M token | Giảm giá | |
|---|---|---|---|
| Thông số mặc định | Đầu vào $0.30 / Đầu ra $2.50 / Đọc bộ nhớ đệm $0.03 | Đầu vào $0.15 / Đầu ra $1.25 / Đọc bộ nhớ đệm $0.015 | -50% |
| Giá cache của prompt | |||
| Đọc bộ nhớ đệm | $0.03 | $0.015 | -50% |
Sử dụng & hoạt động
Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.
Mức sử dụng & tình trạng
24 giờ qua- Yêu cầu
- Tỷ lệ thành công
- Độ trễ P95
- Tổng token
- Tỷ lệ thành công 30 ngày
- 99,7%
- Độ trễ trung vị 7 ngày
- 1,9 sn=346
- Độ trễ P95 7 ngày
- 7 sn=346
- Lượt yêu cầu 30 ngày
- 100+
- Hoạt động gần nhất
- 19 giờ trước
Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.
Mở trong Console
Mở Gemini 3.5 Flash-Lite trong Console để chỉnh sửa và gửi prompt ngay.
Giúp tôi thử gemini-3.5-flash-lite với tin nhắn ngắn tại /v1beta/models/gemini-3.5-flash-lite:generateContent. Hiển thị phản hồi, độ trễ và chi phí.
Tình huống sử dụng
Phù hợp cho- Thị giác
Đường ống tài liệu
Chuyển đổi hợp đồng, hóa đơn và báo cáo thành các trường có cấu trúc ở quy mô lớn, ghi lại một bản ghi JSON đã được xác thực cho mỗi tệp đến.
Phân loại hàng đợi
Sắp xếp các vé hỗ trợ (ticket) hoặc tin nhắn đến theo chủ đề và mức độ khẩn cấp trước khi con người hoặc mô hình lớn hơn nhìn thấy chúng.
Tác nhân nhỏ
Chạy các công việc hẹp gồm các công cụ trong vòng lặp (tools-in-a-loop) như tra cứu đơn hàng hoặc thay đổi lịch, trong đó mỗi bước đều nhỏ và vòng lặp lặp lại thường xuyên.
Kiểm tra trực quan
Xác nhận rằng ảnh đã tải lên đáp ứng các quy tắc đơn giản, chẳng hạn như nhãn có thể nhìn thấy hoặc đúng hướng.
Ví dụ prompt
Trích xuất từng mục dòng (line item) từ hóa đơn này dưới dạng JSON với mô tả, số lượng và số tiền trên một đơn vị.
Đánh giá mức độ khẩn cấp của vé này là thấp, trung bình hoặc cao và đưa ra câu đơn duy nhất biện minh cho điều đó.
Kiểm tra xem ảnh sản phẩm này có hiển thị rõ nhãn bao bì hay không; trả lời có hoặc không và nêu lý do.
Mô hình này có giá theo điều kiện. Chỉ tổng token hàng tháng không thể tạo ước tính đáng tin cậy; hãy dùng bảng giá chi tiết theo thông số yêu cầu, bộ nhớ đệm và khung giờ áp dụng.
FAQ
Gemini 3.5 Flash-Lite dùng để làm gì?
Công việc nhanh chóng, lặp đi lặp lại, đơn giản: trích xuất, phân loại, định tuyến và kiểm tra đa phương thức nhẹ nhàng. Đây là phân khúc tiết kiệm của dòng 3.5, được xây dựng để ưu tiên thời gian phản hồi hơn là chiều sâu.
Mô hình này có mới hơn Gemini 3.1 Flash-Lite không?
Có. Đây là thế hệ sau, và Google liệt kê đây là lựa chọn trọng lượng nhẹ được khuyến nghị cho các dự án mới. Mô hình 3.1 Flash-Lite cũ hơn vẫn tiếp tục khả dụng cho các tích hợp hiện có.
Mô hình này có đọc được hình ảnh không?
Có, hình ảnh có thể đi kèm với văn bản trong một yêu cầu, và câu trả lời trả về dưới dạng văn bản thuần túy hoặc JSON có cấu trúc, phù hợp cho việc kiểm tra ảnh và trích xuất tài liệu quét.
Khi nào thì mô hình này quá nhỏ?
Khi tác vụ đòi hỏi sự suy luận liên tục, phân tích tài liệu dài một cách cẩn thận, hoặc công việc lập trình kéo dài nhiều giờ. Hãy chuyển lên Gemini 3.8 Flash hoặc 3.1 Pro trong những trường hợp đó.
Gemini 3.5 Flash-Lite có giá bao nhiêu?
Trên TokenLab, Gemini 3.5 Flash-Lite có giá Đầu vào $0.15 / Đầu ra $1.25 mỗi 1M token. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.
Giới hạn ngữ cảnh và đầu ra của Gemini 3.5 Flash-Lite là bao nhiêu?
Gemini 3.5 Flash-Lite hỗ trợ tối đa 1.048.576 token ngữ cảnh và trả về tối đa 65.536 token mỗi phản hồi.
Gemini 3.5 Flash-Lite nên dùng endpoint nào?
Dùng https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash-lite:generateContent làm mặc định cho Gemini 3.5 Flash-Lite. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.
Gemini 3.5 Flash-Lite hỗ trợ những thao tác nào?
Gemini 3.5 Flash-Lite hỗ trợ Văn bản sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.
So sánh Gemini 3.5 Flash-Lite
Nguồn
Đánh giá ngày 2 thg 10, 2026