Google: Gemma 4 31B
gemma-4-31b- Đầu vào / Đầu ra
- $0.102 / $0.297
- Phương thức
- Trò chuyện
Về Gemma 4 31B
Gemma 4 31B là mô hình dày đặc (dense model) lớn nhất trong dòng Gemma 4 có trọng số mở của Google, được ra mắt vào tháng 3 năm 2026 với các kích thước từ E2B đến 31B. Google mô tả dòng mô hình này được xây dựng cho khả năng suy luận, quy trình làm việc của tác nhân (agentic workflows), lập trình và hiểu đa phương thức. Không giống như các mô hình Gemini độc quyền, trọng số của nó được công khai, vì vậy cùng một mô hình có thể được chạy trên phần cứng của riêng bạn.
Ưu điểm
- Trọng số mở cho phép bạn di chuyển cùng một mô hình giữa các thiết lập được lưu trữ (hosted) và tự vận hành.
- Kích thước 31B dày đặc nhắm đến chất lượng suy luận và lập trình mà các kích thước Gemma 4 nhỏ hơn không có.
- Thẻ mô hình của Google báo cáo kết quả mạnh mẽ trên các tiêu chuẩn đánh giá suy luận và lập trình như MMLU Pro và LiveCodeBench v6.
- Hỗ trợ đa ngôn ngữ với hơn 140 ngôn ngữ.
Khi nào nên chọn model khác
- Nó chỉ hoạt động với văn bản và không có khả năng gọi công cụ (tool calling), vì vậy các quy trình làm việc của tác nhân sẽ được phục vụ tốt hơn bởi mô hình Gemini.
- Nó có khả năng kém hơn các mô hình Gemini 3.x Pro và Flash trong các tác vụ tự hành dài hạn.
Bắt đầu
Tạo API key
Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.
Gửi yêu cầu đầu tiên của bạn
Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.
Văn bản sang văn bảnChat Completions APIPOST/v1/chat/completionscurl https://api.tokenlab.sh/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "gemma-4-31b", "messages": [ {"role": "user", "content": "Hello!"} ] }'
Giá
Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.
Thông số mặc định
mỗi 1M token- Giá niêm yết
- Đầu vào $0.102 / Đầu ra $0.297 / Đọc bộ nhớ đệm $0.012
- Official
- Đầu vào $0.102 / Đầu ra $0.297 / Đọc bộ nhớ đệm $0.012
- Giảm giá
- —
Đọc bộ nhớ đệm
- Giá niêm yết
- $0.012
- Official
- $0.012
- Giảm giá
- —
| Giá niêm yếtmỗi 1M token | Officialmỗi 1M token | Giảm giá | |
|---|---|---|---|
| Thông số mặc định | Đầu vào $0.102 / Đầu ra $0.297 / Đọc bộ nhớ đệm $0.012 | Đầu vào $0.102 / Đầu ra $0.297 / Đọc bộ nhớ đệm $0.012 | — |
| Giá cache của prompt | |||
| Đọc bộ nhớ đệm | $0.012 | $0.012 | — |
Sử dụng & hoạt động
Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.
Mức sử dụng & tình trạng
24 giờ qua- Yêu cầu
- Tỷ lệ thành công
- Độ trễ P95
- Tổng token
Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.
Mở trong Console
Mở Gemma 4 31B trong Console để chỉnh sửa và gửi prompt ngay.
Giúp tôi thử gemma-4-31b với tin nhắn ngắn tại /v1/chat/completions. Hiển thị phản hồi, độ trễ và chi phí.
Tình huống sử dụng
Trợ lý có thể tự lưu trữ
Tạo mẫu dựa trên mô hình được lưu trữ, sau đó chuyển sang GPU của riêng bạn nếu các quy định về dữ liệu yêu cầu.
Trò chuyện đa ngôn ngữ
Trả lời người dùng bằng nhiều ngôn ngữ từ một mô hình duy nhất, giúp việc duy trì công cụ hỗ trợ đơn giản hơn so với việc chạy các trình dịch riêng biệt.
Giải thích mã nguồn
Xem xét các đoạn mã và viết hàm trong các môi trường mà mô hình có trọng số mở là yêu cầu bắt buộc vì lý do chính sách hoặc lưu trữ.
Cơ sở để tinh chỉnh (fine-tuning)
So sánh với mô hình cơ sở được lưu trữ trước khi điều chỉnh các trọng số mở cho lĩnh vực của bạn.
Ví dụ prompt
Dịch đoạn văn này sang tiếng Tây Ban Nha, tiếng Đức và tiếng Nhật, đồng thời ghi chú bất kỳ thành ngữ nào bạn phải diễn đạt lại.
Giải thích truy vấn SQL này làm gì, sau đó viết lại để tránh truy vấn con tương quan (correlated subquery).
Viết một phản hồi ngắn gọn, lịch sự để từ chối lời mời họp này và đề xuất thời gian vào tuần tới.
Mô hình này có giá theo điều kiện. Chỉ tổng token hàng tháng không thể tạo ước tính đáng tin cậy; hãy dùng bảng giá chi tiết theo thông số yêu cầu, bộ nhớ đệm và khung giờ áp dụng.
FAQ
Gemma 4 31B có phải là mã nguồn mở không?
Google công bố các trọng số theo các điều khoản của Gemma, điều này làm cho nó trở thành mô hình có trọng số mở. Hãy đọc giấy phép trên thẻ mô hình trước khi sử dụng cho mục đích thương mại, vì đó là giấy phép riêng của Gemma.
Gemma khác Gemini như thế nào?
Các mô hình Gemini là dòng mô hình độc quyền được lưu trữ của Google. Các mô hình Gemma là những mô hình có trọng số mở nhỏ hơn được xây dựng từ các nghiên cứu liên quan, mà bạn có thể tải xuống, tinh chỉnh và tự chạy.
Nó có hỗ trợ gọi công cụ không?
Không. Mô hình được lưu trữ chỉ xử lý trò chuyện văn bản, với đầu vào và đầu ra là văn bản và không có khả năng gọi công cụ. Đối với các tác nhân cần gọi hàm, hãy sử dụng mô hình Gemini thay thế.
Mô hình có kích thước bao nhiêu?
Khoảng 31 tỷ tham số, dày đặc, là mô hình lớn nhất trong năm kích thước của Gemma 4: E2B, E4B, 12B, 26B, A4B và 31B. Các kích thước nhỏ hơn nhắm đến điện thoại và máy tính xách tay.
Gemma 4 31B có giá bao nhiêu?
Trên TokenLab, Gemma 4 31B có giá Đầu vào $0.102 / Đầu ra $0.297 mỗi 1M token. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.
Gemma 4 31B nên dùng endpoint nào?
Dùng https://api.tokenlab.sh/v1/chat/completions làm mặc định cho Gemma 4 31B. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.
Gemma 4 31B hỗ trợ những thao tác nào?
Gemma 4 31B hỗ trợ Văn bản sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.
So sánh Gemma 4 31B
Nguồn
Đánh giá ngày 2 thg 10, 2026