Chọn Auto, TokenLab Verified hoặc Official cho mỗi yêu cầu, với giá được hiển thị ngay từ đầu.Xem có gì mới

Google: Gemini 3.5 Flash

Gemini 3.5 Flash được xây dựng cho công việc lập trình và tác tử bền bỉ. Ngữ cảnh dài và khả năng gọi công cụ của mô hình này phù hợp với các trợ lý cần thực hiện tác vụ qua nhiều bước trong khi vẫn duy trì tài liệu, mã nguồn và các quyết định trước đó.
So sánh mô hình
gemini-3.5-flash
Sẵn sàngGoogleTrò chuyệnGiảm 90% cho đầu vào đã lưu
Đầu vào / Đầu ra-50%
$1.50 / $9.00$0.75 / $4.50
Ngữ cảnh
1M
Ngày phát hành
19 thg 5, 2026
Độ dài đầu ra tối đa
64K
Phương thức
Thị giácTrò chuyện
Khả năng
Sử dụng công cụBộ nhớ đệm PromptSuy luận

Về Gemini 3.5 Flash

Gemini 3.5 Flash là một mô hình thuộc phân khúc Flash ổn định từ Google, được Google mô tả là mức chuẩn cho tốc độ và hiệu suất nền tảng đối với các tác vụ thông thường, có khối lượng xử lý lớn. Mô hình này đọc văn bản và hình ảnh, gọi công cụ, trả về JSON tuân thủ schema và hỗ trợ tính năng caching. Mô hình này nằm giữa các phiên bản Flash-Lite 3.5 và các bản phát hành Flash 3.6, 3.7, 3.8 sau đó.

Ưu điểm

  • Một mô hình Flash đa năng ổn định dành cho trò chuyện thông thường, trích xuất và tóm tắt với khối lượng lớn.
  • Việc gọi công cụ hỗ trợ các trợ lý thực hiện một tác vụ qua một vài bước.
  • Tính năng đầu vào hình ảnh cho phép xử lý ảnh chụp màn hình, bản quét và biểu đồ mà không cần một mô hình thị giác riêng biệt.
  • JSON tuân thủ schema và caching ngữ cảnh phù hợp cho các lệnh gọi đường ống lặp đi lặp lại.

Khi nào nên chọn model khác

  • Các mô hình Flash 3.6, 3.7 và 3.8 ra mắt sau mạnh mẽ hơn về các tác vụ lập trình và tác vụ tác tử (agent).
  • Mô hình này không có chế độ suy nghĩ chuyên biệt, vì vậy các lý luận nhiều bước khó nên được giao cho mô hình khác.

Bắt đầu

  1. Tạo API key

    Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.

  2. Gửi yêu cầu đầu tiên của bạn

    Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.

    Văn bản sang văn bảnGemini API
    POST/v1beta/models/gemini-3.5-flash:generateContent
    Định dạng API:
    curl "https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash:generateContent" \
      -H "Content-Type: application/json" \
      -H "x-goog-api-key: sk-xxx" \
      -d '{
        "contents": [
          {"role": "user", "parts": [{"text": "Hello!"}]}
        ]
      }'

Giá

Giá Verified áp dụng cho Verified, thường rẻ hơn trên hầu hết các model. Giá Official là giá niêm yết từ nhà phát triển, áp dụng cho route Official ổn định hơn. Auto sẽ tính phí dựa trên route hoàn thành yêu cầu.

Thông số mặc định

mỗi 1M token
Giá Official
Đầu vào $1.50 / Đầu ra $9.00 / Đọc bộ nhớ đệm $0.15
Giá Verified
Đầu vào $0.75 / Đầu ra $4.50 / Đọc bộ nhớ đệm $0.075
Giảm giá
-50%
Giá cache của prompt

Đọc bộ nhớ đệm

Giá Official
$0.15
Giá Verified
$0.075
Giảm giá
-50%
Phí công cụ

Phí tính theo mỗi lượt gọi khi model sử dụng công cụ.

Tìm kiếm web

Giá Official
$0.014/lượt tìm
Giá Verified
$0.007/lượt tìm
Giảm giá
-50%

Sử dụng & hoạt động

Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.

Mức sử dụng & tình trạng

24 giờ qua
Yêu cầu
Tỷ lệ thành công
Độ trễ P95
Tổng token
Hiệu năng mô hình
Tỷ lệ thành công 30 ngày
95,0%
Lượt yêu cầu 30 ngày
1K+
Hoạt động gần nhất
31 phút trước

Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.

Mở trong Console

Mở Gemini 3.5 Flash trong Console để chỉnh sửa và gửi prompt ngay.

Giúp tôi thử gemini-3.5-flash với tin nhắn ngắn tại /v1beta/models/gemini-3.5-flash:generateContent. Hiển thị phản hồi, độ trễ và chi phí.

Tình huống sử dụng

Phù hợp cho
  • Suy luận
  • Thị giác
  • Trò chuyện với khách hàng

    Trả lời các câu hỏi về sản phẩm bằng cơ sở kiến thức được cache trong phần tiền tố của prompt.

  • Tóm tắt hàng loạt

    Tóm tắt các bản ghi âm cuộc gọi hoặc ticket và xuất ra một bản tóm tắt JSON cố định cho mỗi mục.

  • Đọc biểu mẫu và tài liệu

    Trích xuất các trường từ biểu mẫu quét và phiếu giao hàng thành các bản ghi có cấu trúc mà hệ thống hạ nguồn có thể tải trực tiếp.

  • Hỗ trợ lập trình cấp độ nhập môn

    Giải thích mã nguồn, viết các hàm nhỏ và phác thảo các bài kiểm thử đơn vị (unit test) khi chiều sâu không quá quan trọng.

Ví dụ prompt

Tóm tắt bản ghi hỗ trợ này thành ba ý chính và đặt 'resolved' thành true hoặc false.

Đọc phiếu giao hàng đã quét này và trả về số đơn hàng, các mặt hàng và trạng thái chữ ký dưới dạng JSON.

Viết một hàm Python phân tích cú pháp định dạng ngày tháng ISO từ các chuỗi lộn xộn, cộng với năm trường hợp kiểm thử.

Mô hình này có giá theo điều kiện. Chỉ tổng token hàng tháng không thể tạo ước tính đáng tin cậy; hãy dùng bảng giá chi tiết theo thông số yêu cầu, bộ nhớ đệm và khung giờ áp dụng.

FAQ

Gemini 3.5 Flash là gì?

Một mô hình Gemini thuộc phân khúc Flash ổn định hướng tới các tác vụ thông thường, có khối lượng xử lý lớn. Mô hình này nhận văn bản và hình ảnh, sử dụng công cụ và tạo ra đầu ra có cấu trúc, tập trung vào tốc độ ổn định hơn là chiều sâu tối đa.

Mô hình này so sánh thế nào với Gemini 3.5 Flash-Lite?

Flash-Lite là mô hình 3.5 nhanh nhất và tiết kiệm nhất của Google; Flash là mô hình đầy đủ hơn cho các tác vụ cần sự chăm chút hơn. Hãy chọn Lite cho việc gán nhãn và trích xuất, và chọn Flash cho hội thoại và các đầu ra dài hơn.

Mô hình này có tốt cho các tác tử lập trình không?

Mô hình có thể xử lý các tác vụ lập trình nhỏ, nhưng các mô hình Flash 3.7 và 3.8 ra mắt sau của Google mới là những mô hình được định vị cho lập trình phức tạp và các tác tử chạy dài hạn. Hãy sử dụng 3.5 Flash khi công việc đơn giản và khối lượng lớn.

Mô hình có hỗ trợ hình ảnh và caching không?

Có cho cả hai. Hình ảnh có thể được đính kèm bên cạnh văn bản trong một yêu cầu duy nhất, và caching ngữ cảnh giúp tái sử dụng một tiền tố chung dài qua nhiều yêu cầu, chẳng hạn như một tập hợp hướng dẫn cố định.

Gemini 3.5 Flash có giá bao nhiêu?

Trên TokenLab, Gemini 3.5 Flash có giá Đầu vào $0.75 / Đầu ra $4.50 mỗi 1M token. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.

Giới hạn ngữ cảnh và đầu ra của Gemini 3.5 Flash là bao nhiêu?

Gemini 3.5 Flash hỗ trợ tối đa 1.048.576 token ngữ cảnh và trả về tối đa 65.536 token mỗi phản hồi.

Gemini 3.5 Flash nên dùng endpoint nào?

Dùng https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash:generateContent làm mặc định cho Gemini 3.5 Flash. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.

Gemini 3.5 Flash hỗ trợ những thao tác nào?

Gemini 3.5 Flash hỗ trợ Văn bản sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.

So sánh Gemini 3.5 Flash

Hướng dẫn sử dụng Gemini 3.5 Flash

Nguồn

Đánh giá ngày 2 thg 10, 2026

Xem thêm từ Gemini 3

Mô hình liên quan