Việc gặp lỗi 404 chỉ vì chuỗi định danh mô hình bị thay đổi là một cách khởi đầu tồi tệ cho một vòng lặp tác nhân. API Gemini 3.5 Flash rất đáng để tích hợp vào một vòng lặp tác nhân tốc độ cao, nhưng chỉ sau khi bạn xác nhận chính xác ID mô hình gemini-3.5-flash dựa trên danh sách mô hình thực tế. Google Cloud niêm yết Gemini 3.5 Flash ở mức 1,50 USD cho mỗi 1 triệu token đầu vào và 9,00 USD cho mỗi 1 triệu token đầu ra văn bản trên tầng Global tiêu chuẩn, với mức giá Flex/Batch là 0,75 USD cho đầu vào và 4,50 USD cho đầu ra. Chúng tôi đã thấy cùng một cái bẫy này trong nguồn tin: một ID mô hình hoạt động hôm nay có thể gây ra lỗi 404 vào ngày mai. Các bảng giá trực tuyến thường trộn lẫn giá của nhà cung cấp đã xác nhận với các danh mục chưa được kiểm chứng. Bài hướng dẫn này bao gồm những gì có thể xác minh ngay bây giờ, những gì không, và cách xây dựng một vòng lặp tác nhân không bị hỏng khi ID mô hình thay đổi.
Các điểm chính
- Trang giá của Nền tảng Tác nhân (Agent Platform) trên Google Cloud niêm yết Gemini 3.5 Flash ở mức 1,50 USD/triệu token đầu vào và 9,00 USD/triệu token đầu ra trên tầng Global tiêu chuẩn, khớp với danh mục của TokenLab tại thời điểm làm mới.
- Chuỗi mô hình chính xác cần ghim là
gemini-3.5-flash; trang mô hình API Gemini của Google liệt kê đây là ví dụ về một mô hình ổn định. Tuy nhiên, hãy xác nhận lại thông qua danh sách mô hình trực tuyến trước khi triển khai. - Việc định tuyến thông qua API thống nhất của TokenLab nghĩa là bạn không cần phải mã hóa cứng (hardcode) chuỗi SDK dành riêng cho từng nhà cung cấp; TokenLab ánh xạ một slug mô hình ổn định tới bất kỳ định danh cơ sở nào hiện đang hợp lệ.
- Giá của các đối thủ cạnh tranh trong bảng dưới đây (GPT-5.5, Claude Sonnet 5, DeepSeek V4 Flash) chỉ lấy từ danh mục của TokenLab. Không có trang giá độc lập nào của nhà cung cấp được cung cấp cho các mô hình này trong bài đánh giá này — hãy xác minh trực tiếp với OpenAI, Anthropic và DeepSeek trước khi lập ngân sách dựa trên chúng.
- Không có số liệu độ trễ được kiểm chuẩn (thời gian đến token đầu tiên, thời lượng vòng lặp 5 bước đầy đủ) nào được trích dẫn ở đây vì không có số liệu nào được lấy từ nguồn độc lập. Hãy tự đo đạc vòng lặp của riêng bạn và tính toán p50/p95 cho mỗi bước thay vì trích dẫn các con số gián tiếp.
- Trong các vòng lặp tác nhân, token đầu ra thường chiếm chi phí chủ đạo — mức giá đầu ra của Gemini 3.5 Flash (9,00 USD/triệu) cao gấp 6 lần mức giá đầu vào (1,50 USD/triệu), vì vậy việc giới hạn
max_output_tokensquan trọng hơn việc cắt giảm độ dài prompt.
Ảnh chụp nhanh nguồn tin
| Nguồn | Nội dung bao phủ | Ngày quan sát |
|---|---|---|
| Giá Nền tảng Tác nhân Google Cloud | Giá token cho Gemini 3.5 Flash tiêu chuẩn, cached-input và Flex/Batch | 2026-07-08 |
| Trang mô hình API Google Gemini | Hướng dẫn đặt tên mô hình ổn định; gemini-3.5-flash được liệt kê là ví dụ mô hình ổn định |
2026-07-08 |
| Danh mục mô hình & giá của TokenLab | Giá mỗi token cho gemini-3.5-flash và các mô hình đối thủ trên Google, Anthropic, OpenAI và DeepSeek |
2026-07-08 |
Nền tảng Tác nhân Doanh nghiệp Gemini của Google Cloud niêm yết Gemini 3.5 Flash trên lịch trình giá riêng, tách biệt với trang giá API Nhà phát triển Gemini. Giá Global tiêu chuẩn là 1,50 USD cho mỗi 1 triệu token đầu vào và 9,00 USD cho mỗi 1 triệu token đầu ra văn bản. Giá Global Flex/Batch giảm xuống còn 0,75 USD cho đầu vào và 4,50 USD cho đầu ra. Cached input trên tầng tiêu chuẩn là 0,15 USD cho mỗi 1 triệu token. Đây là bằng chứng trực tiếp cho thấy Gemini 3.5 Flash là một mô hình ổn định, khả dụng rộng rãi, được định giá cho khối lượng công việc tác nhân doanh nghiệp trên Google Cloud, không phải là trình giữ chỗ hay nhãn xem trước. Độc giả so sánh chi phí giữa các bài viết nên kiểm tra xem mức giá được lấy từ trang giá nào trước khi coi các con số là có thể thay thế cho nhau.
So sánh mô hình và chi phí cho API Gemini 3.5 Flash
Tất cả các con số dưới đây là danh mục liệt kê của TokenLab. Các hàng được đánh dấu 'xác minh với nhà cung cấp' không có trích dẫn độc lập nào được cung cấp cho bài đánh giá này.
| Mô hình | Nhà cung cấp | Cửa sổ ngữ cảnh | Đầu vào $/triệu token | Đầu ra $/triệu token | Ghi chú |
|---|---|---|---|---|---|
| gemini-3.5-flash | 1.048.576 | $1.50 | $9.00 | Danh mục TokenLab; xác minh với trang giá trực tuyến của Google | |
| gemini-3.1-flash-lite | n/a | $0.25 | $1.50 | Danh mục TokenLab | |
| gemini-3-pro-image | n/a | $2.00 | $12.00 | Danh mục TokenLab, tầng hình ảnh; không dùng thay thế tác nhân văn bản | |
| gpt-5 | OpenAI | n/a | $1.25 | $10.00 | Danh mục TokenLab |
| gpt-5.5 | OpenAI | 1.050.000 | $5.00 | $30.00 | Danh mục TokenLab - xác minh với OpenAI |
| claude-sonnet-5 | Anthropic | 1.000.000 | $2.00 | $10.00 | Danh mục TokenLab - xác minh với Anthropic |
| claude-haiku-4-5 | Anthropic | n/a | $1.00 | $5.00 | Danh mục TokenLab |
| deepseek-v4-flash | DeepSeek | 1.048.576 | $0.09 | $0.18 | Danh mục TokenLab - xác minh với DeepSeek |
Đối với các vòng lặp tác nhân thực hiện nhiều lượt gọi công cụ nhỏ, mức giá rẻ nhất trên mỗi token không phải lúc nào cũng là mức giá rẻ nhất trên mỗi tác vụ — một mô hình cần ít lần thử lại hơn hoặc các dấu vết suy luận ngắn hơn có thể đánh bại mức giá niêm yết thấp hơn. Hãy đo chi phí trên mỗi tác vụ hoàn thành, không chỉ chi phí trên mỗi token.
Các bước triển khai cho API Gemini 3.5 Flash
Xác nhận ID mô hình trước khi viết mã. Tại thời điểm làm mới, ID mô hình để ghim là
gemini-3.5-flash, và tài liệu mô hình của Google liệt kê nó là một ví dụ về mô hình ổn định. Tuy nhiên, hãy gọi điểm cuối danh sách mô hình của nhà cung cấp hoặc kiểm tra danh mục của TokenLab trước khi triển khai. Đây là cách khắc phục vấn đề 'SDK báo lỗi': chuỗi định danh không tồn tại tại thời điểm gọi. Không có logic thử lại nào có thể sửa được một định danh sai. Ví dụ, nguồn tin mô tả trực tiếp chế độ lỗi đó.Định tuyến thông qua một điểm cuối thống nhất thay vì SDK nhà cung cấp thô. Sử dụng TokenLab (hoặc cổng tương tự) nghĩa là mã ứng dụng của bạn tham chiếu đến một slug ổn định, và cổng sẽ phân giải nó thành bất kỳ định danh hợp lệ hiện tại nào của nhà cung cấp. Điều này tách biệt vòng lặp tác nhân của bạn khỏi việc đổi tên hoặc ngừng hỗ trợ mô hình từ phía nhà cung cấp.
Xây dựng vòng lặp với các bước và công cụ đo lường rõ ràng:
# Chỉ là cấu trúc minh họa - xác nhận điểm cuối/mô hình chính xác
# các trường dựa trên tài liệu hiện tại của cổng kết nối trước khi triển khai.
import time
def agent_loop(task):
timings = {}
t0 = time.time()
plan = call_model(model="gemini-3.5-flash", prompt=build_plan_prompt(task))
timings["plan"] = time.time() - t0
t0 = time.time()
context = retrieve_context(plan)
timings["retrieve"] = time.time() - t0
t0 = time.time()
tool_result = call_tool(plan, context)
timings["tool_call"] = time.time() - t0
t0 = time.time()
synthesis = call_model(
model="gemini-3.5-flash",
prompt=build_synthesis_prompt(tool_result),
max_output_tokens=512,
)
timings["synthesize"] = time.time() - t0
t0 = time.time()
response = format_response(synthesis)
timings["respond"] = time.time() - t0
return response, timings
Trong quy trình của chúng tôi, chúng tôi ghi lại timings cho mỗi lần chạy và tự tính toán p50/p95 trên một lô tác vụ đại diện. Đừng xuất bản hoặc dựa vào con số 'N giây mỗi vòng lặp' cố định lấy từ môi trường của người khác — điều kiện mạng, độ dài prompt và tải của nhà cung cấp đều làm thay đổi các con số này.
Giới hạn token đầu ra một cách có chủ đích. Token đầu ra có chi phí cao gấp khoảng 6 lần token đầu vào cho
gemini-3.5-flashtheo giá danh mục ở trên. Chúng tôi đã kiểm tra toán học về giá. Hãy đặtmax_output_tokenscho mỗi bước thay vì để mô hình chạy dài. Điều này quan trọng nhất ở bước tổng hợp nơi các câu trả lời dài dòng thường xuyên xảy ra.Thêm chuỗi dự phòng (fallback chain). Định cấu hình một mô hình thứ cấp (ví dụ:
gemini-3.1-flash-liteđể tiết kiệm chi phí, hoặc một nhà cung cấp hoàn toàn khác) để một sự cố hoặc ngừng hỗ trợ mô hình đơn lẻ không làm sập toàn bộ tác nhân của bạn.
Khi nào nên sử dụng TokenLab
- Bạn muốn một slug mô hình ổn định thay vì một chuỗi nhà cung cấp dễ hỏng. Cách tiếp cận danh mục của TokenLab nghĩa là mã của bạn không cần phải viết lại mỗi khi nhà cung cấp đổi tên hoặc ngừng hỗ trợ một mô hình. Việc ngừng hoạt động Veo 3.0 của Google được lên lịch vào ngày 30 tháng 6 năm 2026 cho thấy rủi ro này.
- Bạn cần một nơi để so sánh chi phí giữa các nhà cung cấp trước khi cam kết với một nhà cung cấp, thay vì kiểm tra thủ công bốn trang giá riêng biệt mỗi khi bạn đánh giá việc thay đổi mô hình.
- Bạn đang chạy logic dự phòng đa nhà cung cấp và muốn một hình dạng yêu cầu/phản hồi nhất quán trên các mô hình Google, Anthropic, OpenAI và DeepSeek thay vì duy trì bốn tích hợp SDK riêng biệt.
Đọc thêm
Câu hỏi thường gặp
gemini-3.5-flash có phải là ID mô hình hợp lệ mà tôi có thể gọi trực tiếp vào SDK của Google không?
Đừng cho là vậy. Hãy xác nhận nó dựa trên danh sách mô hình hiện tại của Google trước khi triển khai — chuỗi ID mô hình thay đổi, và trạng thái xem trước/GA thay đổi theo thời gian. Nếu bạn đang định tuyến thông qua TokenLab, cổng kết nối sẽ xử lý việc ánh xạ này cho bạn.
Giá của các đối thủ cạnh tranh trong bảng so sánh đến từ đâu?
Chúng là các danh mục liệt kê của TokenLab. Chỉ có giá video Veo trong bài viết này là có nguồn gốc từ Google được ghi ngày độc lập (quan sát ngày 2026-07-08). Giá của GPT-5.5, Claude Sonnet 5 và DeepSeek V4 Flash ở đây không có trích dẫn độc lập nào được cung cấp — hãy xác minh với từng nhà cung cấp trước khi sử dụng các con số này trong ước tính chi phí cho khách hàng.
Vòng lặp tác nhân Gemini 3.5 Flash 5 bước nhanh đến mức nào?
Không có số liệu kiểm chuẩn nào được bao gồm ở đây vì không có số liệu nào được lấy từ nguồn độc lập cho bài viết này. Hãy tự đo đạc vòng lặp của riêng bạn (xem mẫu mã ở trên) và đo độ trễ p50/p95 thực tế trong môi trường của bạn thay vì dựa vào con số gián tiếp.
Điều gì xảy ra nếu mô hình tôi đang sử dụng bị ngừng hỗ trợ giữa dự án?
Đây chính xác là kịch bản mà việc ngừng hoạt động Veo 3.0 của Google (30 tháng 6 năm 2026) minh họa. Hãy xây dựng một chuỗi dự phòng và, nếu có thể, định tuyến thông qua một cổng kết nối duy trì các slug mô hình được cập nhật để việc ngừng hỗ trợ không yêu cầu phải viết lại mã.
Tạo khóa API TokenLab để so sánh các ID mô hình hiện tại trước khi bạn triển khai.
Nguồn
Giá quan sát ngày 2026-07-08
- Google AI Gemini API pricingQuan sát ngày 2026-07-08
- Google Cloud Agent Platform pricingQuan sát ngày 2026-07-08
- Google Gemini API modelsQuan sát ngày 2026-07-08
- TokenLab model directoryQuan sát ngày 2026-07-07



