Chọn Auto, TokenLab Verified hoặc Official cho mỗi yêu cầu, với giá được hiển thị ngay từ đầu.Xem có gì mới

Các mô hình AI giá rẻ tốt nhất cho Agent: Chi phí và các dạng lỗi thường gặp

·19 tháng 9, 2026·21 phút đọc·Cập nhật 26 tháng 9, 2026·1507 lượt xem
#Tác nhân AI#Tối ưu hóa chi phí LLM#Điều hướng mô hình#Công cụ lập trình
Các mô hình AI giá rẻ tốt nhất cho Agent: Chi phí và các dạng lỗi thường gặp

Trong pipeline của chúng tôi, mô hình có giá rẻ nhất trên mỗi token hiếm khi là mô hình rẻ nhất trên mỗi tác vụ hoàn thành. Khi chúng tôi thử nghiệm các mô hình AI giá rẻ tốt nhất cho các agent, các token đầu ra từ việc gọi công cụ (tool calls), sửa lỗi JSON và suy luận theo chuỗi tư duy (chain-of-thought) chiếm phần lớn chi phí. DeepSeek V4 Flash, Gemini 3.5 Flash, Claude Sonnet 5, GPT-5.5, GLM-5.2 và Laguna XS 2.1 là các ví dụ SSOT (Single Source of Truth) hiện tại mà chúng ta có thể thảo luận. Giá trong danh mục TokenLab dưới đây được ghi nhận vào ngày 19/09/2026; giá từ bên ngoài chưa được cập nhật ngày tháng và cần xác nhận từ nhà cung cấp. Chúng tôi không công bố benchmark về độ trễ vì không có tập dữ liệu kiểm soát về TTFT, tokens/giây hoặc tỷ lệ thử lại (retry-rate) cho các lộ trình này tại thời điểm làm mới. Hãy coi đây là danh sách rút gọn về chi phí và các dạng lỗi, sau đó hãy tự benchmark độ trễ trong vòng lặp của riêng bạn.

Những điểm chính cần lưu ý

  • Chi phí đầu ra (output) thúc đẩy chi tiêu cho agent nhiều hơn chi phí đầu vào (input). Các agent tạo ra nhiều token thông qua việc gọi công cụ, thử lại và JSON hơn là số lượng chúng tiêu thụ mỗi lượt.
  • Trong số các ví dụ SSOT hiện tại với giá trong danh mục TokenLab, DeepSeek V4 Flash là dòng có chi phí đầu ra thấp nhất mà chúng tôi có thể xác minh tại đây với mức $0.147 cho đầu vào / $0.294 cho đầu ra trên mỗi MTok.
  • Việc trùng lặp tên mô hình là có thật. DeepSeek V4 Flash xuất hiện ở hai mức giá: $0.147/$0.294 trong danh mục TokenLab và $0.09/$0.18 trong một danh sách bên ngoài.
  • Giá tạo video và hình ảnh (PixVerse, fal, Black Forest Labs) không phải là bằng chứng cho giá token LLM. Nó không bao giờ nên xuất hiện như một trích dẫn cho chi phí của text-agent, và chúng tôi đã tách riêng nó ra bên dưới.
  • Giá so sánh bên ngoài cho Claude Sonnet 5, GLM-5.2, Kimi K2.7 Code, Qwen3.7 Plus và các mô hình khác thiếu URL nguồn công khai có ngày tháng cụ thể. Hãy xác nhận chúng với trang giá của từng nhà cung cấp trước khi lập ngân sách.
  • Rẻ nhất trên mỗi token không tự động đồng nghĩa với rẻ nhất trên mỗi tác vụ. Một mô hình thất bại khi gọi công cụ hoặc cắt ngắn JSON sẽ buộc phải thử lại, điều này làm mất đi các khoản tiết kiệm.

Ảnh chụp nguồn và các dạng lỗi

Nguồn Loại nội dung Ngày quan sát Mức độ liên quan đến bài viết này
Tài liệu nền tảng PixVerse (docs.platform.pixverse.ai) Giá tạo video 08/07/2026 Không dùng cho các khẳng định về LLM - chỉ dành cho video, bao gồm để minh bạch
Trang mô hình fal PixVerse V6 (fal.ai/pixverse-v6) Giá tạo video 08/07/2026 Không dùng cho các khẳng định về LLM - chỉ dành cho video
Tài liệu giá Black Forest Labs (docs.bfl.ml) Giá tạo hình ảnh 08/07/2026 Không dùng cho các khẳng định về LLM - chỉ dành cho hình ảnh
Danh mục mô hình nội bộ TokenLab Giá LLM & media bên thứ nhất 19/09/2026 Nguồn chính cho tất cả giá trong danh mục TokenLab bên dưới
Trang giá của từng nhà cung cấp (OpenAI, Anthropic, Google, DeepSeek, Moonshot, Qwen, MiniMax, Z.ai) Giá LLM Không có ngày tháng trong tập dữ liệu này Phải được xác minh độc lập trước khi đưa ra các khẳng định về ngân sách công khai

Các nguồn PixVerse, fal và BFL tồn tại trong tập dữ liệu nghiên cứu của chúng tôi vì chúng tôi đã thu thập chúng trong quá trình quét giá media rộng hơn. Chúng mô tả việc tính phí video theo giây và chi phí tín dụng theo hình ảnh, vốn không liên quan đến giá LLM theo token. Chúng tôi liệt kê chúng ở đây để độc giả thấy lý do tại sao chúng tôi loại trừ chúng. Chúng tôi không sử dụng chúng cho các khẳng định về LLM.

Trong pipeline của mình, chúng tôi ghi lại tỷ lệ thử lại khi gọi công cụ, JSON bị cắt ngắn, các cuộc gọi công cụ bị bỏ lỡ và các đối số hàm bị ảo giác cùng với chi tiêu token. Chúng tôi không có tập dữ liệu tỷ lệ thử lại được kiểm soát cho các lộ trình này tại thời điểm làm mới, vì vậy chúng tôi không thể công bố tỷ lệ. Ví dụ, một mô hình giá $0.05/MTok mà thất bại 15% các cuộc gọi công cụ có thể tốn kém hơn trong việc thử lại so với một mô hình $1/MTok mà chỉ thất bại 2%. Phép toán về dạng lỗi đó, chứ không phải giá niêm yết, mới là thứ nên thúc đẩy lựa chọn phân khúc giá rẻ của bạn.

So sánh mô hình và chi phí cho các mô hình AI giá rẻ tốt nhất cho Agent

Tất cả giá bên dưới là danh sách trong danh mục của chính TokenLab (theo token, biểu thị dưới dạng $/MTok), được quan sát vào ngày 19/09/2026. Đây là cơ sở chính xác cho các khẳng định về chi phí LLM agent trong bài viết này.

Mô hình Nhà cung cấp Input $/MTok Output $/MTok Độ phù hợp với Agent
DeepSeek V4 Flash DeepSeek $0.147 $0.294 Tùy chọn SSOT hiện tại có chi phí đầu ra rẻ nhất trong danh mục của TokenLab; xác nhận ID mô hình chính xác trước khi so sánh với báo giá bên ngoài
Gemini 3.5 Flash Google $1.50 $9.00 Các bước agent đa phương thức (sử dụng công cụ hình ảnh + văn bản)
Claude Sonnet 5 Anthropic $2.00 $10.00 Dành cho bước xác minh/QA cuối cùng trên đầu ra của agent
GPT-5.5 OpenAI $5.00 $30.00 Dự phòng cho việc lập kế hoạch phức tạp hoặc lựa chọn công cụ mơ hồ
Claude Opus 4.8 Anthropic $5.00 $25.00 So sánh hàng đầu; hiếm khi được biện minh bên trong vòng lặp agent
Claude Fable 5 Anthropic $10.00 $50.00 Trần cao cấp
GLM-5.2 Z.ai $0.93 $3.00 Ví dụ về trọng số mở cho định tuyến chi phí thấp
Kimi K2.7 Code Moonshot AI $0.74 $3.50 Ví dụ về agent lập trình
Qwen3.7 Plus Alibaba/Qwen $0.32 $1.28 Ví dụ về định tuyến chi phí thấp
MiniMax M3 MiniMax $0.30 $1.20 Ví dụ về định tuyến chi phí thấp
DeepSeek V4 Pro DeepSeek $0.441 $0.882 Các tác vụ phụ suy luận nặng hơn trong cùng một gia đình

Chúng tôi giữ các số liệu bên ngoài bên dưới để đảm bảo tính liên tục của việc kiểm toán và đánh dấu mỗi hàng là chưa được xác minh. Không sử dụng chúng để lập ngân sách. Chi tiết chính xác phải được xác nhận dựa trên tài liệu hiện tại.

Mô hình Nhà cung cấp Input $/MTok Output $/MTok Trạng thái xác minh
DeepSeek V4 Flash (danh sách bên ngoài) DeepSeek $0.09 $0.18 Khác với danh mục TokenLab ở trên - xác nhận sản phẩm/phân khúc nào mà điều này đề cập đến; không có URL nguồn có ngày tháng trong tập dữ liệu của chúng tôi
MiniMax M3 MiniMax $0.30 $1.20 Không có URL nguồn có ngày tháng trong tập dữ liệu của chúng tôi; xác nhận dựa trên tài liệu nhà cung cấp
Qwen3.7 Plus Alibaba/Qwen $0.32 $1.28 Không có URL nguồn có ngày tháng trong tập dữ liệu của chúng tôi; xác nhận dựa trên tài liệu nhà cung cấp
Kimi K2.7 Code Moonshot AI $0.74 $3.50 Không có URL nguồn có ngày tháng trong tập dữ liệu của chúng tôi; xác nhận dựa trên tài liệu nhà cung cấp
GLM-5.2 Z.ai $0.93 $3.00 Không có URL nguồn có ngày tháng trong tập dữ liệu của chúng tôi; xác nhận dựa trên tài liệu nhà cung cấp
Claude Sonnet 5 Anthropic $2.00 $10.00 Không có URL nguồn có ngày tháng trong tập dữ liệu của chúng tôi; xác nhận dựa trên tài liệu nhà cung cấp
Claude Opus 4.8 Anthropic $5.00 $25.00 Không có URL nguồn có ngày tháng trong tập dữ liệu của chúng tôi; xác nhận dựa trên tài liệu nhà cung cấp
GPT-5.5 Batch/Flex OpenAI $2.50 $15.00 Không có URL nguồn có ngày tháng trong tập dữ liệu của chúng tôi; không phải hàng GPT-5.5 tiêu chuẩn
GPT-5.5 OpenAI $5.00 $30.00 Không có URL nguồn có ngày tháng trong tập dữ liệu của chúng tôi; xác nhận dựa trên tài liệu nhà cung cấp
Claude Fable 5 Anthropic $10.00 $50.00 Không có URL nguồn có ngày tháng trong tập dữ liệu của chúng tôi; xác nhận dựa trên tài liệu nhà cung cấp

Các mức giá trong danh mục đã ngừng hoạt động không còn khớp với tên mô hình SSOT hiện tại. Chúng tôi giữ lại các con số để đảm bảo tính liên tục của việc kiểm toán, nhưng chúng tôi không định tuyến công việc agent mới đến các phân khúc không tên này nếu không có xác nhận từ nhà cung cấp.

Phân khúc đã ngừng hoạt động hoặc không phải SSOT Input $/MTok Output $/MTok Trạng thái
Phân khúc chi phí cực thấp đã ngừng hoạt động $0.05 $0.40 Không còn là ví dụ SSOT hiện tại; xác nhận người kế nhiệm trước khi sử dụng
Phân khúc flash-lite chi phí thấp đã ngừng hoạt động $0.25 $1.50 Không còn là ví dụ SSOT hiện tại; ánh xạ tới Gemini 3.5 Flash hoặc DeepSeek V4 Flash và xác nhận
Phân khúc mini chi phí thấp đã ngừng hoạt động $0.25 $2.00 Không còn là ví dụ SSOT hiện tại; ánh xạ tới Claude Sonnet 5 hoặc DeepSeek V4 Flash và xác nhận
Phân khúc xác thực nhỏ đã ngừng hoạt động $1.00 $5.00 Không còn là ví dụ SSOT hiện tại; ánh xạ tới Claude Sonnet 5 và xác nhận
Phân khúc dự phòng tầm trung đã ngừng hoạt động $1.25 $10.00 Không còn là ví dụ SSOT hiện tại; ánh xạ tới GPT-5.5 và xác nhận
Trần cao cấp đã ngừng hoạt động $15.00 $120.00 Không còn là ví dụ SSOT hiện tại; ánh xạ tới GPT-5.5 hoặc Claude Fable 5 và xác nhận

Ghi chú triển khai cho các mô hình AI giá rẻ tốt nhất cho Agent

  1. Phân tầng agent của bạn theo tác vụ, không phải theo một mô hình rẻ nhất duy nhất. Định tuyến các tác vụ định tuyến, phân loại và lựa chọn công cụ đến DeepSeek V4 Flash hoặc Gemini 3.5 Flash. Leo thang việc lập kế hoạch nhiều bước lên DeepSeek V4 Pro hoặc GPT-5.5. Dành riêng Claude Sonnet 5 cho việc xác minh câu trả lời cuối cùng.
  2. Giới hạn token đầu ra một cách quyết liệt ở phân khúc giá rẻ. Vì chi phí đầu ra chiếm ưu thế trong chi tiêu của agent, hãy đặt giới hạn max-token chặt chẽ trên các cuộc gọi DeepSeek V4 Flash và Gemini 3.5 Flash. Chỉ cho phép tạo văn bản dài hơn ở phân khúc leo thang.
  3. Ghi lại các dạng lỗi theo mô hình, không chỉ chi phí mỗi cuộc gọi. Theo dõi JSON bị cắt ngắn, các cuộc gọi công cụ bị bỏ lỡ và các đối số hàm bị ảo giác tách biệt với chi tiêu token. Ví dụ, một mô hình $0.05/MTok mà thất bại 15% các cuộc gọi công cụ có thể tốn kém hơn trong việc thử lại so với một mô hình $1/MTok mà chỉ thất bại 2%.
  4. Ghim ID mô hình chính xác trong mã, không bao giờ dùng bí danh. Với sự trùng lặp tên hiển thị ở trên (hai mức giá DeepSeek V4 Flash khác nhau), hãy hardcode chuỗi nhà cung cấp và mô hình đầy đủ. Xác minh lại giá trên mỗi bản cập nhật của nhà cung cấp.
  5. Kiểm tra lại giá bên ngoài hàng quý. Bất cứ thứ gì không có URL nguồn có ngày tháng trong bài viết này nên được lấy lại từ trang giá trực tiếp của nhà cung cấp trước khi nó xuất hiện trong ước tính chi phí dành cho khách hàng.

Dưới đây là bản phác thảo định tuyến sử dụng các tên mô hình trong danh mục trong bài viết này. Hình dạng yêu cầu TokenLab chính xác và các trường lỗi gọi công cụ phải được xác nhận trong tài liệu API TokenLab trước khi sử dụng trong sản xuất.

Routing sketch, not a TokenLab API contract. Confirm the request shape in the TokenLab API docs.
for model in ['DeepSeek V4 Flash', 'Gemini 3.5 Flash', 'Claude Sonnet 5']:
    retry once if the tool call is missing or the JSON is truncated
    if the response contains a valid tool call and valid JSON:
        return the response
    log the failure mode for this model
raise an error after the final tier fails

Bản phác thảo này cho thấy ranh giới thử lại: bắt lỗi gọi công cụ, ghi lại dạng lỗi, sau đó chuyển sang mô hình tiếp theo. Xác nhận hình dạng yêu cầu và các trường lỗi trong tài liệu API TokenLab hiện tại trước khi đưa vào sản xuất.

TokenLab phù hợp với việc định tuyến Agent như thế nào

  • Một danh mục duy nhất giúp giảm bớt việc quản lý tài khoản của nhiều nhà cung cấp. TokenLab cung cấp các phân khúc giá của OpenAI, Google, Anthropic và DeepSeek dưới một API và bề mặt thanh toán. Việc chuyển đổi một bước quy trình làm việc từ DeepSeek V4 Flash sang Gemini 3.5 Flash trở thành một thay đổi cấu hình, không phải là một tích hợp mới.
  • Giá cả bên thứ nhất, có ngày tháng mà bạn có thể kiểm toán. Không giống như các báo giá bên thứ ba rời rạc, các con số trong danh mục TokenLab trong bài viết này được lấy từ danh sách của chính nền tảng được quan sát vào ngày 19/09/2026. Đó là lý do tại sao chúng là những mức giá duy nhất ở đây được trình bày mà không có cảnh báo "phải xác minh".
  • Phân tầng tích hợp cho các pipeline agent. Vì TokenLab lưu trữ cả các mô hình phân khúc giá rẻ và phân khúc leo thang cạnh nhau, bạn có thể A/B test chi phí và tỷ lệ lỗi trên DeepSeek V4 Flash, Gemini 3.5 Flash và Claude Sonnet 5. Bạn không cần phải thiết kế lại logic định tuyến của agent.

Đọc thêm

Câu hỏi thường gặp

Tại sao tôi thấy hai mức giá cho DeepSeek V4 Flash?

DeepSeek V4 Flash xuất hiện ở hai mức giá trong tập nguồn của chúng tôi: $0.147/$0.294 trong danh mục của TokenLab và $0.09/$0.18 trong một danh sách bên ngoài. Tên mô hình được sử dụng lại và định giá lại trên các nhà cung cấp và đại lý. Hãy ghim ID nhà cung cấp và mô hình chính xác trong mã, sau đó xác minh lại dựa trên tài liệu trực tiếp của nhà cung cấp thay vì chỉ tin vào một cái tên.

Tôi có thể sử dụng giá tham khảo bên ngoài để lập ngân sách không?

Chưa. Các hàng đó thiếu URL nguồn có ngày tháng trong tập nguồn của chúng tôi, vì vậy chúng tôi đánh dấu chúng là cần xác nhận từ nhà cung cấp. Các con số trong danh mục TokenLab là cơ sở lập kế hoạch, và bảng bên ngoài là điểm khởi đầu cho việc xác minh của riêng bạn, không phải là con số cuối cùng. Chi tiết chính xác phải được xác nhận dựa trên tài liệu hiện tại.

Mô hình SSOT hiện tại nào là rẻ nhất cho một agent sản xuất?

Theo chi phí đầu ra trong số các ví dụ SSOT hiện tại với giá trong danh mục TokenLab, DeepSeek V4 Flash là mức thấp nhất mà chúng tôi có thể xác minh tại đây với $0.294/MTok đầu ra. Danh sách bên ngoài cho thấy $0.18/MTok đầu ra, nhưng con số đó cần xác nhận từ nhà cung cấp. Hãy đo lường mức rẻ nhất sau khi tính đến tỷ lệ thử lại trên lược đồ gọi công cụ cụ thể của bạn.

Tại sao PixVerse, fal và BFL được trích dẫn nếu bài viết này nói về giá LLM?

Chúng không được trích dẫn làm bằng chứng cho bất kỳ khẳng định giá LLM nào. Chúng chỉ xuất hiện trong bảng Ảnh chụp nguồn để minh bạch về quá trình nghiên cứu rộng hơn của chúng tôi và được đánh dấu rõ ràng là không sử dụng cho các khẳng định về LLM. Mọi con số đô la trong bảng So sánh mô hình và chi phí đều đến từ danh mục của chính TokenLab hoặc được gắn cờ là chưa được xác minh.

Việc thử lại khi gọi công cụ thay đổi lựa chọn mô hình rẻ nhất như thế nào?

Một mô hình giá rẻ mà thất bại khi gọi công cụ hoặc cắt ngắn JSON sẽ buộc phải thử lại, và những lần thử lại đó sẽ thêm các token đầu ra. Ví dụ, một mô hình $0.05/MTok mà thất bại 15% các cuộc gọi công cụ có thể tốn kém hơn trong việc thử lại so với một mô hình $1/MTok mà chỉ thất bại 2%. Trong pipeline của mình, chúng tôi ghi lại tỷ lệ thử lại theo mô hình và so sánh chi phí trên mỗi tác vụ hoàn thành, không phải chi phí trên mỗi token.

Khám phá danh mục mô hình TokenLab và bắt đầu so sánh chi phí ngay hôm nay: Danh mục mô hình TokenLab.

Nguồn

Giá quan sát ngày 2026-07-07

Mô hình liên quan

Mô hình mới phát hành

Xây dựng với các mô hình trong hướng dẫn này

So sánh giá, thử route và biến nghiên cứu thành một lệnh gọi API chạy được.