Chọn Auto, TokenLab Verified hoặc Official cho mỗi yêu cầu, với giá được hiển thị ngay từ đầu.Xem có gì mới

DeepSeek V4 API cho lập trình: Định tuyến deepseek-v4-pro và deepseek-v4-flash

·19 tháng 9, 2026·24 phút đọc·Cập nhật 2 tháng 10, 2026·1529 lượt xem
#lập trình#AI API#TokenLab
DeepSeek V4 API cho lập trình: Định tuyến deepseek-v4-pro và deepseek-v4-flash

Gửi mọi bước của một phiên lập trình đến cùng một mô hình là chính sách định tuyến dễ dàng nhất, và thường cũng là chính sách đắt đỏ nhất. Hướng dẫn này chỉ ra cách sử dụng API DeepSeek V4 để lập trình trên TokenLab bằng cách chia nhỏ công việc giữa deepseek-v4-pro và deepseek-v4-flash. Chúng tôi đã đọc cả hai bản ghi mô hình từ API trực tiếp vào ngày 03/10/2026, và mọi thông tin dưới đây đều đến từ các bản ghi đó và tài liệu của TokenLab. Bạn sẽ nhận được bảng so sánh, ước tính chi phí thực tế, yêu cầu gọi công cụ (tool-calling), mã xử lý thử lại (retry) và dự phòng (fallback), cùng với kiểm tra tiền khởi chạy (preflight check).

Những điểm chính

  • Cả hai mô hình đều liệt kê giới hạn đầu vào 1.000.000 token, giới hạn đầu ra 384.000 token và ba định dạng yêu cầu giống nhau. Giá cả là sự khác biệt chính giữa chúng.
  • Theo giá niêm yết, deepseek-v4-pro đắt gấp 4,4 lần so với deepseek-v4-flash cho mỗi token đầu vào và đắt gấp 3,3 lần cho mỗi token đầu ra.
  • Trong ví dụ 20 lần gọi của chúng tôi, việc định tuyến 4 lần gọi đến pro và 16 lần đến flash tốn khoảng $0,18 vào giờ thấp điểm. Gửi cả 20 lần đến pro tốn khoảng $0,46.
  • Thử lại 429 sau Retry-After. Chỉ thử lại 500–504 khi retryable là true. Không bao giờ thử lại 400, 401, 402, 403, 404 hoặc 413 mà không thay đổi gì.
  • Danh mục liệt kê deepseek-v4.1-flash là đang hoạt động. Cả deepseek-v4-pro và deepseek-v4-flash đều không nêu tên mô hình thay thế.
  • Hãy đọc các giới hạn, định dạng và giá từ GET /v1/models/:model trước khi bạn định tuyến. Đừng mã hóa cứng (hard-code) một bảng đã sao chép.

API DeepSeek V4 cho lập trình: Danh mục nói gì

Chúng tôi đã lấy cả hai bản ghi vào ngày 03/10/2026. Bảng dưới đây so sánh chúng cạnh nhau. Giá tính bằng USD cho mỗi 1 triệu token, và giá trong danh mục được cập nhật lần cuối vào 2026-10-02T16:53:30.068Z.

Mục deepseek-v4-pro deepseek-v4-flash Nguồn, quan sát ngày 03/10/2026
Giới hạn ngữ cảnh (tối đa token đầu vào) 1.000.000 1.000.000 pro, flash
Giới hạn đầu ra (tối đa token đầu ra) 384.000 384.000 pro, flash
Các định dạng yêu cầu được chấp nhận anthropic_messages, openai_chat_completions, openai_responses anthropic_messages, openai_chat_completions, openai_responses pro, flash
Khả năng json-mode, prompt-cache, tool-use json-mode, prompt-cache, tool-use pro, flash
Đầu vào giờ thấp điểm $0,66 $0,15 pro, flash
Đầu ra giờ thấp điểm $1,98 $0,60 pro, flash
Đọc bộ nhớ đệm giờ thấp điểm $0,022 $0,003 pro, flash
Ghi bộ nhớ đệm giờ thấp điểm $0,66 không liệt kê pro, flash
Đầu vào giờ cao điểm $1,32 $0,30 pro, flash
Đầu ra giờ cao điểm $3,96 $1,20 pro, flash
Đọc bộ nhớ đệm giờ cao điểm $0,044 $0,006 pro, flash
Giai đoạn vòng đời đang hoạt động, phát hành 24/04/2026 đang hoạt động, phát hành 24/04/2026 pro, flash

Khối giá mặc định trong mỗi bản ghi khớp với mục giờ thấp điểm. Thời gian cao điểm khác nhau tùy theo bản ghi. Đối với deepseek-v4-pro, giá cao điểm áp dụng từ 09:00-12:00 và 14:00-18:00 giờ Bắc Kinh. Đối với deepseek-v4-flash, bản ghi cho biết các khung giờ cao điểm áp dụng vào các ngày trong tuần, không bao gồm các ngày lễ của Trung Quốc. Nó cho biết giờ thấp điểm bao gồm cuối tuần và các ngày lễ đó, nhưng không đưa ra khung giờ cụ thể. Hãy kiểm tra endpoint giá trước khi lập ngân sách xung quanh khung giờ flash.

Vòng đời và các mô hình DeepSeek mới hơn

Cả hai bản ghi đều hiển thị giai đoạn vòng đời đang hoạt động, với mô hình thay thế, deprecated_at và retired_at đều trống. Vì vậy, danh mục không lên lịch loại bỏ mô hình nào và không nêu tên người kế nhiệm cho bất kỳ mô hình nào.

Danh mục cũng liệt kê deepseek-v4.1-flash. Bản ghi của nó, được quan sát vào ngày 03/10/2026, đang hoạt động, không có ngày phát hành và không có mô hình thay thế. Nó có cùng giới hạn, định dạng và giá niêm yết như deepseek-v4-flash. Nó bổ sung reasoning và vision vào danh sách khả năng và hiển thị giá ghi bộ nhớ đệm là $0,15 vào giờ thấp điểm.

Đó là một ID mô hình riêng biệt, vì vậy bài viết này giữ nguyên chủ đề của nó. Chúng tôi khuyên bạn nên tự kiểm tra deepseek-v4.1-flash trên các tác vụ của mình trước khi thay thế nó vào. Danh mục cũng liệt kê deepseek-v4-flash-vision-exp, nhưng chúng tôi đã không đọc bản ghi của nó. Hãy xác minh nó trên trang Models nếu bạn cần.

Định tuyến deepseek-v4-pro và deepseek-v4-flash theo tác vụ

Hãy tưởng tượng một phiên tác nhân lập kế hoạch thay đổi trên năm mô-đun, viết các chỉnh sửa, sau đó tạo ra một tá các đoạn mã kiểm thử (test stubs). Bước đầu tiên cần nhiều ngữ cảnh và sự cẩn thận nhất. Bước cuối cùng mang tính lặp đi lặp lại và rẻ để làm lại. Danh mục không thể cho bạn biết ranh giới chất lượng nằm ở đâu. Hướng dẫn của TokenLab về các mô hình tác nhân lập trình, được quan sát vào ngày 03/10/2026, cho biết kết quả bảng xếp hạng không dự đoán được cách một mô hình tuân theo các hướng dẫn và công cụ của riêng bạn.

Phương pháp suy nghiệm (heuristic) ban đầu của chúng tôi giả định rằng mô hình đắt tiền hơn sẽ xứng đáng với chi phí của nó trong công việc đa tệp. Hãy coi đó là một giả thuyết để kiểm tra, không phải là một kết luận:

+-------------------------------------------------------------+
|                      Tác vụ đến                             |
+-------------------------------------------------------------+
                               |
         [Tác vụ có liên quan đến ngữ cảnh đa tệp,
          tương thích ngược, hoặc đánh giá bảo mật không?]
                               |
               +---------------+---------------+
               |                               |
             [Có]                            [Không]
               |                               |
               v                               v
       deepseek-v4-pro                 deepseek-v4-flash

Các tiêu chí đẩy một bước sang deepseek-v4-pro:

  • Sửa đổi logic trên nhiều tệp được import.
  • Đánh giá bảo mật hoặc lỗ hổng.
  • Tương thích ngược nghiêm ngặt trên các giao diện công khai.
  • Công việc nhiều lượt (multi-turn) nơi độ chính xác quan trọng hơn thời gian hoàn thành.

Các khung kiểm thử độc lập, định dạng lược đồ, docstrings và hoàn thiện cú pháp sẽ chuyển sang deepseek-v4-flash.

Để kiểm tra phương pháp suy nghiệm, hãy làm theo cùng một hướng dẫn. Cung cấp cho mỗi mô hình cùng một trạng thái kho lưu trữ, hướng dẫn, công cụ và giới hạn thời gian. Sau đó so sánh độ chính xác, các bài kiểm tra đã vượt qua, các thay đổi không cần thiết, tổng số token, chi phí cuối cùng và tần suất con người phải can thiệp. Lưu kết quả theo loại tác vụ, vì một mô hình có thể đánh giá tốt nhưng thực hiện kém.

Ước tính chi phí vòng lặp tác nhân lập trình

Các tác nhân gửi lại hướng dẫn, lịch sử, mã và kết quả công cụ trong mỗi lần gọi. Hướng dẫn chi phí, được quan sát vào ngày 03/10/2026, lưu ý rằng các phiên dài có thể tốn kém hơn nhiều so với một yêu cầu trò chuyện đơn lẻ. Chúng tôi đã tính toán số học dưới đây từ giá niêm yết. Kết quả là một ước tính, không phải hóa đơn đo lường.

Các giả định (của chúng tôi, không đo lường): một vòng lặp gồm 20 lần gọi mô hình, mỗi lần với 30.000 token đầu vào và 1.500 token đầu ra. Điều đó mang lại tổng cộng 600.000 token đầu vào và 30.000 token đầu ra.

Công thức là input_tokens / 1M × giá đầu vào + output_tokens / 1M × giá đầu ra. Giá lấy từ bảng trên.

Tất cả 20 lần gọi đến deepseek-v4-pro:

  • Giờ thấp điểm: 0,6 × $0,66 = $0,396 đầu vào, cộng 0,03 × $1,98 = $0,0594 đầu ra, tổng là $0,4554.
  • Giờ cao điểm: 0,6 × $1,32 = $0,792, cộng 0,03 × $3,96 = $0,1188, tổng là $0,9108.

Tất cả 20 lần gọi đến deepseek-v4-flash:

  • Giờ thấp điểm: 0,6 × $0,15 = $0,09, cộng 0,03 × $0,60 = $0,018, tổng là $0,108.
  • Giờ cao điểm: 0,6 × $0,30 = $0,18, cộng 0,03 × $1,20 = $0,036, tổng là $0,216.

Hỗn hợp: 4 lần gọi đến pro, 16 lần đến flash. Pro mang 120.000 token đầu vào và 6.000 token đầu ra. Flash mang 480.000 token đầu vào và 24.000 token đầu ra.

  • Giờ thấp điểm: pro là 0,12 × $0,66 + 0,006 × $1,98 = $0,0792 + $0,01188 = $0,09108. Flash là 0,48 × $0,15 + 0,024 × $0,60 = $0,072 + $0,0144 = $0,0864. Tổng là $0,17748.
  • Giờ cao điểm: pro là 0,12 × $1,32 + 0,006 × $3,96 = $0,1584 + $0,02376 = $0,18216. Flash là 0,48 × $0,30 + 0,024 × $1,20 = $0,144 + $0,0288 = $0,1728. Tổng là $0,35496.
Kịch bản Ước tính giờ thấp điểm Ước tính giờ cao điểm
20 lần gọi trên deepseek-v4-pro $0,4554 $0,9108
20 lần gọi trên deepseek-v4-flash $0,1080 $0,2160
4 pro + 16 flash $0,1775 $0,3550

Ước tính từ giá niêm yết được quan sát ngày 03/10/2026 (pro, flash).

Biến thể bộ nhớ đệm (giờ thấp điểm, giả định: 80% token đầu vào là đọc bộ nhớ đệm). Điều đó có nghĩa là 480.000 token đọc bộ nhớ đệm và 120.000 token không được lưu bộ nhớ đệm mỗi vòng lặp.

  • Pro: 0,48 × $0,022 = $0,01056, cộng 0,12 × $0,66 = $0,0792, cộng $0,0594 đầu ra, tổng là $0,14916.
  • Flash: 0,48 × $0,003 = $0,00144, cộng 0,12 × $0,15 = $0,018, cộng $0,018 đầu ra, tổng là $0,03744.

Biến thể này tính phí các token không được lưu bộ nhớ đệm theo giá đầu vào thông thường và bỏ qua phí ghi bộ nhớ đệm trên flash, điều mà bản ghi không liệt kê. Hãy xác nhận số lượng token được lưu bộ nhớ đệm trong phản hồi hoặc trong Usage trước khi bạn tin tưởng vào khoản giảm giá này. Hướng dẫn thanh toán cũng cảnh báo rằng giá thấp nhất trên mỗi token không phải lúc nào cũng là chi phí thấp nhất cho mỗi tác vụ hoàn thành, vì các lần thử lại sẽ cộng dồn.

Yêu cầu gọi công cụ cho tác nhân lập trình

Cả hai bản ghi đều liệt kê tool-use và cả hai đều chấp nhận openai_chat_completions. Yêu cầu dưới đây chỉ sử dụng các trường từ hướng dẫn gọi công cụ (được quan sát vào ngày 03/10/2026): model, messages và tools với type: "function". Chúng tôi đã thêm max_tokens, mà hướng dẫn thanh toán liệt kê như một cách để giới hạn độ dài phản hồi. Chúng tôi đã bỏ qua tool_choice, vì hướng dẫn đó chỉ ghi lại nó cho định dạng Responses.

curl https://api.tokenlab.sh/v1/chat/completions \
  -H "Authorization: Bearer $TOKENLAB_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "max_tokens": 2000,
    "messages": [
      {"role": "system", "content": "You are a software engineering assistant."},
      {"role": "user", "content": "The pagination test in tests/test_api.py fails. Find the cause."}
    ],
    "tools": [
      {
        "type": "function",
        "function": {
          "name": "read_file",
          "description": "Read a file from the repository",
          "parameters": {
            "type": "object",
            "properties": {"path": {"type": "string"}},
            "required": ["path"]
          }
        }
      },
      {
        "type": "function",
        "function": {
          "name": "run_tests",
          "description": "Run the test suite for one path",
          "parameters": {
            "type": "object",
            "properties": {"path": {"type": "string"}},
            "required": ["path"]
          }
        }
      }
    ]
  }'

Mô hình trả về tên hàm và các đối số trong tool_calls. Backend của bạn chạy công cụ. Vòng lặp sau đó chạy trong năm bước:

  1. Gửi tin nhắn cộng với định nghĩa công cụ.
  2. Đọc phản hồi cho tool_calls.
  3. Thực thi công cụ trong backend của riêng bạn.
  4. Nối kết quả công cụ theo cùng định dạng API.
  5. Tiếp tục cho đến khi mô hình trả về câu trả lời cuối cùng.

Hướng dẫn không hiển thị hình dạng tin nhắn kết quả công cụ nội tuyến. Hãy lấy nó từ tài liệu tham khảo Create Chat Completion (/api-reference/chat/create-completion) thay vì đoán.

Trước khi thực thi bất kỳ lệnh gọi nào, hãy xác thực các đối số và áp dụng các kiểm tra quyền của riêng bạn. Làm cho việc thực thi có tính lũy đẳng (idempotent), vì việc thử lại của client có thể lặp lại cùng một lệnh gọi công cụ. Giữ một định dạng API cho toàn bộ quá trình trao đổi, vì các định dạng đại diện cho trạng thái công cụ khác nhau.

Thử lại, Backoff và Dự phòng giữa hai mô hình

Hướng dẫn lỗi và hướng dẫn giới hạn tốc độ, cả hai đều được quan sát vào ngày 03/10/2026, thiết lập chính sách. Phân nhánh dựa trên trạng thái HTTP và code, không bao giờ dựa trên message.

Trạng thái Lặp lại cùng một yêu cầu? Hành động
400, 401, 402, 403, 404, 413 Không Sửa yêu cầu, khóa, số dư, quyền hoặc đầu vào
429 Có Đợi Retry-After; nếu không có, sử dụng exponential backoff với jitter
500–504 Chỉ khi retryable là true Tôn trọng retry_after và giới hạn số lần thử
Kết nối bị đóng trước khi có phản hồi Đôi khi Thử lại cẩn thận nếu một lệnh gọi công cụ có thể lặp lại tác dụng phụ
Luồng bị gián đoạn sau khi đầu ra đến Không Coi đó là không hoàn chỉnh; việc lặp lại có thể tạo ra đầu ra khác hoặc tính phí lần thứ hai

Hai trường hợp cần đặc biệt chú ý. Một 503 all_channels_failed hoặc 503 delivery_tier_unavailable không phải lúc nào cũng tạm thời. Khi retryable là false và retry_after bị thiếu, đừng lặp lại yêu cầu. Kiểm tra GET /v1/models trước khi chọn mô hình khác. Ngoài ra, context_length_exceeded sẽ không được khắc phục bằng cách chuyển đổi giữa hai mô hình này, vì cả hai đều liệt kê cùng giới hạn đầu vào 1.000.000 token.

Mã dưới đây áp dụng chính sách đó. Nó đặt max_retries=0 để SDK không thử lại sau lưng bạn. Mỗi mô hình có bốn lần thử và dự phòng chỉ chạy sau khi mô hình đầu tiên cạn kiệt các lỗi có thể thử lại.

import os
import random
import time
from openai import OpenAI, APIStatusError, APIConnectionError

client = OpenAI(
    api_key=os.environ["TOKENLAB_API_KEY"],
    base_url="https://api.tokenlab.sh/v1",
    timeout=30.0,
    max_retries=0,
)

FALLBACK = {
    "deepseek-v4-pro": "deepseek-v4-flash",
    "deepseek-v4-flash": "deepseek-v4-pro",
}

def error_fields(exc):
    body = getattr(exc, "body", None)
    if isinstance(body, dict):
        return body.get("error", body)
    return {}

def backoff(attempt):
    return min(30, 2 ** attempt + random.random())

def retry_delay(exc, attempt):
    """Số giây để đợi, hoặc None khi yêu cầu không được lặp lại."""
    if isinstance(exc, APIConnectionError):
        return backoff(attempt)
    fields = error_fields(exc)
    header = exc.response.headers.get("Retry-After")
    if exc.status_code == 429:
        return float(header) if header else backoff(attempt)
    if exc.status_code >= 500 and fields.get("retryable") is True:
        wait = fields.get("retry_after") or header
        return float(wait) if wait else backoff(attempt)
    return None

def chat_with_fallback(model, messages, tools=None, attempts=4):
    last_exc = None
    for candidate in (model, FALLBACK[model]):
        kwargs = {"model": candidate, "messages": messages}
        if tools:
            kwargs["tools"] = tools
        for attempt in range(attempts):
            try:
                return candidate, client.chat.completions.create(**kwargs)
            except (APIStatusError, APIConnectionError) as exc:
                delay = retry_delay(exc, attempt)
                if delay is None:
                    raise  # 4xx hoặc 5xx không thể thử lại: không lặp lại hoặc dự phòng
                last_exc = exc
                if attempt < attempts - 1:
                    time.sleep(delay)
        print(f"{candidate} đã cạn kiệt số lần thử, đang thử {FALLBACK[candidate]}")
    raise last_exc

def pick_model(is_complex):
    return "deepseek-v4-pro" if is_complex else "deepseek-v4-flash"

used, response = chat_with_fallback(
    pick_model(is_complex=False),
    [{"role": "user", "content": "Write a pytest case: an empty list returns 0 for sum_items()."}],
)
print(used, response.choices[0].message.content)

Luôn ghi nhật ký mô hình nào đã trả lời. Hướng dẫn tác nhân lập trình cảnh báo rằng dự phòng có thể thay đổi giá, giới hạn ngữ cảnh, định dạng công cụ hoặc kiểu đầu ra, vì vậy hãy thông báo cho người dùng khi mô hình thay đổi. Dự phòng từ flash sang pro làm tăng chi phí đầu vào khoảng gấp bốn lần theo giá niêm yết, vì vậy hãy cảnh báo về điều đó. Lưu ID yêu cầu từ các tiêu đề phản hồi với mỗi lần gọi để bộ phận hỗ trợ có thể truy vết lỗi.

Đọc giới hạn, định dạng và giá trước khi định tuyến

Tài liệu tham khảo Get a Model, được quan sát vào ngày 03/10/2026, mô tả GET /v1/models/:model. Phản hồi mang một đối tượng tokenlab với capabilities, pricing, max_input_tokens, max_output_tokens, accepted_request_formats và lifecycle. Một mô hình không xác định trả về 404 model_not_found. Hướng dẫn thanh toán cũng chỉ ra GET /v1/models/:model/pricing cho giá hiện tại.

import json
import urllib.request

def read_model(model_id):
    url = f"https://api.tokenlab.sh/v1/models/{model_id}"
    with urllib.request.urlopen(url, timeout=10) as resp:
        meta = json.load(resp)["tokenlab"]
    return {
        "max_input_tokens": meta.get("max_input_tokens"),
        "max_output_tokens": meta.get("max_output_tokens"),
        "formats": meta.get("accepted_request_formats"),
        "capabilities": meta.get("capabilities"),
        "lifecycle": meta.get("lifecycle"),
        "pricing": meta.get("pricing"),
    }

def preflight(model_id, input_tokens):
    info = read_model(model_id)
    problems = []
    if "openai_chat_completions" not in (info["formats"] or []):
        problems.append("chat completions not accepted")
    if "tool-use" not in (info["capabilities"] or []):
        problems.append("no tool-use capability")
    if info["max_input_tokens"] and input_tokens > info["max_input_tokens"]:
        problems.append("input exceeds max_input_tokens")
    return info, problems

for model_id in ("deepseek-v4-pro", "deepseek-v4-flash"):
    info, problems = preflight(model_id, input_tokens=30_000)
    print(model_id, json.dumps(info, indent=2), problems)

Chúng tôi in lifecycle và pricing ở dạng thô vì bằng chứng của bài viết này không hiển thị bố cục JSON chính xác của chúng bên trong phản hồi đó. Hãy kiểm tra đầu ra một lần, sau đó phân tích cú pháp các trường bạn cần. Tài liệu khuyên không nên mã hóa cứng các bảng giá đã sao chép, vì vậy hãy chạy kiểm tra khi khởi động hoặc theo lịch trình. Các endpoint khám phá công khai như GET /v1/models có giới hạn tốc độ riêng, vì vậy hãy lưu kết quả vào bộ nhớ đệm thay vì gọi nó cho mỗi yêu cầu.

Đối với giới hạn tốc độ, cấp độ Người dùng tiêu chuẩn cho phép 1.000 yêu cầu mỗi phút cho mỗi API key, được quan sát vào ngày 03/10/2026. Hướng dẫn cho biết cấu hình hoạt động có thể khác. Khi gặp 429, hãy tin tưởng vào các giá trị X-RateLimit-Limit và Retry-After được trả về thay vì bất kỳ con số nào đã sao chép.

Câu hỏi thường gặp

Tôi có thể gọi deepseek-v4-pro thông qua định dạng Anthropic Messages không?

Có. Cả hai bản ghi đều liệt kê anthropic_messages trong số các định dạng được chấp nhận, được quan sát vào ngày 03/10/2026. Hướng dẫn tác nhân lập trình đưa ra URL cơ sở Anthropic Messages là https://api.tokenlab.sh, không có hậu tố /v1 mà Chat Completions sử dụng. Các lược đồ công cụ khác nhau tùy theo định dạng, vì vậy hãy giữ một định dạng cho toàn bộ cuộc trò chuyện.

Tôi có nên thử lại lỗi 503 từ deepseek-v4-pro hoặc deepseek-v4-flash không?

Chỉ khi phần thân lỗi cho biết retryable là true, và sau đó đợi retry_after. Một 503 all_channels_failed với retryable: false có nghĩa là yêu cầu không có nguồn cung trong tầng Delivery đã chọn. Việc lặp lại nó sẽ không giúp ích gì. Kiểm tra GET /v1/models trước khi bạn chọn mô hình khác, như hướng dẫn lỗi mô tả.

deepseek-v4.1-flash có thay thế deepseek-v4-flash không?

Danh mục không nói như vậy. Vào ngày 03/10/2026, bản ghi deepseek-v4-flash không hiển thị mô hình thay thế, và deepseek-v4.1-flash hiển thị trạng thái đang hoạt động. Hai mô hình này chia sẻ giới hạn và giá niêm yết, và mô hình mới hơn bổ sung khả năng reasoning và vision. Hãy kiểm tra nó trên các tác vụ của bạn và chuyển đổi một cách có chủ đích theo ID mô hình.

Token được lưu bộ nhớ đệm có làm cho deepseek-v4-flash rẻ hơn trong vòng lặp tác nhân không?

Có thể. Bản ghi liệt kê giá đọc bộ nhớ đệm giờ thấp điểm là $0,003 cho mỗi 1 triệu token, so với $0,15 cho đầu vào thông thường. Hướng dẫn chi phí cho biết hãy xác nhận việc sử dụng token được lưu bộ nhớ đệm trong phản hồi hoặc trong Usage trước khi tin tưởng vào khoản giảm giá. Hành vi và giá bộ nhớ đệm khác nhau tùy theo mô hình.

Việc định tuyến đến deepseek-v4-flash có làm tăng giới hạn tốc độ của tôi không?

Không. Hướng dẫn giới hạn tốc độ cho biết một mô hình nhanh hơn không làm tăng giới hạn yêu cầu của tài khoản của bạn. Tốc độ mô hình, giới hạn token và giới hạn tốc độ tài khoản là các ràng buộc riêng biệt, và các giới hạn áp dụng cho mỗi API key.

Kiểm tra các mục deepseek-v4-pro và deepseek-v4-flash hiện tại trên trang mô hình TokenLab trước khi bạn thiết lập bộ định tuyến của mình.

Nguồn

Giá quan sát ngày 2026-10-03

Mô hình liên quan

Mô hình mới phát hành

Xây dựng với các mô hình trong hướng dẫn này

So sánh giá, thử route và biến nghiên cứu thành một lệnh gọi API chạy được.