
Prompt Caching 비용 가이드: Cache Hits, Prefixes, 그리고 실제 API 비용
20,000-token 시스템 프롬프트는 2026-10-03에 관찰된 TokenLab 가격을 기준으로, claude-sonnet-5에서 캐시되지 않은 경우 1,000건의 요청당 약 $18.18, 캐시 적중 시 약 $2.00의 비용이 발생합니다.
각 요청에 대해 Auto, TokenLab Verified 또는 Official를 선택할 수 있으며, 가격은 사전에 표시됩니다.새로운 기능 확인하기
TokenLab 블로그

20,000-token 시스템 프롬프트는 2026-10-03에 관찰된 TokenLab 가격을 기준으로, claude-sonnet-5에서 캐시되지 않은 경우 1,000건의 요청당 약 $18.18, 캐시 적중 시 약 $2.00의 비용이 발생합니다.

OpenRouter와 TokenLab의 기술적 비교: OpenAI, Anthropic, Gemini 엔드포인트 전반에 걸친 단일 스키마 정규화와 다중 포맷 네이티브 게이트웨이 라우팅을 살펴봅니다.

OpenAI에서 TokenLab으로 마이그레이션하는 과정은 `base_url`과 `api_key`를 변경하는 것부터 시작하며, 이후 모델 ID, 스트리밍, tool calls, 에러 형태, 타임아웃 및 과금 체계를 최신 문서와 대조하여 확인해야 합니다.

코딩 에이전트는 모델 이름이 변경되었다고 해서 작동이 중단되어서는 안 됩니다. 다음은 MCP 모델 카탈로그를 통해 모델 선택을 런타임 조회 방식으로 전환하는 방법과 요청 예시, 라우팅 규칙, 그리고 검증 습관에 대한 내용입니다.

TokenLab의 날짜가 지난 4개 모델 스트리밍 샘플은 왜 첫 번째 가시 토큰(first visible token), 총 시간(total time), 초당 토큰 수(tokens per second)를 하니스(harness), 로그 기록용 헤더, 그리고 속도 제한(rate-limit) 계산과 함께 각각 별도로 측정해야 하는지를 보여줍니다.

모델 문자열이 변경되어 404 오류가 발생하는 것은 에이전트 루프를 시작하는 아주 좋지 않은 방법입니다. 다음은 `gemini-3.5-flash`를 고정(pin)하고, Google Cloud 요금 정보를 읽어오며, 서비스 종료(deprecation) 상황에서도 살아남는 루프를 구축하는 방법입니다.