각 요청에 대해 Auto, TokenLab Verified 또는 Official를 선택할 수 있으며, 가격은 사전에 표시됩니다.새로운 기능 확인하기

Anthropic: Claude Haiku 5.5

가장 빠른 Claude 모델로, 분류, 추출, 라우팅, 하위 에이전트 작업과 같이 대량의 처리가 필요하고 지연 시간에 민감한 업무를 위해 설계되었습니다.
모델 비교
claude-haiku-5-5
사용 가능Anthropic채팅입력 캐싱 시 90% 할인신규
입력 / 출력-70%
$0.10 / $0.50$0.03 / $0.15
컨텍스트
1M
출시일
2026년 10월 7일
최대 출력
128K
모달리티
비전채팅
기능
도구 사용프롬프트 캐시추론

Claude Haiku 5.5 소개

Claude Haiku 5.5는 2026년 10월 7일에 출시된 Anthropic의 작고 빠른 Claude 모델로, 분류, 추출, 라우팅, 서브 에이전트 작업과 같이 대량의 처리가 필요하고 지연 시간에 민감한 작업에 적합합니다. Haiku 모델 중 최초로 노력(effort) 수준을 조절할 수 있어, 하나의 모델로 간단한 요청에는 빠르게 응답하고 어려운 요청에는 더 깊이 사고할 수 있습니다. Anthropic은 이 모델을 표준 속도에서 가장 빠른 모델로 정의하며, 지식 차단 시점은 2026년 6월입니다.

강점

  • Anthropic은 이 모델을 표준 속도에서 가장 빠른 모델로 정의하며, 실시간 고객 지원 및 브라우저 사용에 적합합니다.
  • Haiku 모델 중 최초로 노력 수준을 지원하여, 하나의 모델로 빠른 채팅 응답과 더 긴 에이전트 작업을 모두 수행할 수 있습니다.
  • Anthropic은 OSWorld 2.1, GDPval-AA, Terminal-Bench 4.0을 포함한 벤치마크에서 Haiku 4.5 대비 큰 성능 향상이 있었다고 보고합니다.
  • Anthropic에 따르면, 이 모델은 텍스트와 이미지 입력을 모두 지원하며 코딩 작업 시 Opus 5.5 또는 Sonnet 5.5와 함께 서브 에이전트로 작동합니다.
  • 적응형 사고(adaptive thinking) 기능이 기본적으로 활성화되어 있으며, 노력 설정(effort setting)을 통해 모델의 사고 수준을 제어할 수 있습니다.

다른 모델이 필요한 경우

  • Anthropic은 복잡한 에이전트형 코딩 및 개방형 작업에는 여전히 Sonnet 5.5와 Opus 5.5가 더 나은 선택이라고 밝히고 있습니다.
  • 안전 분류기가 거부 사유와 함께 요청을 거절할 수 있으며, 사이버 보안 보호 장치는 여전히 모의 해킹(penetration testing)을 차단합니다.
  • 수동 사고 예산(manual thinking budgets)은 지원되지 않으며, 노력 설정을 통한 적응형 사고가 이를 대체합니다.

시작하기

  1. API 키 만들기

    Console에서 키를 만들고 플랫폼의 모든 모델에 사용하세요.

  2. 첫 번째 요청 보내기

    사용 중인 언어의 예시를 복사하여 엔드포인트에 실행하세요.

    텍스트-텍스트Messages API
    POST/v1/messages
    API 형식:
    curl https://api.tokenlab.sh/v1/messages \
      -H "Content-Type: application/json" \
      -H "x-api-key: sk-xxx" \
      -H "anthropic-version: 2023-06-01" \
      -d '{
        "model": "claude-haiku-5-5",
        "max_tokens": 1024,
        "messages": [
          {"role": "user", "content": "Hello!"}
        ]
      }'

가격 책정

Verified는 TokenLab 가격이 적용되어 대부분의 모델에서 더 저렴합니다. Official은 제조사가 책정한 공식 가격으로 더 안정적인 경로를 제공합니다. Auto는 요청을 완료한 경로의 가격으로 자동 청구합니다.

입력 토큰 <= 100K

1M Token 당
Official 가격
입력 $0.10 / 출력 $0.50 / 캐시 읽기 $0.01 / 캐시 쓰기 $0.125
TokenLab 가격
입력 $0.03 / 출력 $0.15 / 캐시 읽기 $0.003 / 캐시 쓰기 $0.0375
할인
-70%

입력 토큰 100K-1M

1M Token 당
Official 가격
입력 $0.50 / 출력 $2.50 / 캐시 읽기 $0.05 / 캐시 쓰기 $0.625
TokenLab 가격
입력 $0.15 / 출력 $0.75 / 캐시 읽기 $0.015 / 캐시 쓰기 $0.1875
할인
-70%
프롬프트 캐시 가격

캐시 읽기

Official 가격
$0.01
TokenLab 가격
$0.003
할인
-70%

캐시 쓰기

Official 가격
$0.125
TokenLab 가격
$0.0375
할인
-70%
도구 사용료

모델이 도구를 사용할 때만 호출당 비용이 부과됩니다.

웹 검색

Official 가격
$0.01/검색
TokenLab 가격
$0.003/검색
할인
-70%

사용량 및 활동

성공률은 완료된 요청의 비율입니다. 지연 시간은 전체 응답에 걸리는 시간이며, P95는 요청의 95%가 해당 시간 내에 완료되었음을 의미합니다.

사용량 및 가용성

지난 24시간
요청
성공률
P95 지연 시간
총 토큰
모델 성능
개인정보 보호 및 데이터 볼륨 임계값이 충족되면 메트릭이 표시됩니다.

데이터는 상태 확인을 제외한 집계된 사용자 요청을 기반으로 합니다.

Console에서 열기

Console에서 Claude Haiku 5.5을 열고 프롬프트를 수정하거나 전송하세요.

/v1/messages에서 claude-haiku-5-5로 짧은 메시지를 테스트합니다. 응답, 지연 시간, 비용을 확인하세요.

사용 사례

적합한 용도
  • 추론
  • 비전
  • 대량 분류 및 라우팅

    응답 속도와 안정적인 처리량이 가장 중요한 대량의 티켓 분류, 요청 라우팅, 문서 내 필드 추출 작업에 사용됩니다.

  • 코딩 워크플로우 내 서브 에이전트

    Anthropic이 강조하는 방식처럼, 더 큰 모델이 전체 작업을 주도하는 동안 코드베이스 검색이나 파일 요약과 같은 세부적인 보조 작업을 수행합니다.

  • 실시간 지원 및 브라우저 작업

    턴 사이의 대기 시간이 사용자 경험을 결정짓는 실시간 고객 응대나 스크린샷을 기반으로 한 브라우저 제어 작업에 사용됩니다.

  • 요약 및 압축

    긴 대화, 서류, 로그를 짧은 요약본으로 압축하거나 단계 사이에서 에이전트의 컨텍스트를 압축합니다.

프롬프트 예제

이 50개의 지원 티켓을 각각 청구, 버그, 기능 요청으로 분류하고 티켓 ID와 카테고리가 포함된 JSON 목록을 반환하세요.

이 서류를 읽고 회사명, 회계연도, 매출, 순이익을 표로 정리하세요. 찾을 수 없는 값은 표시하세요.

새로운 에이전트가 작업을 이어받을 수 있도록, 지금까지의 대화를 모든 결정 사항, 미해결 질문, 파일 이름을 포함하여 6개의 글머리 기호로 요약하세요.

이 모델은 조건부 요금제입니다. 월간 토큰 총량만으로는 신뢰할 수 있는 견적을 낼 수 없습니다. 요청 사양, 캐시, 해당 시간대에 맞는 상세 요금을 사용하세요.

FAQ

Claude Haiku 5.5는 어떤 작업에 가장 적합한가요?

분류, 추출, 라우팅, 요약, 압축, 서브 에이전트 작업과 같이 범위가 좁고 대량으로 처리해야 하는 작업에 적합합니다. Anthropic은 이 모델을 가장 빠른 모델로 마케팅하고 있으며, 복잡한 에이전트형 코딩에는 Sonnet 5.5나 Opus 5.5가 더 적합하다고 밝히고 있습니다.

Haiku 5.5에서 어떤 노력 수준으로 시작해야 하나요?

Anthropic은 에이전트형 코딩을 포함한 대부분의 작업에 기본값인 'medium'을 권장합니다. 채팅, 짧은 도구 작업, 간단한 대량 요청에는 'low'를 사용하되, 긴 에이전트 프롬프트에서는 검색을 건너뛰거나 조기에 종료할 수 있습니다. 엄격한 지시 이행이 필요할 때는 'high'를 사용하고, 'xhigh'나 'max'는 자체 테스트를 통해 성능 향상이 확인된 경우에만 사용하세요.

Haiku 5.5에서 사고 기능을 끌 수 있나요?

부분적으로 가능합니다. 사고 기능은 적응형이며 기본적으로 켜져 있습니다. 사고 기능을 비활성화한 상태로 요청을 보내면 low, medium, high 노력 수준에서는 작동하지만, xhigh와 max에서는 오류가 반환됩니다. Anthropic이 권장하는 사고량을 줄이는 방법은 더 낮은 노력 수준을 설정하는 것입니다. 사고 과정도 출력 제한에 포함되므로 충분한 여유를 두어야 합니다.

Haiku 5.5는 Haiku 4.5와 어떻게 다른가요?

Anthropic은 벤치마크 성능의 대폭 향상, 더 긴 컨텍스트 윈도우 및 출력 제한, 조절 가능한 노력 수준, 수동 사고 예산을 대체하는 적응형 사고 기능을 보고합니다. 더 새로운 토크나이저를 사용하므로 동일한 텍스트라도 더 많은 토큰으로 계산되며, 안전 분류기가 Haiku 4.5에서는 없던 거절 응답을 반환할 수 있습니다.

Haiku 5.5 대신 Sonnet 5.5를 선택해야 하는 경우는 언제인가요?

복잡한 에이전트형 코딩, 긴 터미널 세션, 지속적인 판단력이 필요한 작업 등 Anthropic이 더 강력하다고 평가하는 작업에는 Sonnet 5.5나 Opus 5.5를 선택하세요. 속도와 대량 처리가 중요하고 분류, 요약, 서브 에이전트 작업처럼 범위가 좁은 작업에는 Haiku 5.5를 선택하세요.

Claude Haiku 5.5 의 가격은 얼마인가요?

TokenLab 에서 Claude Haiku 5.5 은 입력 $0.03 / 출력 $0.15 1M Token 당 입니다. 자세한 내역은 위 가격 표를 확인하세요. 요금은 청구 단위, 사양, 사용량에 따라 달라집니다. 모델의 상세 요금에서 동일한 조건끼리 비교하세요. 단일 요금으로 총비용이 결정되지 않습니다.

Claude Haiku 5.5의 컨텍스트 윈도우와 출력 제한은 어떻게 되나요?

Claude Haiku 5.5은 최대 1,000,000 토큰의 컨텍스트를 지원하며, 한 번의 응답으로 최대 128,000 토큰까지 출력합니다.

Claude Haiku 5.5 은 어떤 엔드포인트를 써야 하나요?

Claude Haiku 5.5에 대해 https://api.tokenlab.sh/v1/messages를 사용하세요. 아래 요청 예시는 일치하는 코드 형태를 보여줍니다.

Claude Haiku 5.5 은 어떤 오퍼레이션을 지원하나요?

Claude Haiku 5.5은(는) 텍스트-텍스트을(를) 지원합니다. 엔드포인트와 요청 예시를 보려면 위에서 작업을 선택하세요.

Claude Haiku 5.5 비교하기

출처

2026. 10. 8. 검토 완료

Claude 5의 다른 모델

관련 모델