Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

Anthropic: Claude Haiku 5.5

O modelo Claude mais rápido, desenvolvido para trabalhos de alto volume e sensíveis à latência, como classificação, extração, roteamento e tarefas de subagentes.
Comparar modelos
claude-haiku-5-5
DisponívelAnthropicChatEntrada em cache 90% mais barataNovo
Entrada / Saída-70%
$0.10 / $0.50$0.03 / $0.15
Contexto
1M
Lançado
7 de out. de 2026
Saída máxima
128K
Modalidades
VisãoChat
Capacidades
Uso de ferramentasCache de promptsRaciocínio

Sobre o Claude Haiku 5.5

Claude Haiku 5.5 é o modelo Claude pequeno e rápido da Anthropic, lançado em 7 de outubro de 2026 para trabalhos de alto volume e sensíveis à latência, como classificação, extração, roteamento e tarefas de subagentes. É o primeiro Haiku com esforço ajustável, permitindo que um único modelo responda a solicitações simples rapidamente e pense mais tempo em solicitações mais difíceis. A Anthropic o descreve como seu modelo mais rápido em velocidade padrão, com um corte de conhecimento em junho de 2026.

Pontos fortes

  • A Anthropic o descreve como seu modelo mais rápido em velocidade padrão, o que é adequado para suporte ao cliente em tempo real e uso de navegador.
  • É o primeiro Haiku com níveis de esforço, permitindo que um único modelo atenda a chats rápidos e tarefas de agentes mais longas.
  • A Anthropic relata grandes ganhos em relação ao Haiku 4.5 em benchmarks, incluindo OSWorld 2.1, GDPval-AA e Terminal-Bench 4.0.
  • Ele aceita entrada de texto e imagem e funciona como um subagente ao lado do Opus 5.5 ou Sonnet 5.5 em trabalhos de codificação, segundo a Anthropic.
  • O pensamento adaptativo está ativado por padrão, e a configuração de esforço controla o quanto o modelo pensa.

Quando usar outro modelo

  • A Anthropic afirma que o Sonnet 5.5 e o Opus 5.5 continuam sendo escolhas melhores para codificação agente complexa e trabalhos de final aberto.
  • Classificadores de segurança podem recusar uma solicitação com um motivo de recusa, e salvaguardas de cibersegurança ainda bloqueiam testes de penetração.
  • Orçamentos de pensamento manuais não são suportados; o pensamento adaptativo com a configuração de esforço os substitui.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Texto para textoMessages API
    POST/v1/messages
    Formato da API:
    curl https://api.tokenlab.sh/v1/messages \
      -H "Content-Type: application/json" \
      -H "x-api-key: sk-xxx" \
      -H "anthropic-version: 2023-06-01" \
      -d '{
        "model": "claude-haiku-5-5",
        "max_tokens": 1024,
        "messages": [
          {"role": "user", "content": "Hello!"}
        ]
      }'

Preço

O preço TokenLab aplica-se ao Verified, que é mais barato na maioria dos modelos. O preço oficial segue a tabela do criador e aplica-se à rota Official, que é mais confiável. O modo Auto cobra pela rota que finalizar o seu pedido.

Entrada tokens <= 100K

Por 1M Token
Preço oficial
Entrada $0.10 / Saída $0.50 / Leitura de cache $0.01 / Escrita de cache $0.125
Preço da TokenLab
Entrada $0.03 / Saída $0.15 / Leitura de cache $0.003 / Escrita de cache $0.0375
Desconto
-70%

Entrada tokens 100K-1M

Por 1M Token
Preço oficial
Entrada $0.50 / Saída $2.50 / Leitura de cache $0.05 / Escrita de cache $0.625
Preço da TokenLab
Entrada $0.15 / Saída $0.75 / Leitura de cache $0.015 / Escrita de cache $0.1875
Desconto
-70%
Preços de cache de prompt

Leitura de cache

Preço oficial
$0.01
Preço da TokenLab
$0.003
Desconto
-70%

Escrita de cache

Preço oficial
$0.125
Preço da TokenLab
$0.0375
Desconto
-70%
Taxas de ferramentas

Cobrado por chamada, apenas quando o modelo utiliza a ferramenta.

Pesquisa na web

Preço oficial
$0.01/busca
Preço da TokenLab
$0.003/busca
Desconto
-70%

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
As métricas aparecerão assim que os limites de privacidade e volume de dados forem atingidos.

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra Claude Haiku 5.5 no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar claude-haiku-5-5 com uma mensagem em /v1/messages. Exiba a resposta, latência e custo.

Casos de uso

Indicado para
  • Raciocínio
  • Visão
  • Classificação e roteamento de alto volume

    Classifique tickets, roteie solicitações e extraia campos de documentos em volume, onde a velocidade de resposta e a taxa de transferência constante são o que mais importa.

  • Subagentes em fluxos de trabalho de codificação

    Execute tarefas secundárias restritas, como pesquisar uma base de código ou resumir arquivos enquanto um modelo maior lidera o trabalho, um emparelhamento que a Anthropic destaca.

  • Suporte em tempo real e tarefas de navegador

    Responda a clientes em tempo real ou conduza etapas de navegador a partir de capturas de tela, onde o tempo de espera entre as interações molda a experiência.

  • Resumos e compactação

    Condense conversas longas, registros ou logs em resumos curtos e compacte o contexto de um agente entre as etapas.

Exemplos de prompt

Classifique cada um destes 50 tickets de suporte como cobrança, bug ou solicitação de recurso, e retorne uma lista JSON com o ID do ticket e a categoria.

Leia este documento e extraia o nome da empresa, ano fiscal, receita e lucro líquido para uma tabela. Marque qualquer valor que você não conseguiu encontrar.

Resuma esta conversa até o momento em seis tópicos que mantenham todas as decisões, perguntas em aberto e nomes de arquivos, para que um novo agente possa continuar o trabalho.

Este modelo tem preço condicional. Totais mensais de tokens sozinhos não produzem uma estimativa confiável; use o preço detalhado para a especificação da requisição, cache e janela aplicável.

FAQ

Em que o Claude Haiku 5.5 é melhor?

Trabalhos de escopo restrito e alto volume: classificação, extração, roteamento, resumos, compactação e tarefas de subagentes. A Anthropic o comercializa como seu modelo mais rápido e afirma que o Sonnet 5.5 ou o Opus 5.5 continuam sendo melhores para codificação agente complexa.

Com qual nível de esforço devo começar no Haiku 5.5?

A Anthropic recomenda o nível médio, o padrão, para a maioria dos trabalhos, incluindo codificação agente. Use baixo para chat, tarefas curtas de ferramentas e solicitações simples de alto volume, embora em prompts de agentes longos ele possa pular uma pesquisa ou parar mais cedo. Use alto para seguir instruções estritas, e xhigh ou max apenas onde seus próprios testes mostrarem um ganho.

Posso desativar o pensamento no Haiku 5.5?

Parcialmente. O pensamento é adaptativo e ativado por padrão. Enviar com o pensamento desativado funciona nos níveis de esforço baixo, médio e alto, e retorna um erro em xhigh e max. A maneira preferida da Anthropic de obter menos pensamento é um nível de esforço mais baixo. O pensamento conta para o limite de saída, então deixe espaço para ele.

Como o Haiku 5.5 difere do Haiku 4.5?

A Anthropic relata grandes ganhos em benchmarks, uma janela de contexto e limite de saída maiores, esforço ajustável e pensamento adaptativo no lugar de orçamentos de pensamento manuais. Ele usa o tokenizador mais novo, portanto, o mesmo texto conta como mais tokens, e seus classificadores de segurança podem retornar recusas que o Haiku 4.5 não retornava.

Quando devo escolher o Sonnet 5.5 em vez do Haiku 5.5?

Escolha o Sonnet 5.5 ou o Opus 5.5 para codificação agente complexa, sessões de terminal longas e tarefas que precisam de julgamento sustentado, onde a Anthropic diz que eles permanecem mais fortes. Escolha o Haiku 5.5 quando a velocidade e o volume importarem e a tarefa for de escopo restrito, como classificação, resumos ou trabalho de subagente.

Quanto custa o Claude Haiku 5.5?

No TokenLab, Claude Haiku 5.5 custa Entrada $0.03 / Saída $0.15 Por 1M Token. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual a janela de contexto e o limite de saída do Claude Haiku 5.5?

O Claude Haiku 5.5 aceita até 1.000.000 tokens de contexto e gera até 128.000 tokens por resposta.

Qual endpoint o Claude Haiku 5.5 deve usar?

Use https://api.tokenlab.sh/v1/messages para Claude Haiku 5.5. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o Claude Haiku 5.5 suporta?

Claude Haiku 5.5 suporta Texto para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar Claude Haiku 5.5

Fontes

Revisado em 8 de out. de 2026

Mais da série Claude 5

Modelos relacionados