Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

Anthropic: Claude Haiku 5.5

El modelo Claude más rápido, diseñado para tareas de gran volumen y sensibles a la latencia, como clasificación, extracción, enrutamiento y tareas de subagentes.
Comparar modelos
claude-haiku-5-5
DisponibleAnthropicChatEntrada en caché 90% más barataReciente
Entrada / Salida-70%
$0.10 / $0.50$0.03 / $0.15
Contexto
1M
Lanzado
7 oct 2026
Salida máxima
128K
Modalidades
VisiónChat
Capacidades
Uso de herramientasCaché de promptsRazonamiento

Sobre Claude Haiku 5.5

Claude Haiku 5.5 es el modelo Claude pequeño y rápido de Anthropic, lanzado el 7 de octubre de 2026 para tareas de alto volumen y sensibles a la latencia, como clasificación, extracción, enrutamiento y tareas de subagentes. Es el primer Haiku con esfuerzo ajustable, por lo que un mismo modelo puede responder solicitudes sencillas rápidamente y pensar más tiempo en las más difíciles. Anthropic lo denomina su modelo más rápido a velocidad estándar, con una fecha de corte de conocimiento de junio de 2026.

Puntos fuertes

  • Anthropic lo denomina su modelo más rápido a velocidad estándar, lo cual es adecuado para atención al cliente en vivo y uso del navegador.
  • Es el primer Haiku con niveles de esfuerzo, por lo que un mismo modelo puede servir para chats rápidos y tareas de agente más largas.
  • Anthropic reporta grandes ganancias respecto a Haiku 4.5 en benchmarks que incluyen OSWorld 2.1, GDPval-AA y Terminal-Bench 4.0.
  • Acepta entradas de texto e imagen y funciona como subagente junto a Opus 5.5 o Sonnet 5.5 en tareas de programación, según Anthropic.
  • El pensamiento adaptativo está activado por defecto, y el ajuste de esfuerzo controla cuánto piensa el modelo.

Cuándo buscar otra opción

  • Anthropic afirma que Sonnet 5.5 y Opus 5.5 siguen siendo mejores opciones para programación agente compleja y trabajo de final abierto.
  • Los clasificadores de seguridad pueden rechazar una solicitud con un motivo de parada por rechazo, y las salvaguardas de ciberseguridad siguen bloqueando las pruebas de penetración.
  • Los presupuestos de pensamiento manual no son compatibles; el pensamiento adaptativo con el ajuste de esfuerzo los reemplaza.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Texto a textoMessages API
    POST/v1/messages
    Formato de API:
    curl https://api.tokenlab.sh/v1/messages \
      -H "Content-Type: application/json" \
      -H "x-api-key: sk-xxx" \
      -H "anthropic-version: 2023-06-01" \
      -d '{
        "model": "claude-haiku-5-5",
        "max_tokens": 1024,
        "messages": [
          {"role": "user", "content": "Hello!"}
        ]
      }'

Precios

El precio de TokenLab se aplica a Verified, que es más económico en la mayoría de los modelos. El precio oficial corresponde a la tarifa del fabricante y se aplica a la ruta Official, que es más fiable. Auto cobra según la ruta que complete la solicitud.

Entrada tokens <= 100K

Por 1M Token
Precio Official
Entrada $0.10 / Salida $0.50 / Lectura de caché $0.01 / Escritura de caché $0.125
Precio de TokenLab
Entrada $0.03 / Salida $0.15 / Lectura de caché $0.003 / Escritura de caché $0.0375
Descuento
-70%

Entrada tokens 100K-1M

Por 1M Token
Precio Official
Entrada $0.50 / Salida $2.50 / Lectura de caché $0.05 / Escritura de caché $0.625
Precio de TokenLab
Entrada $0.15 / Salida $0.75 / Lectura de caché $0.015 / Escritura de caché $0.1875
Descuento
-70%
Precios de caché de prompt

Lectura de caché

Precio Official
$0.01
Precio de TokenLab
$0.003
Descuento
-70%

Escritura de caché

Precio Official
$0.125
Precio de TokenLab
$0.0375
Descuento
-70%
Costos de herramientas

Se cobra por llamada, solo cuando el modelo utiliza la herramienta.

Búsqueda web

Precio Official
$0.01/búsqueda
Precio de TokenLab
$0.003/búsqueda
Descuento
-70%

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Las métricas aparecerán una vez que se alcancen los umbrales de privacidad y volumen de datos.

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre Claude Haiku 5.5 en Console con un prompt listo para editar o enviar.

Ayúdame a probar claude-haiku-5-5 con un mensaje breve en /v1/messages. Muestra la respuesta, la latencia y el coste.

Casos de uso

Ideal para
  • Razonamiento
  • Visión
  • Clasificación y enrutamiento de alto volumen

    Etiquetar tickets, enrutar solicitudes y extraer campos de documentos a gran escala, donde la velocidad de respuesta y el rendimiento constante son lo más importante.

  • Subagentes en flujos de trabajo de programación

    Ejecutar tareas secundarias específicas, como buscar en una base de código o resumir archivos mientras un modelo más grande lidera el trabajo, una combinación que Anthropic destaca.

  • Soporte en vivo y tareas de navegador

    Responder a clientes en tiempo real o ejecutar pasos en el navegador a partir de capturas de pantalla, donde la espera entre turnos define la experiencia.

  • Resúmenes y compactación

    Condensar conversaciones largas, archivos o registros en resúmenes breves, y compactar el contexto de un agente entre pasos.

Ejemplos de prompts

Clasifica cada uno de estos 50 tickets de soporte como facturación, error o solicitud de función, y devuelve una lista JSON con el ID del ticket y la categoría.

Lee este archivo y extrae el nombre de la empresa, el año fiscal, los ingresos y el beneficio neto en una tabla. Marca cualquier valor que no hayas podido encontrar.

Resume esta conversación hasta el momento en seis puntos que conserven cada decisión, pregunta abierta y nombre de archivo, para que un nuevo agente pueda continuar el trabajo.

Este modelo tiene precio condicional. Los totales mensuales de tokens por sí solos no producen una estimación fiable; use el precio detallado según la especificación de la solicitud, la caché y la ventana aplicable.

FAQ

¿En qué es mejor Claude Haiku 5.5?

Trabajo de alcance limitado y alto volumen: clasificación, extracción, enrutamiento, resúmenes, compactación y tareas de subagente. Anthropic lo comercializa como su modelo más rápido y afirma que Sonnet 5.5 o Opus 5.5 siguen siendo mejores para la programación agente compleja.

¿Con qué nivel de esfuerzo debería empezar en Haiku 5.5?

Anthropic recomienda medio, el valor predeterminado, para la mayoría del trabajo, incluida la programación agente. Usa bajo para chat, tareas cortas con herramientas y solicitudes sencillas de alto volumen, aunque en prompts de agentes largos puede omitir una búsqueda o detenerse antes de tiempo. Usa alto para un seguimiento estricto de instrucciones, y xhigh o max solo donde tus propias pruebas demuestren una mejora.

¿Puedo desactivar el pensamiento en Haiku 5.5?

En parte. El pensamiento es adaptativo y está activado por defecto. Enviar la solicitud con el pensamiento desactivado funciona en los niveles de esfuerzo bajo, medio y alto, y devuelve un error en xhigh y max. La forma preferida de Anthropic para obtener menos pensamiento es un nivel de esfuerzo más bajo. El pensamiento cuenta para el límite de salida, así que deja espacio para ello.

¿En qué se diferencia Haiku 5.5 de Haiku 4.5?

Anthropic reporta grandes ganancias en benchmarks, una ventana de contexto y un límite de salida más largos, esfuerzo ajustable y pensamiento adaptativo en lugar de presupuestos de pensamiento manual. Utiliza el tokenizador más reciente, por lo que el mismo texto cuenta como más tokens, y sus clasificadores de seguridad pueden devolver rechazos que Haiku 4.5 no devolvía.

¿Cuándo debería elegir Sonnet 5.5 en lugar de Haiku 5.5?

Elige Sonnet 5.5 o Opus 5.5 para programación agente compleja, sesiones de terminal largas y tareas que requieran un juicio sostenido, donde Anthropic afirma que siguen siendo más fuertes. Elige Haiku 5.5 cuando la velocidad y el volumen sean importantes y la tarea tenga un alcance limitado, como clasificación, resúmenes o trabajo de subagente.

¿Cuánto cuesta Claude Haiku 5.5?

En TokenLab, Claude Haiku 5.5 cuesta Entrada $0.03 / Salida $0.15 Por 1M Token. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Cuál es la ventana de contexto y el límite de salida de Claude Haiku 5.5?

Claude Haiku 5.5 admite hasta 1.000.000 tokens de contexto y genera hasta 128.000 tokens por respuesta.

¿Qué endpoint debe usar Claude Haiku 5.5?

Utiliza https://api.tokenlab.sh/v1/messages para Claude Haiku 5.5. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta Claude Haiku 5.5?

Claude Haiku 5.5 admite Texto a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar Claude Haiku 5.5

Fuentes

Revisado el 8 oct 2026

Más de Claude 5

Modelos relacionados