Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

Anthropic: Claude Haiku 5.5

Le modèle Claude le plus rapide, conçu pour les tâches à haut volume et sensibles à la latence, telles que la classification, l'extraction, le routage et les tâches de sous-agents.
Comparer les modèles
claude-haiku-5-5
DisponibleAnthropicDiscussionEntrée en cache : 90% de réductionRécent
Entrée / Sortie-70%
$0.10 / $0.50$0.03 / $0.15
Contexte
1M
Date de sortie
7 oct. 2026
Sortie maximale
128K
Modalités
VisionDiscussion
Capacités
Utilisation d'outilsCache de promptsRaisonnement

À propos de Claude Haiku 5.5

Claude Haiku 5.5 est le modèle Claude petit et rapide d'Anthropic, lancé le 7 octobre 2026 pour les tâches à haut volume et sensibles à la latence, telles que la classification, l'extraction, le routage et les tâches de sous-agent. Il s'agit du premier Haiku doté d'un effort ajustable, permettant à un seul modèle de répondre rapidement aux demandes simples et de réfléchir plus longuement aux plus complexes. Anthropic le présente comme son modèle le plus rapide à vitesse standard, avec une date de coupure des connaissances fixée à juin 2026.

Points forts

  • Anthropic le présente comme son modèle le plus rapide à vitesse standard, ce qui convient au support client en direct et à l'utilisation du navigateur.
  • Il s'agit du premier Haiku doté de niveaux d'effort, permettant à un seul modèle de gérer des discussions rapides et des tâches d'agent plus longues.
  • Anthropic rapporte des gains importants par rapport à Haiku 4.5 sur des benchmarks incluant OSWorld 2.1, GDPval-AA et Terminal-Bench 4.0.
  • Il accepte les entrées de texte et d'image et fonctionne comme un sous-agent aux côtés d'Opus 5.5 ou de Sonnet 5.5 pour le travail de codage, selon Anthropic.
  • La réflexion adaptative est activée par défaut, et le paramètre d'effort contrôle l'intensité de la réflexion du modèle.

Quand préférer un autre modèle

  • Anthropic indique que Sonnet 5.5 et Opus 5.5 restent de meilleurs choix pour le codage agentique complexe et le travail ouvert.
  • Les classificateurs de sécurité peuvent refuser une demande avec un motif de refus, et les mesures de protection en cybersécurité bloquent toujours les tests d'intrusion.
  • Les budgets de réflexion manuels ne sont pas pris en charge ; la réflexion adaptative avec le paramètre d'effort les remplace.

Pour commencer

  1. Créer une clé API

    Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.

  2. Envoyez votre première requête

    Copiez l'exemple pour votre langage et lancez-le.

    Texte vers texteMessages API
    POST/v1/messages
    Format d'API:
    curl https://api.tokenlab.sh/v1/messages \
      -H "Content-Type: application/json" \
      -H "x-api-key: sk-xxx" \
      -H "anthropic-version: 2023-06-01" \
      -d '{
        "model": "claude-haiku-5-5",
        "max_tokens": 1024,
        "messages": [
          {"role": "user", "content": "Hello!"}
        ]
      }'

Tarification

Le tarif TokenLab s'applique à Verified pour réduire vos coûts. Le tarif officiel s'applique à la route Official pour une fiabilité optimale. Auto sélectionne la route qui garantit le succès de votre requête.

Entrée tokens <= 100K

Par 1M Token
Tarif Official
Entrée $0.10 / Sortie $0.50 / Lecture cache $0.01 / Jetons d'écriture cache $0.125
Prix TokenLab
Entrée $0.03 / Sortie $0.15 / Lecture cache $0.003 / Jetons d'écriture cache $0.0375
Remise
-70%

Entrée tokens 100K-1M

Par 1M Token
Tarif Official
Entrée $0.50 / Sortie $2.50 / Lecture cache $0.05 / Jetons d'écriture cache $0.625
Prix TokenLab
Entrée $0.15 / Sortie $0.75 / Lecture cache $0.015 / Jetons d'écriture cache $0.1875
Remise
-70%
Tarification du cache de prompt

Lecture cache

Tarif Official
$0.01
Prix TokenLab
$0.003
Remise
-70%

Jetons d'écriture cache

Tarif Official
$0.125
Prix TokenLab
$0.0375
Remise
-70%
Frais d'outils

Facturation à l'appel, uniquement lors de l'utilisation de l'outil par le modèle.

Recherche web

Tarif Official
$0.01/recherche
Prix TokenLab
$0.003/recherche
Remise
-70%

Utilisation et activité

Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.

Utilisation et disponibilité

Dernières 24 heures
Requêtes
Taux de succès
Latence P95
Total des jetons
Performance du modèle
Les métriques s'affichent une fois les seuils de confidentialité et de volume de données atteints.

Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.

Ouvrir dans Console

Ouvrez Claude Haiku 5.5 dans Console avec un prompt prêt à modifier ou envoyer.

Aide-moi à tester claude-haiku-5-5 avec un message sur /v1/messages. Affiche la réponse, la latence et le coût.

Cas d'usage

Idéal pour
  • Raisonnement
  • Vision
  • Classification et routage à haut volume

    Étiquetez des tickets, acheminez des demandes et extrayez des champs de documents en volume, là où la vitesse de réponse et un débit constant sont primordiaux.

  • Sous-agents dans les flux de travail de codage

    Exécutez des tâches secondaires ciblées telles que la recherche dans une base de code ou la synthèse de fichiers pendant qu'un modèle plus large dirige le travail, une association mise en avant par Anthropic.

  • Support en direct et tâches de navigation

    Répondez aux clients en temps réel ou pilotez les étapes de navigation à partir de captures d'écran, là où l'attente entre les tours façonne l'expérience.

  • Synthèses et compactage

    Condensez de longues conversations, des documents officiels ou des journaux en brefs résumés, et compactez le contexte d'un agent entre les étapes.

Exemples de prompts

Classez chacun de ces 50 tickets de support comme facturation, bug ou demande de fonctionnalité, et renvoyez une liste JSON avec l'ID du ticket et la catégorie.

Lisez ce document officiel et extrayez le nom de l'entreprise, l'exercice fiscal, le chiffre d'affaires et le résultat net dans un tableau. Marquez toute valeur que vous n'avez pas pu trouver.

Résumez cette conversation jusqu'à présent en six points qui conservent chaque décision, question ouverte et nom de fichier, afin qu'un nouvel agent puisse poursuivre le travail.

Ce modèle a une tarification conditionnelle. Les totaux mensuels de tokens ne suffisent pas pour une estimation fiable ; utilisez la tarification détaillée selon la spécification de la requête, le cache et la fenêtre applicable.

FAQ

En quoi Claude Haiku 5.5 excelle-t-il ?

Travail à portée limitée et à haut volume : classification, extraction, routage, synthèses, compactage et tâches de sous-agent. Anthropic le commercialise comme son modèle le plus rapide et précise que Sonnet 5.5 ou Opus 5.5 restent meilleurs pour le codage agentique complexe.

Quel niveau d'effort dois-je utiliser pour commencer avec Haiku 5.5 ?

Anthropic recommande le niveau moyen, qui est la valeur par défaut, pour la plupart des travaux, y compris le codage agentique. Utilisez le niveau faible pour les discussions, les tâches courtes avec des outils et les demandes simples à haut volume, bien que dans les invites d'agent longues, il puisse ignorer une recherche ou s'arrêter prématurément. Utilisez le niveau élevé pour un respect strict des instructions, et xhigh ou max uniquement là où vos propres tests montrent un gain.

Puis-je désactiver la réflexion sur Haiku 5.5 ?

En partie. La réflexion est adaptative et activée par défaut. L'envoi d'une demande avec la réflexion désactivée fonctionne aux niveaux d'effort faible, moyen et élevé, et renvoie une erreur aux niveaux xhigh et max. La méthode privilégiée par Anthropic pour obtenir moins de réflexion est d'utiliser un niveau d'effort inférieur. La réflexion compte dans la limite de sortie, prévoyez donc de la marge.

En quoi Haiku 5.5 diffère-t-il de Haiku 4.5 ?

Anthropic rapporte des gains importants sur les benchmarks, une fenêtre de contexte et une limite de sortie plus longues, un effort ajustable et une réflexion adaptative remplaçant les budgets de réflexion manuels. Il utilise le nouveau tokenizer, donc le même texte compte pour plus de jetons, et ses classificateurs de sécurité peuvent renvoyer des refus que Haiku 4.5 ne renvoyait pas.

Quand devrais-je choisir Sonnet 5.5 plutôt que Haiku 5.5 ?

Choisissez Sonnet 5.5 ou Opus 5.5 pour le codage agentique complexe, les sessions de terminal longues et les tâches nécessitant un jugement soutenu, domaines où Anthropic indique qu'ils restent plus performants. Choisissez Haiku 5.5 lorsque la vitesse et le volume sont importants et que la tâche est à portée limitée, comme la classification, les synthèses ou le travail de sous-agent.

Combien coûte Claude Haiku 5.5 ?

Sur TokenLab, Claude Haiku 5.5 coûte Entrée $0.03 / Sortie $0.15 Par 1M Token. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.

Quelles sont les limites de contexte et de sortie de Claude Haiku 5.5 ?

Claude Haiku 5.5 accepte jusqu'à 1 000 000 jetons de contexte et génère jusqu'à 128 000 jetons par réponse.

Quel endpoint Claude Haiku 5.5 doit-il utiliser ?

Utilisez https://api.tokenlab.sh/v1/messages pour Claude Haiku 5.5. L'exemple de requête ci-dessous montre la structure de code correspondante.

Quelles opérations Claude Haiku 5.5 prend-il en charge ?

Claude Haiku 5.5 prend en charge Texte vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.

Comparer Claude Haiku 5.5

Sources

Mis à jour le 8 oct. 2026

Plus de la série Claude 5

Modèles associés