Anthropic divise par dix le prix de Claude Haiku 5.5 et lui ajoute des contrôles d’effort
Le 7 octobre 2026, Anthropic lance Claude Haiku 5.5, son plus petit modèle, au tarif de 0,10 $ par million de tokens en entrée — une baisse de 90 % — avec des contrôles d’effort inédits sur cette gamme. Si vous poussez des tâches agentiques à fort volume, ce prix redessine le choix du petit modèle.
7 octobre 2026. Anthropic lance Claude Haiku 5.5, la première refonte de son plus petit modèle en près d’un an. 0,10 $ par million de tokens en entrée contre 1 $ pour la génération précédente. 72,4 % sur le sous-ensemble hors ligne d’OSWorld 2.1, contre 15,7 % pour Haiku 4.5. Pourquoi c’est important : le modèle le moins cher de la gamme devient dix fois moins cher et nettement plus capable — et c’est le troisième modèle 5.5 d’Anthropic en un mois.
La baisse de prix n’est pas cosmétique
Le changement de tarif est le fait le plus frappant, et il est structurel. Haiku 4.5 coûtait 1 $ en entrée et 5 $ en sortie par million de tokens, quel que soit le volume. Haiku 5.5 introduit un tarif dégressif par taille de requête : 0,10 $ / 0,50 $ pour les requêtes de moins de 100 000 tokens, et 0,50 $ / 2,50 $ au-delà. Ce sont des baisses de 90 % et 50 % respectivement, pour une économie moyenne autour de 75 % selon Anthropic — une fois tenu compte d’un tokenizer révisé qui consomme légèrement plus de tokens par tâche.
Ce découpage n’est pas anodin : Anthropic précise qu’environ 90 % des requêtes adressées à Haiku 4.5 tombaient déjà dans la tranche la moins chère. La baisse cible donc le cœur du trafic réel — les tâches courtes et nombreuses qui font la masse des appels agentiques — plutôt qu’un segment marginal.
Les contrôles d’effort arrivent sur le petit modèle
Haiku 5.5 est le premier modèle Haiku doté de contrôles d’effort, réglés par défaut sur medium. Le développeur peut désormais arbitrer, sur un même modèle, entre un traitement minimaliste et une réflexion plus longue, selon la tâche. C’est un transfert direct des modèles de la famille Sonnet et Opus vers le bas de gamme, et il change la façon d’utiliser un petit modèle.
La logique est la même que celle des modèles de décision — la catégorie où des acteurs comme Jev font actuellement le bruit — mais appliquée à un modèle généraliste bon marché. Concrètement, on peut garder l’effort au minimum pour la compaction de contexte et les requêtes de base de données, et le pousser plus haut pour les tâches qui demandent un raisonnement, comme la navigation navigateur ou le support client en direct.
Des gains de capacité inhabituels pour un petit modèle
Les évaluations internes d’Anthropic racontent une histoire rare pour un modèle « petit et efficace » : un bond, pas un simple rafraîchissement. Sur le sous-ensemble hors ligne d’OSWorld 2.1, qui mesure l’usage de l’ordinateur, Haiku 5.5 atteint 72,4 %, contre 15,7 % pour Haiku 4.5 — et devant les 48,9 % de GPT-6 Luna, le petit modèle d’OpenAI.
Le même schéma se répète ailleurs. Sur GDPval-AA v2.1, un benchmark de travail de connaissance, Haiku 5.5 marque 1 620, contre 735 pour son prédécesseur et 1 437 pour GPT-6 Luna. Sur Terminal-Bench 4.0, qui teste des tâches complexes en plusieurs étapes dans un environnement en ligne de commande, il passe de 0 % à 39,2 % — toujours loin des 70,6 % de Sonnet 5.5, mais sur un modèle dont le métier n’est pas d’être le plus fort.
Il faut lire ces chiffres avec la prudence d’usage : ce sont les évaluations d’Anthropic, et elles ne comparent Haiku 5.5 qu’à ses propres modèles et à GPT-6 Luna. Elles disent néanmoins quelque chose de vrai — la frontière entre « petit modèle » et « modèle capable » s’est déplacée en un an.
La concurrence ne dort pas
Le terrain des petits modèles est précisément celui où la pression des prix est la plus forte, et Haiku 5.5 n’y est pas seul. Artificial Analysis crédite GLM-5.3-Flash de Z.ai de 1 647 sur GDPval-AA v2.1 et 1 454 sur AA-Briefcase v1.1, face à 1 620 et 1 578 pour Haiku 5.5 — des scores voisins à des prix parfois plus bas.
Côté tarif, la référence reste Qwen3.7 Flash d’Alibaba : 0,03 $ par million de tokens en entrée et 0,13 $ en sortie jusqu’à 32 000 tokens, puis 0,10 $ / 0,40 $ jusqu’à 256 000 tokens. C’est, sur le papier, encore moins cher que Haiku 5.5. Le choix se joue donc moins sur le prix absolu que sur l’écosystème : la qualité de l’usage de l’ordinateur, la robustesse des garde-fous, et la disponibilité sur les clouds que l’entreprise utilise déjà.
Disponibilité et à-côtés
Haiku 5.5 est disponible sur la plateforme Claude, AWS, Google Cloud et Microsoft Azure, accessible sous l’identifiant claude-haiku-5-5. Anthropic ajoute aussi un support bêta de l’usage de l’ordinateur et du navigateur dans ses SDK Python et TypeScript.
Dans la même annonce, Anthropic divise par deux le prix du cache read de Sonnet 5.5, de 0,20 $ à 0,10 $ par million de tokens — de quoi rendre la plupart des tâches agentiques environ 20 % moins chères. Des crédits API mensuels arrivent aussi sur les abonnements Max et Team (jusqu’à 200 $ pour Max 20x, 500 $ mutualisés pour Team). Enfin, Haiku 5.5 embarque des garde-fous de cybersécurité plus stricts que Haiku 4.5, qui autorisent plus de travail défensif que ceux de Sonnet 5.5, tout en continuant de bloquer le pentesting.
Le coût réel d’un agent à fort volume
Pour juger la baisse, mieux vaut un chiffre concret. Prenons un agent qui traite un million de requêtes courtes par mois, chacune autour de 2 000 tokens en entrée et 500 en sortie — l’ordre de grandeur d’une compaction de contexte ou d’une requête de base de données. Sur Haiku 4.5, à 1 $ / 5 $ le million de tokens, la facture mensuelle grimpe à 2 000 $ d’entrée et 2 500 $ de sortie, soit 4 500 $. Sur Haiku 5.5, dans la tranche sous 100 000 tokens, la même charge tombe à 200 $ d’entrée et 250 $ de sortie — 450 $, dix fois moins.
L’écart se creuse quand on tient compte des contrôles d’effort. Un agent de support client en direct peut laisser l’effort en medium et absorber la masse des requêtes à bas coût, puis basculer ponctuellement en effort élevé pour les cas qui exigent un raisonnement. Sur Haiku 4.5, ce réglage n’existait pas : tout passait au même tarif, quel que soit le besoin réel. La granularité nouvelle transforme le petit modèle en variable d’ajustement budgétaire — on paie la réflexion seulement quand on en a besoin.
Reste la question de la qualité. Dix fois moins cher ne sert à rien si le modèle échoue là où l’on en a besoin ; c’est pourquoi le bond de 15,7 % à 72,4 % sur OSWorld 2.1 compte autant que le prix. Un modèle qui coûte dix fois moins cher et qui réussit quatre fois plus de tâches d’usage de l’ordinateur n’est pas une promotion — c’est un changement de catégorie.
Verdict
Si vous poussez un fort volume de tâches courtes — compaction, requêtes de base, support client en direct, usage du navigateur — Haiku 5.5 change l’équation : à 0,10 $ le million de tokens, son bond de capacité sur l’usage de l’ordinateur en fait un choix sérieux face à GPT-6 Luna. Si vous optimisez le prix pur, comparez d’abord GLM-5.3-Flash et Qwen3.7 Flash, moins chers sur le papier, avant de trancher sur la foi des benchmarks d’Anthropic : mesurez sur votre charge, pas sur celle du communiqué. Si vous êtes déjà sur Sonnet 5.5, profitez surtout de la baisse du cache read, qui réduit vos coûts agentiques d’environ 20 % sans changer de modèle. Le petit modèle n’est plus le parent pauvre de la gamme — c’est désormais le cheval de bataille économique.