Anthropic a publié le 7 octobre Claude Haiku 5.5, le plus petit et le plus rapide des modèles de sa gamme, qui n'avait pas été renouvelé depuis un an. Un petit modèle raisonne moins finement qu'un grand, mais il coûte beaucoup moins cher à faire tourner. Anthropic le destine aux tâches répétitives et massives : résumer, classer, interroger une base de données. Il doit surtout servir de sous-agent, c'est-à-dire d'exécutant : un grand modèle comme Opus ou Sonnet planifie et décide, Haiku abat le volume. L'entreprise le présente comme son petit modèle « le moins cher, le plus rapide et le plus capable » (propos traduits).
Le prix affiché est spectaculaire. Les modèles d'IA se facturent au jeton, un fragment de texte de quelques lettres, par million de jetons lus et écrits. Haiku 5.5 coûte 0,10 dollar par million de jetons lus et 0,50 dollar par million écrits, dix fois moins que Haiku 4.5. C'est exactement le tarif de GPT-6 Luna, son concurrent chez OpenAI, notent AINews et AlphaSignal. Deux réserves pourtant. Au-delà de 100 000 jetons de consigne, le prix est multiplié par cinq, même si Anthropic indique que 90 % des requêtes adressées à Haiku 4.5 restaient sous ce seuil. Et le nouveau modèle découpe le texte en un peu plus de jetons que l'ancien. Anthropic retient donc une baisse moyenne d'environ 75 %, et non de 90 %.
Le coût réel dépend surtout de la quantité de texte que le modèle produit. Haiku 5.5 est le premier de sa lignée doté d'un réglage d'effort, du plus bas au maximum : plus l'effort est élevé, plus le modèle réfléchit longtemps, et plus il écrit de jetons. Artificial Analysis, un comparateur indépendant cité par AINews, a mesuré qu'à l'effort maximal Haiku 5.5 écrit environ 162 000 jetons par tâche de test, trois fois plus que Luna au maximum. Vals AI, un autre évaluateur, va plus loin : sur tous les tests communs, une épreuve coûte plus cher avec Haiku 5.5 qu'avec Haiku 4.5. Sur une recherche juridique, le nouveau modèle a enchaîné 59 étapes contre 17 pour l'ancien. Dans le même temps, Cursor, un éditeur de code, annonce une facture divisée par dix sur les requêtes courtes. Les deux constats tiennent ensemble : tout dépend de la longueur de la tâche et de l'effort demandé.
La qualité, elle, progresse nettement. Artificial Analysis lui accorde 43 points sur son indice d'intelligence à l'effort maximal, 26 de plus que le précédent Haiku. C'est un peu mieux que Gemini 3.8 Flash et GPT-6 Luna, mais 13 points sous Claude Sonnet 5.5. Un détail mérite l'attention. Sur un test de connaissances, Haiku 5.5 donne moins souvent la bonne réponse que Luna, 36 % contre 44 %. Mais il invente aussi beaucoup moins : son taux d'hallucination, la proportion de réponses fabriquées, tombe à 40 %, contre 77 % pour Luna. Selon AINews, une partie de sa moindre exactitude vient de ce qu'il avoue plus volontiers ne pas savoir.
Le lancement s'inscrit dans une offensive plus large sur le coût des agents. Le même jour, Anthropic a divisé par deux le prix de la relecture du cache de Sonnet 5.5. Le cache conserve les consignes déjà lues, qu'un agent renvoie à chaque étape de son travail : les relire coûte désormais 0,10 dollar par million de jetons, ce qui rendrait la plupart des travaux d'agents environ 20 % moins chers. Les abonnés Max et Team reçoivent aussi un crédit mensuel d'utilisation des modèles, de 100 à 500 dollars.
Pour qui utilise ou construit des outils d'IA, la leçon est simple. Le prix du jeton est une vitrine, le coût par tâche est la facture. Un modèle bon marché réglé au maximum peut coûter davantage que son prédécesseur, s'il réfléchit trois fois plus longtemps. Le bon réflexe consiste à choisir l'effort le plus bas qui donne un résultat acceptable, et à mesurer sur ses propres tâches plutôt que sur l'étiquette. Et pour résumer ou extraire des informations, un modèle qui dit « je ne sais pas » vaut souvent mieux qu'un modèle plus brillant qui comble ses trous.