Anthropic a présenté Haiku 5.5 le 7 octobre 2026, et la grille tarifaire retient aussitôt l attention. Jusqu à 100 000 tokens, un million de tokens d entrée coûte 10 cents et un million de tokens de sortie 50 cents. Au-delà du seuil, le tarif quintuple et grimpe à 50 cents puis 2,50 $. Les graphiques de la vidéo racontent donc deux histoires : côté efficacité par token , Haiku paraît plus intelligent que son rival GPT-6 Luna, tandis que côté efficacité par coût , Luna reprend l avantage. L exemple chiffré frappe : la même tâche coûte 21 cents via Haiku contre 7 cents via Luna. Le supplément achète une intelligence supérieure et une génération un peu plus rapide.
Pourquoi un modèle si bon marché et si rapide ? La réponse se niche dans les tâches à haut volume. Résumés, condensations, classifications et requêtes de bases de données se répètent sans fin et ne devraient pas mobiliser les fleurons. Haiku 5.5 intervient ici comme sous-agent au service de ses grands frères Opus 5.5 et Sonnet 5.5. L assistance en direct et la navigation web, sensibles à la vitesse, figurent aussi sur la liste. L animateur Caleb en montre un exemple vivant : Atticus, un agent personnel installé à son domicile.
Atticus : un agent personnel au quotidien
Atticus obéit à la voix et accomplit deux missions dans la démonstration. Pendant que Caleb lit un article de recherche, il parle, et Atticus rassemble les travaux voisins en arrière-plan sans rompre le fil de lecture. Puis il observe le bureau, lit le travail ouvert dans la fenêtre VS Code, retrouve la documentation PyTorch et l épingle à gauche de l écran. Caleb continue d écrire pendant que la référence patiente à côté. Chaque échange coûte environ 0,001 $, donc l agent personnel revient presque à rien. Ce calcul a fait passer Caleb du local vers le nuage : il faisait tourner une version Qwen sur son réseau domestique et appelle désormais la gamme Haiku via l interface. Son motif, la facture d électricité du Michigan à 0,23 $ le kilowattheure. La vidéo comporte un parrainage Micro Center, qui distribue des clés flash de 128 Go lors de l ouverture d Austin.
Le chiffre le plus commenté concerne l usage de l ordinateur . Haiku 5.5 obtient 72,4 points sur le sous-ensemble hors ligne d OSWorld 2.1, devant Luna à 48,9 et loin devant l ancien Haiku 4.5 à 15,7. Même le grand frère Sonnet 5.5 culmine à 83,9, si bien que le petit modèle s est remarquablement rapproché. Les autres lignes impressionnent aussi : 1620 points au test de travail savant GDPval-AA v2.1 contre 1437 pour Luna, et 39,2 points au test de codage agentique Terminal-Bench 4.0, plus du double des 16,4 de Luna. Au test principal FrontierCode, 46,4 points devancent les 42,4 de Luna.
Ce que mesure le test OSWorld
Le test OSWorld vérifie si un modèle sait piloter un véritable ordinateur au clavier et à la souris. Des environnements virtuels sont montés, et le modèle doit boucler des tâches au long cours comme mettre en forme un diaporama ou réserver un voyage. L environnement renvoie des captures fraîches à chaque pas, le modèle lit chaque image et planifie le geste suivant. La boucle tourne jusqu au bout ; l exemple de diaporama exige 62 étapes, et la liste dépasse la centaine de tâches.
Les essais à domicile montrent le double visage de cette boucle. Côté réussite, Caleb parle, Haiku retrouve le tableur Excel et bascule en mode sombre, en cliquant dans les menus pendant que les captures circulent jusqu au but. Côté raté, l animateur demande un filtrage sur le site ArtificialAnalysis : les modèles au-delà de 1 $ doivent être désactivés. Le modèle décoche d abord les lignes Opus 5.5 et GPT-6, puis abandonne à mi-chemin. Après une relance, il avance un peu sans jamais conclure, et l opération entière dure 33 secondes. Malgré 173 tokens par seconde, l animateur admet qu il reste du chemin en vitesse comme en raisonnement, ajoutant que son écran 4K a peut-être ralenti l affaire. Ces accrocs prouvent que la consigne vocale couplée au pilotage reste un artisanat inachevé.
La vitesse seule ne suffit pas
La conclusion frappe net : des modèles moins chers, plus intelligents et plus rapides ouvrent des usages inédits. Anthropic annonce des coûts moyens en baisse de 75 points, avec une remise de 90 points pour les tâches tenant dans la limite de 100 000 tokens. Un nouveau réglage d effort permet de choisir l intensité d inférence de basse à maximale ; des essais indépendants ont dessiné un pélican pour 0,09 cent au niveau bas contre 3,38 cents au niveau haut. Mais le nouveau tokenizer découpe le même texte en 1,25 fois plus de tokens, masquant une hausse. Au-delà du seuil, Luna semble meilleur marché, puisque le rival ne monte qu à 20 et 75 cents après sa barre de 272 000 tokens.
| Indicateur | Valeur |
|---|---|
| Entrée jusqu à 100 000 tokens | 10 cents par million de tokens |
| Score OSWorld 2.1 | 72,4 points, devant Luna |
| Coût par échange | 0,001 $ via Atticus |
Moments clés
Commentaire de l’IA
"Les petits modèles gagnent en intelligence pendant que leurs factures fondent, ouvrant la voie aux agents personnels. La flambée au-delà du seuil et les tâches inachevées forment le versant prudent du récit."
Évaluation de l’IA
La riposte la plus forte naît des longs contextes. Passée la ligne des 100 000 tokens, Haiku quintuple pendant que Luna garde ses 10 cents jusqu à 272 000 tokens, puis reste à 20 et 75 cents. Ajoutez l inflation de 1,25 du tokenizer et le tableau bascule pour les longs documents. En outre, les 72,4 points appartiennent au sous-ensemble hors ligne ; rien ne prouve encore le même succès sur des parcours complets prenant 1,6 heure aux humains. L écart entre le banc virtuel bien rangé et les vrais sites labyrinthiques impose une lecture prudente du chiffre vedette.
La liste des manques s allonge. Rien de concret sur la sécurité, la conservation des données ou l audit d entreprise, tandis qu un agent qui regarde les écrans du foyer laisse la question de la vie privée ouverte. L arbitrage entre intimité et vitesse locales d un côté, coût du nuage de l autre, varie selon chacun, sans formule unique. Le récit matériel parrainé brouille encore le tableau, alignant dans la même vidéo des stations coûteuses et des appels à un centime. Le lecteur mesurera donc sa propre charge avant de trancher.
Le conseil pratique tient en trois gestes. D abord couper la charge à la ligne des 100 000 tokens : Haiku en deçà, le rival ou un grand frère au-delà. Puis jouer du réglage d effort , en esquissant vite au niveau bas et en raisonnant serré au niveau haut. Enfin adopter le motif du sous-agent, où le fleuron planifie et le petit modèle abat les marches répétitives. Des chiffres comme 0,001 $ par échange séduisent, mais le total mensuel mérite surveillance, car le haut volume engraisse vite les menues monnaies.
Sources
6 liens ; 2 d’entre eux sont aussi cités par 3 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube YouTube — Caleb Writes Code
- @anthropic Anthropic — Introducing Claude Haiku 5.5
Également cité par : Same Sticker, Different Bill: Haiku 5.5 vs Luna in 12 Runs · Haiku 5.5: Anthropic finally fixes its small-model problem · Claude Haiku 5.5: Anthropic's Cheapest and Fastest Model Reshapes the Small-Model Race
- @siliconangle SiliconANGLE — Anthropic releases Claude Haiku 5.5
- @simonwillison SimonWillison — Claude Haiku 5.5
Également cité par : Haiku 5.5: Anthropic finally fixes its small-model problem · Claude Haiku 5.5: Anthropic's Cheapest and Fastest Model Reshapes the Small-Model Race
- @xlang XLang — OSWorld 2.0 Benchmark
- @artificialanalysis ArtificialAnalysis — Model Comparison
haiku 5.5 · anthropic · osworld · agent ia · efficacité coût