Retour au fil

Haiku 5.5 : Anthropic répare enfin son petit modèle

Theo constate que Haiku 5.5 double son prédécesseur tout en égalant Luna sur contexte court ; usage d'ordinateur et codage agentique penchent pour Anthropic.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — 38_6C0dkKmU
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Anthropic domine le sommet des modèles de code. Depuis Fable et Opus jusqu'à l'ère Sonnet 3.5, ses appels d'outils ont fait du développement assisté par intelligence artificielle le quotidien des programmeurs. Mais la gamme gardait un maillon faible : les petits modèles. Haiku 4.5, sorti en octobre dernier, coûtait cher à l'époque et paraît risible aujourd'hui. Theo est allé jusqu'à ordonner à tous ses outils, agents et fichiers de règles d'éviter Haiku 4.5 à tout prix. Il y a quelques semaines, il l'écrivait noir sur blanc : aucun petit modèle Anthropic ne mérite l'usage.

La critique est historique : Anthropic concentre presque tout sur le modèle amiral et distille mal vers les paliers bon marché, d'où l'affaissement d'Opus pendant les versions intermédiaires et un terne Opus 5. La malédiction s'est brisée avec Opus 5.5 et Sonnet 5.5, et l'attente s'est reportée sur Haiku 5.5. Le rôle du petit modèle est clair : fouiller les fichiers, revérifier les modifications, tout ce qui ne doit pas brûler les jetons d'un modèle coûteux. Theo avait tellement perdu confiance qu'il faisait appeler un modèle rival Sol par son Claude pour économiser. Reste la question : Haiku 5.5 efface-t-il la honte ?

Prix et seuil des 100 000

Haiku 5.5 répond nettement : prix juste, performance solide, quelques astuces flatteuses pour un si petit modèle. Jusqu'à 100 000 jetons, l'entrée coûte 0,10 $ le million et la sortie 0,50 $ ; au-delà, les deux quintuplent. Environ 90 % des requêtes de l'ancien Haiku restaient sous la barre. Les tarifs chutent de 90 % sur requêtes courtes et de 50 % sur longues, soit environ 75 % de moins en moyenne une fois l'appétit du nouveau décodeur compté. Cette grille vient de l'annonce Anthropic , qui destine le modèle aux tâches répétitives sensibles au coût.

Le seuil remplit deux fonctions. D'un côté, il rend dérisoires la lecture rapide et la classification, défi aux outils de retouche textuelle ; de l'autre, il oriente l'usage dans Claude Code vers les réponses courtes pour protéger la facturation sur long contexte. Calendrier : Opus 5.5 le 22 septembre, Sonnet 5.5 le 28, puis Haiku 5.5 qui complète la famille. Lydia, côté Anthropic, conseille de figer la fenêtre de résumé automatique à 100 000, réglage par modèle couvrant aussi les sous-agents. Ce calendrier figure aussi dans le dossier SiliconAngle .

La comparaison qui compte, c'est Luna. Sur contexte court, Haiku 5.5 égale Luna au centime près (0,10 $/0,50 $) ; au-delà de 100 000, tout bascule car Luna ne durcit ses prix qu'à 272 000 (0,20 $/0,75 $). Ajoutez le nouveau décodeur, qui convertit le même texte en environ 25 % de jetons en plus, et le prix affiché diverge de la facture réelle. Tenu sous 100 000, Haiku mène ; au-dessus, Luna gagne largement. SimonWillison martèle ce partage : parité en bas, Luna bien moins chère en haut.

Le calcul à l'échelle tranche : sur un tour type lisant 80 000 jetons en cache plus 2 000 frais et 1 000 générés, Haiku et Luna coûtent 0,15 centime contre 2,2 pour Sonnet ; mille tours valent 1,50 $ contre 22 $. Quand la vérification coûte peu, les essais répétés gagnent : avec 39,2 % de réussite pour Haiku, 16,4 % pour Luna et 70,6 % pour Sonnet, le succès vérifié revient à 0,4, 0,9 et 3,1 centimes. Même étiquette, autre précision. Ce calcul vient de l'analyse CTOL , qui recommande l'aiguillage : le modèle bon marché tente, un vérificateur juge, l'échec monte en gamme.

Mesures et courbe de rentabilité

Le bond des mesures est violent. Le travail de connaissance GDPval double de 735 à 1620 ; l'examen de l'humanité grimpe de 10,2 % à 45,9 % sans outils et de 18,7 % à 57,4 % avec ; l'usage d'ordinateur OSWorld bondit de 15,7 % à 72,4 % ; le codage agentique Terminal-Bench passe de zéro à 39,2 %. Luna plafonne à 16,4 % sur ce test, moins de la moitié. Le raisonnement visuel saute de 6,4 % à 46,4 %. Ces chiffres sont le tableau officiel Anthropic ; un indice indépendant place aussi le nouveau venu premier des petits modèles avec 43 points, tout en signalant sa soif de jetons.

OpenAI menait l'usage d'ordinateur depuis longtemps ; l'écart se referme, mais le codage agentique ardu reste à Sonnet et Opus 5.5. Haiku 5.5 devient le premier petit modèle à réglage d'effort, de bas à maximal, laissant la tâche fixer l'arbitrage entre finesse et coût. Le contexte passe de 200 000 à un million de jetons. Assistance en direct, agents vocaux, aides intégrées et navigation : tout ce qui exige la vitesse est visé. Ce tableau est aussi résumé dans la synthèse Technology.org .

Le morceau le plus amusant, c'est la courbe finesse-prix : la frontière de Pareto court par Luna, Haiku, Sonnet et Opus jusqu'à ce que 6.1 Sol la torde, offrant un bond de finesse pour un dixième de centime de plus. Luna reste toujours moins chère et, sur ces chiffres, toujours moins fine. La pépite discrète, c'est Mimo aux poids ouverts, étonnamment fort pour son prix. Pour qui reste chez un seul fournisseur, Haiku devient une étape sensée : un abonnement, des modèles qui se comprennent.

Le cas mono-fournisseur est pratique : une équipe calibrée sur Anthropic fait tout sous un même toit, une facture, un guichet, sans doubler d'abonnement. L'idée qu'Opus instruisant Haiku batte Opus instruisant Sol n'est pas mesurée mais se ressent sur le terrain. Les équipes au budget serré jugeront au coût par succès vérifié, pas au prix affiché, en gardant l'option Luna sur la table.

Démos et goût du design

L'architecture des sous-agents bouge : Theo veut assouplir la règle qui route tout vers Opus dans son fichier de règles, laissant Opus décider quel sous-ensemble étroit confier à Haiku pour pas cher. Il ne l'a pas encore poussée à fond mais réécrira la règle. Même direction dans le dossier AICoder : Claude Code 2.1.293 fait de Haiku 5.5 le petit modèle par défaut, fenêtre d'un million, pour résumés, compaction, requêtes et tri.

Puis viennent les démos. Une vidéo communautaire d'Arshan, générée pour une soixantaine de centimes en moins de vingt minutes, impressionne pour ce prix. Theo y voit le goût design infusé aux modèles Anthropic : des données de design triées avec obsession, laissant au modèle de solides repères. L'étude frontale whichAI de Dara porte le même polish.

La comparaison whichAI enterre Grok : meilleurs choix typographiques, tours d'animation inédits, panneau blueprint dont le survol remodèle le contenu. Coupez l'échelle design et l'on retombe dans la laideur classique des modèles de langage : l'écart vient du module design. Theo l'avait désinstallé et compte le remettre. Module coupé, Grok empire encore, et le passage finit en éclats de rire.

La tache noire, c'est une leçon de quota en direct : un script aspirant 181 demandes de tirage en parallèle fracasse le plafond GitHub de 5 000 requêtes par heure, stocke le corps d'erreur comme donnée, puis explose à l'analyse JSON. Rien ne relance l'attente, le fil reste mort jusqu'à reprise manuelle, et Theo perd ses intégrations pour près d'une heure. Les petits modèles se coincent eux-mêmes et donnent du travail à l'usager : l'exhibit vivant de la méfiance de l'animateur.

Preuves de terrain et verdict

Les retours de terrain sont forts. Asana mesure des tâches 30 % plus rapides avec une inférence par tour jusqu'à 2,5 fois plus vive ; l'ingénieur Aaron Vinh parle d'une fluidité visible. Le banc CRM de HubSpot signe son meilleur score à 92,8, au plus vite, avec le plus de détections et le moins de fausses alertes. AlphaSense, à huit millions d'appels par semaine, gagne de 0,76 à 0,84 sur 400 requêtes. Ces résultats clients sont publiés dans l'annonce Anthropic .

Box complète le tableau avec onze points d'avance pour moitié moins de latence. La sécurité se resserre : l'alignement montre bien moins d'écarts que Haiku 4.5, le défensif respire plus que sous Sonnet 5.5, le test d'intrusion reste interdit, et l'accès large passe par le programme de vérification cyber. Ce cadre est confirmé dans le dossier SiliconAngle , qui liste aussi la diffusion via la plateforme Claude, AWS, Google Cloud et Azure.

Le jour du lancement apporte deux cadeaux. La lecture en cache de Sonnet 5.5 passe de 0,20 $ à 0,10 $ le million, allégeant d'un cinquième la plupart des factures agentiques. Des crédits API mensuels arrivent : 100 $ en Max 5x, 200 $ en Max 20x, jusqu'à 500 $ mutualisés en Team ; sans report, hors Claude Code interactif. Le contexte est aussi raconté dans le dossier TechCrunch : Sonnet 5.5 du 28 septembre va 30 % plus vite, bat Opus en multi-agents et porte des garde-fous cyber de niveau Fable.

Verdict : Haiku 5.5 est le modèle des tâches étroites, vérifiables et répétitives, du résumé à la compaction, du tri aux requêtes et aux sous-agents. Le grand modèle planifie, le bon marché tente, le vérificateur tranche. Le calcul au succès vérifié approuve : essais pas chers plus escalade sélective. Le gros œuvre reste aux fleurons. La malédiction du petit modèle semble brisée pour la première fois, et Theo part réécrire son fichier de règles.

Visualization: nodesdaily AI
MesureRésultat
OSWorld 72,4 %Avant 15,7 %
Terminal 39,2 %Avant 0
Entrée courte0,10 $ le million

Moments clés

  1. Réquisitoire contre les petits modèles
  2. Grille de prix et seuil des 100 000
  3. Bond des mesures face à Luna
  4. Courbe finesse-prix et Pareto
  5. Sous-agents et fichier de règles
  6. Démos communautaires et goût design
  7. Leçon de quota et fil bloqué
  8. Verdict et conseil d'aiguillage

Commentaire de l’IA

"La course des petits modèles vient de changer : le prix n'est plus l'excuse, la mesure parle. Mais l'aiguillage reste clé ; tout miser sur le pas cher grossit la déception, pas les économies."

Évaluation de l’IA

Le plus fort contre-argument, c'est l'appétit en jetons : au maximum, le nouveau venu brûle environ 162 000 jetons par tâche quand Luna fait pareil avec 50 000. Étiquette égale, facture inégale. Passé 100 000, la marche de Luna reste douce, donc le long contexte la favorise. Parité de prix n'est pas parité de capacité, et les essais ne résolvent pas l'impossible.

Les manques demeurent : le codage agentique ardu reste à Sonnet et Opus, et le fournisseur l'écrit lui-même. Les hallucinations tombent sous Luna (40 % contre 77 %) avec un meilleur aveu d'ignorance, mais le savoir factuel traîne (36 % contre 44 %). Permissions cyber larges en défense, fermées en attaque : équilibre raisonnable, mur dur pour les équipes rouges.

Un intérêt possible mérite note : la vidéo porte un parrainage Coderabbit, et l'éloge du petit modèle flatte un outil parrainé. Les démos communautaires sont une vitrine triée ; les ratés ne passent jamais. Pourtant le tableau est officiel, les clients nommés, et les chiffres collent aux sources indépendantes.

Pour le lecteur, c'est pratique : confier à Haiku ce qui tient sous 100 000 avec vérification pas chère, figer la fenêtre de résumé à 100 000, surveiller la facturation. Garder le fleuron pour le long contexte et le gros œuvre. Un seul fournisseur simplifie la facture, mais l'option Luna reste sur la table.

Sources

8 liens ; 5 d’entre eux sont aussi cités par 4 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

intelligence artificielle · claude · anthropic · llm · agents

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages sources, leurs versions et leur origine.

LIRE AVEC LES SOURCES

Comprendre cet article.

Vérification du compte…