Retour au fil

J'ai teste Opus 5.5 sur 24 taches de code : qualite Fable en moitie moins de temps et de cout

Dans un benchmark independant de 24 taches de code, Claude Opus 5.5 a nettement devance Opus 5 en qualite, vitesse et cout — le reglage medium s'est termine en deux minutes pour moins d'un dollar.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — dLHFC-mumsA
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

La semaine a ete chargee pour les grands modeles. Claude Opus 5.5 est arrive pendant qu'OpenAI evoquait GPT-6 Sol et Luna, et Mimo 2.6 a ete ecarte car trop lent. La question centrale etait de savoir si 5.5 est une petite evolution comme 5.1 ou un vrai saut. Des rumeurs internes parlaient de 5.2, et Fable etait sorti en 5.1 sans grand effet. Sur le classement prive de l'auteur, Opus 5 restait derriere Astro medium et meme Solve high de quelques fractions — proche, mais pas premier.

Methode : une boucle Bash, quatre projets

La methode est restee volontairement simple. Un script Bash appelle le CLI Claude Code pour 24 prompts de code. Vingt taches sont notees jusqu'a 20 points pour les cas limites et les chemins imparfaits, dont deux en PHP, une en Dart Flutter et une en Go. Par ailleurs, un frontend React TypeScript et un backend PHP Laravel sont juges par GPT 5.6 jusqu'a 20 points pour la qualite du code. Le premier run a termine tous les tests en environ deux minutes, le second encore plus vite. La variance sur un seul essai est elevee, l'auteur envisage une moyenne sur trois essais a l'avenir mais garde un seul run pour limiter le cout.

La vitesse et le cout ont surpris immediatement. Avec Opus 5, medium et high depassaient un dollar par prompt meme avec le forfait Anthropic a 20 dollars ; avec Opus 5.5 l'ensemble des 24 prompts est reste sous un dollar. L'auteur depensait habituellement trois a quatre fenetres de cinq heures pour tester les deux variantes d'Opus 5. Cette fois une seule fenetre a suffi. Sur les reseaux, le modele etait presente comme au niveau de Fable mais plus rapide et moins cher qu'Opus 5 ; la premiere impression et les chiffres detailles allaient dans le meme sens.

Tableau de bord : 20 sur 20 en front et en back

Le detail des scores a revele une nuance curieuse. Dans le tableur, les deux variantes d'Opus 5.5 cote a cote montraient medium legerement au-dessus de high en qualite de code — plausible sur un seul essai. Pourtant les deux depassaient nettement le plafond de 100 points des autres ; trois 100 parfaits sur six runs ont ete observes, moyennes puis divisees par cinq pour l'echelle sur 20. Sur une moyenne de trois essais, medium restait un peu devant mais l'ecart etait minime, high reprenant l'avantage sur d'autres axes.

La mise a jour du classement general a place deux nouveaux leaders au-dessus de GPT-6 Astra. High a obtenu 20 sur 20 sur les quatre projets. Medium a rate un test et a signe 18 sur 19 ailleurs, restant legerement devant en qualite mais derriere au total. Compare a Opus 5 le bond est net, beaucoup plus proche du plafond de 60 sur 60. C'est le deuxieme modele a franchir 20 sur 20 apres Astra medium, mais le prix et le temps priment. Un post viral soutenait qu'il nous faut moins des modeles meilleurs que Fable ou Astra que des modeles normaux moins chers — Opus 5.5 correspond exactement a ce besoin. Medium a affiche 56 centimes en moyenne par appel API contre plus d'un dollar pour chaque variante d'Opus 5, et meme Opus 5.5 high revenait moins cher que Opus 5 medium.

Pourquoi beaucoup plus rapide et moins cher ?

Le prix API officiel est seulement un peu plus bas ; l'essentiel vient d'un besoin de calcul moindre, donc un modele optimise pour la vitesse et le cout. Cela a ete confirme par des utilisateurs intensifs qui disent pousser fort sans entamer leurs limites — Theo est cite. En temps, medium tourne autour de deux minutes par requete, high autour de trois, environ deux fois plus vite qu'Opus 5 et plus vite qu'Astra medium ; aucune autre entree sous deux minutes n'existe dans tout le tableau, sauf Luna low, hors classement. L'usage sur le forfait 20 dollars s'est aussi allege : un pic au-dessus de 100% a ete absorbe par un nouveau reset en cache, la semaine de test est restee a 91% puis 58% d'une seconde fenetre a suffi, contre trois a quatre fenetres pour Opus 5. Anthropic a aussi releve de 20% les limites de fenetre de cinq heures officiellement.

Le signal de la communaute a suivi. L'auteur dit desormais faire davantage confiance aux retours de communaute qu'aux suites generiques, car corriger de vrais depots reflete le travail quotidien. Opus 5.5 y figure presque au sommet, moins cher que Fable, et les reseaux se sont remplis d'eloges style Halleluja sur le fait de pouvoir enfin ignorer le plafond d'usage sur Fable. Quel role reste-t-il a Fable a son prix premium, ou a Sonnet 5 suppose moins cher ? Sonnet 5 est plus bas dans le tableau et ni vraiment moins cher ni bien meilleur. La note d'Anthropic est claire : Opus 5.5 est le premier de la famille Claude 5.5, donc Sonnet et peut-etre Haiku ou Fable 5.5 pourraient suivre bientot. L'auteur compte continuer a alimenter son benchmark et traitera GPT-6 Sol et Luna ensuite, avec des approfondissements sur son site AI Coding Dealer.

Visualization: nodesdaily AI
DimensionResultat
QualiteHigh 20/20, medium proche
Vitesse2-3 min/req, moitie d'Opus 5
CoutMoy. $0.56, une seule fenetre 5h
ModeleCout API moyenTemps / Requete
Opus 5.5 Medium$0.56~2 min
Opus 5.5 High~$0.90~3 min
Opus 5 Medium/High>$1.00~5-6 min

Moments clés

  1. Ouverture — pourquoi 5.5 pas 5.1, rumeurs 5.2 et Fable 5.1
  2. Methode — 24 taches, Bash via Cloud Code CLI, repartition 20+2+1+1
  3. Surprise — premier run ~2 min, second plus rapide, sous $1
  4. Qualite — React et Laravel juges par GPT 5.6 proche de 100/100
  5. Classement — high 20/20, double sommet au-dessus d'Astra
  6. Calcul — 56c vs >$1, test Theo et hausse 20%
  7. Communaute — signal correction depot, premiere famille 5.5 et suite

Commentaire de l’IA

"Ce qui me frappe, c'est que nous ne cherchions pas un modele encore plus cher mais un modele quotidien rapide et abordable — Opus 5.5 semble combler ce manque."

Évaluation de l’IA

A son meilleur, Opus 5.5 offre une qualite proche de Fable avec une vitesse et un cout utilisables au quotidien. Vingt-quatre taches tiennent en une fenetre de cinq heures, sous un dollar, a deux ou trois minutes par requete. L'idee n'est pas un modele meilleur mais la meme qualite rendue accessible — et elle convainc.

Les limites sont claires. Un seul run gonfle la variance ; medium devant high tient probablement au hasard. Le juge est GPT 5.6 seul, sans revue humaine. La famille reste incomplete — Sonnet 5 score plus bas, la valeur de Fable a prix premium reste incertaine. Des anecdotes comme 680 000 lignes migrees en un jour ne se generalisent pas et les types de projets testes restent etroits.

L'enseignement cle est l'efficacite operationnelle plus que la capacite brute. Une petite baisse de prix API compte moins que le besoin de calcul reduit. Cela se traduit par des limites de cinq heures qui paraissent plus larges en usage d'equipe. La confiance de la communaute se deplace vers des tests pratiques de correction de depots plutot que des suites generiques ; la place de haut niveau d'Opus 5.5 y est un signal plus fort que des scores theoriques.

En pratique, commencez par Opus 5.5 medium pour le code quotidien et les agents, essayez high pour les taches critiques. Suivez la consommation par fenetre ; avec la hausse de limite et le reset en cache, comptez trois a quatre fois moins de fenetres qu'avec Opus 5. Pour decider de Fable, attendez Sonnet et Haiku 5.5 ; justifier le premium de Fable est difficile pour l'instant.

Sources

6 liens ; 3 d’entre eux sont aussi cités par 10 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

opus 5.5 · claude code · benchmark code · prix performance · anthropic

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…