Retour au fil

Opus 5.5 Annoncé : Anthropic Pousse le Sommet du Code, le Prix et le Style en Même Temps

La chaîne Prompt Engineering présente Opus 5.5 comme devançant Fable et Astra sur Terminal-Bench 4.0 à moindre coût, avec des scores agentiques au sommet et une prose nettement plus naturelle, une petite baisse tarifaire et un reset de quota thésaurisable.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — 04qy4OWteio
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Prompt Engineering présente Opus 5.5 comme l’entrée inaugurale d’une nouvelle lignée Claude 5.5 et annonce la couleur : une quasi-parité ou un léger avantage face à Fable 5.1 sur presque tous les tableaux, pour un coût inférieur à Opus 5. Ce qui enthousiasme le plus l’animateur n’est pas le score brut mais la voix : là où les grands modèles précédents tombaient dans un registre mécanique reconnaissable, la promesse ici est une prose qui se lit comme si une personne l’avait écrite, un point décisif dans les longues sessions agentiques.

Côté tarif, la vidéo décrit un ajustement modeste mais parlant : les prix au million de jetons en entrée et sortie et les frais d’écriture/lecture du cache reculent légèrement. L’animateur estime que l’intelligence par dollar pèse désormais autant que l’intelligence brute dans le choix d’un modèle. Même une petite baisse, dans cette lecture, signale qu’Anthropic ressent la pression concurrentielle et veut clarifier son récit de valeur, car les gros utilisateurs ressentent vite l’effet cumulé.

Le test auquel l’animateur accorde le plus de crédit est Terminal-Bench 4.0, présenté comme encore non saturé et donc encore discriminant. Conçu par Stanford et Harbor, il propose 89 tâches difficiles dans des terminaux isolés qui reflètent de vrais flux de travail. Dans les graphiques montrés, la nouvelle version dépasse Astra et Fable 5.1 et, découpée par niveau d’effort, reste devant à moindre dépense. L’animateur rappelle qu’aucun test de laboratoire ne reflète parfaitement le code réel, mais qu’un test non saturé reste utile, et les autres tableaux agentiques vont dans le même sens.

Sur l’ensemble plus large, le récit se répète : mener le classement tout en réduisant le coût. Les cycles précédents poussaient la capacité brute, celui-ci cherche à rendre cette capacité moins chère à déployer. Vue effort par effort, la courbe de coût reste sous celle des rivaux, un motif que l’animateur souligne sur chaque panneau de code agentique. La même revendication revient sur le mur du travail de connaissance où Elo et coût par tâche sont croisés, avec l’espoir de réponses plus concises.

La signature pour le codage pratique est une boucle de vérification qui dépasse la simple émission de fichiers. Dans le prompt favori de l’animateur, le système écrit du code puis ouvre un navigateur pour inspecter le rendu et corriger ses propres erreurs. L’animateur y voit la charnière du travail sans surveillance sur longue durée : un agent capable de regarder sa propre sortie peut itérer sans humain, transformant une astuce en livrable.

Un graphique intrigue l’animateur : sur Frontier Code, l’effort medium dépasse high et extra-high et finit proche du max. Des oscillations non monotones similaires apparaissent chez Fable et certaines variantes GPT sur cette évaluation précise. L’hypothèse avancée est un décalage de distribution — le test pourrait se situer hors du mélange de données sur lequel les modèles ont été réglés — ce qui invite à ne pas généraliser trop vite à partir d’un seul tableau.

La revendication en travail de connaissance s’accompagne de l’histoire de la prose. L’animateur attend des réponses plus courtes et pointe le mur Elo/coût comme preuve d’efficacité. Mais le titre pour beaucoup sera la façon dont Opus écrit. Anthropic dit avoir retravaillé la voix après des retours répétés sur un style maniéré et difficile à balayer, les testeurs trouvant les nouveaux messages plus faciles à comprendre d’un coup d’œil. L’illustration avant/après est une explication de baisse métrique : là où l’ancien ton s’égarait, la nouvelle formulation dit plainement que le changement d’offre gratuite n’explique qu’environ un point de la baisse d’août.

Les notes de livraison sont brèves et pratiques : mettre à jour Claude Code et l’app de bureau, ou appeler l’API sous l’étiquette 5.5. La vidéo signale les annexes habituelles sur la rétention, la distillation et la sûreté et renvoie les curieux vers la documentation. Le ton est celui d’une transparence mesurée, présentée en notes de bas de page plutôt qu’en gros titre.

Les démos portent l’argument. Une simulation de trou noir suit un brief très détaillé et livre une sortie riche en contrôles où densité et luminosité se règlent ; l’animateur juge la fidélité impressionnante même si un CPU chargé limite la fluidité. Un traqueur en direct de la Station spatiale internationale effectue de vrais appels API, trace la trajectoire du moment et ajoute un petit soleil sur le côté salué comme détail charmant. Un site de lancement auto-recherché assemble recherche, figures animées et comparaison entre Opus 5 et le nouveau venu sans ressources externes, respectant le réglage medium par défaut. Une dernière scène voxel en 3JS est présentée comme l’un des rendus les plus littéraux et riches vus par l’animateur.

La conclusion porte sur la capacité. L’allocation sur cinq heures a grandi, le budget hebdomadaire pas encore, mais les utilisateurs gagnent un reset capitalisable que l’animateur lit comme inspiré par OpenAI et salue comme signe que les labos doivent concourir sur prix et avantages autant que sur capacité. Ensemble — prose plus claire, code plus fort, facture légèrement moindre et moins de jetons par tâche — la mise à jour est cadrée comme un pas pragmatique, et la concurrence, selon l’animateur, est bonne pour les clients.

Visualization: nodesdaily AI

Commentaire de l’IA

"Ce que je retiens le plus honnêtement dans la vidéo, ce n'est pas le classement mais le changement de langue : s'éloigner de la voix lourde d'Opus compte plus en sessions longues que quelques points supplémentaires. Une petite baisse de prix et une vérification visuelle dans le navigateur rendent l'idée de laisser l'agent travailler seul plus crédible."

Évaluation de l’IA

À prendre le contre-argument au sérieux, la couronne reste provisoire. Les graphiques viennent d’un seul narrateur, sans fiche officielle, sans reproduction indépendante du classement et sans méthodologie dollars-par-tâche divulguée. La baisse de prix est modeste en absolu ; une coupe rivale pourrait vite l’annuler. L’amélioration de la voix résiste à un chiffre unique — sans évaluations humaines en aveugle, l’anecdote avant/après reste une anecdote.

Les limites de méthode sont aussi nettes : les trois démos sont triées, des réussites en un coup ; les échecs restent invisibles. L’inversion sur Frontier Code — medium battant high — suggère que l’évaluation n’est pas monotone entre familles et peut récompenser une distribution particulière, donc gagner là ne garantit pas de gagner partout. Les notes sur luminosité et fluidité liée au CPU dans la scène du trou noir rappellent que la fidélité n’est pas purement modèle.

Sur l’intérêt et la vérifiabilité, le testeur est aussi juge ; des reproductions indépendantes s’imposent. Le nom interne wafer-eap et la fenêtre du mardi circulent depuis un seul compte X relayant une fuite, sans second relais, grille tarifaire ou fiche système — tant qu’Anthropic n’a pas livré, 5.5 reste l’étiquette d’un checkpoint, pas un produit. Les axes de coût mélangent les niveaux d’effort sans dévoiler le comptage de jetons, ce qui rend l’affirmation d’économie à tous les niveaux difficile à auditer.

Pratiquement, les équipes qui vivent dans Claude Code et dépendent d’agents à long horizon ressentiront vite la valeur des auto-contrôles ancrés dans le navigateur et d’une prose plus serrée, surtout en medium où la dépense est minimale. Traitez pourtant la version comme candidate, pas comme défaut : testez votre propre dépôt, mesurez longueur de réponse et justesse d’outillage sur vos données, et confrontez les notes de rétention et de sûreté à vos exigences avant de basculer. Si le quota hebdomadaire est votre goulot, attendez une hausse claire.

Sources

6 liens ; 2 d’entre eux sont aussi cités par 4 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

opus 5.5 · anthropic · claude code · terminal-bench · codage ia

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…

Opus 5.5 Annoncé : Anthropic Pousse le Sommet du Code, le…