Retour au fil

Classement qualité-coût OpenDesign : 17 modèles, aucun vainqueur unique

L'arène design d'OpenDesign a noté 17 modèles : GPT-6.1 Sol mène à 90,1, tandis que GPT-6 Luna offre 83,1 points pour $0,016. J'ai ouvert le tableau ligne par ligne et chiffré ce que chaque score coûte vraiment.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — e9c02deed78
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

J'ai déroulé devant moi le tableau de 17 lignes : GPT-6.1 Sol 90,1 en tête, GPT-6 Sol 89,9 juste derrière, Claude Sonnet 5.5 troisième à 86,8. L'épreuve est une arène design : chaque modèle livre une pièce vitrine finie et le jury note le résultat. Le coût figure dans le même tableau : $0,382 et $0,297 pour la fratrie Sol, $0,574 pour Sonnet. Ces trois premières lignes viennent des relevés open-design.ai, où chaque modèle affiche son score à côté de son coût estimé par artefact.

L'histoire du duo de tête remonte à fin septembre : GPT-6.1 Sol a remplacé GPT-6 Sol sur la scène DevDay du 29 septembre, affiché à $2 l'entrée et $10 la sortie, soit un cinquième du prix du fleuron Astra. L'analyse venturebeat.com trace la même ligne : codage agentique et usage ordinateur de classe Astra, palier Ultrafast jusqu'à 300 tokens/s. Le tableau me paraît honnête ici : 0,2 point d'écart dans cette vitrine IA coûte 29 % de plus. Côté benchmark , la famille Sol se mesure autour de 48 à l'Intelligence Index, près de 100 tokens/s.

Le camp Sonnet 5.5 est arrivé le 28 septembre : $2 l'entrée, $10 la sortie, lectures de cache divisées par deux à $0,10. La mesure artificialanalysis.ai place Sonnet 5.5 à 56 sur l'Intelligence Index, deux points derrière le fleuron Opus 5.5, tout en notant 70,6 % sur Terminal Bench 4.0 devant Opus. Pour ce modèle , noté 86,8 dans l'arène design, la facture par artefact s'affiche à $0,574. Mon analyse : pour une équipe restée sous un même toit, Sonnet est le port sûr et la facture reste prévisible. La remise sur le cache allège les charges d' agents d'environ 20 %.

Le sommet coûte cher, le milieu est malin

Les rangs du milieu sont le passage le plus savoureux du tableau : MiMo 2.6 Flash à 83,5 pour $0,029, GPT-6 Luna à 83,1 pour $0,016, Grok 4.7 à 82,9 pour $0,662. La page comparative openrouter.ai expose l'écart de structure : Grok 4.7 s'affiche à $2 l'entrée et $6 la sortie sur 500K de contexte, tandis que MiMo Flash s'affiche à $0,10 l'entrée et $0,28 la sortie sur 1,05M de contexte. Donc une même bande de benchmark avec plus de 20 fois d'écart de prix. Pour des essais vitrine, je testerais le MiMo ouvert ou Luna, pas Grok. La dépense en tokens tranche ici.

La ligne fléchée de l'image, c'est Claude Haiku 5.5 : 82,2 points, $0,018. L'annonce anthropic.com est datée du 7 octobre : $0,10 l'entrée et $0,50 la sortie jusqu'à 100K tokens, les deux lignes quintuplant au-delà, contexte 1M. Le relevé artificialanalysis.ai place Haiku 5.5 deuxième de sa classe de prix à l'effort maximal avec 43 à l'Intelligence Index, soit $0,21 par tâche. L'examen beam.ai va dans le même sens : 34 points à l'effort moyen pour $0,05, un rôle taillé pour les tâches de sous- agents . À mes yeux, cette ligne est la vedette du tableau : 4,6 points sous Sonnet pour un trentième de la facture. Ce ratio est rare dans le choix d'un LLM .

La ligne Astra rompt le motif : 82,7 points, $1,61. Le modèle fleuron, affiché à $10 l'entrée et $50 la sortie, se tient ici 0,4 point derrière Luna pour 100 fois la facture. La ligne Fable 5.1 frappe encore plus : 80,3 points à $3,66, la cellule la plus chère du tableau. Les relevés artificialanalysis.ai montrent Fable à $10 l'entrée et $50 la sortie pour $2,37 à $3,76 par tâche d'Intelligence Index. Mon verdict est sec : la puissance IA générale est peut-être élevée, mais dans cette arène elle sort loin de la ligne prix-performance. Je regarde les factures de travaux finis, pas les prix catalogue, pour choisir un modèle .

L'aile coûteuse et les rangs inférieurs

Le couloir Flash continue : DeepSeek V4.1 Flash à 81,2 pour $0,023, GLM-5.3 Flash-X à 80,1 pour $0,098. La comparaison yottalabs.ai donne les coulisses : DeepSeek à 552B paramètres dans une bande $0,044 l'entrée et $0,30 la sortie, GLM dans une bande $0,036 l'entrée et $0,50 la sortie. Les prix en direct openrouter.ai confirment. Ces deux lignes sont ma réserve du duo Haiku-Luna : si l'un cale, l'autre prend le relais. L'écart de benchmark est de 1,1 point, l'écart de facture de 4 fois ; ici aussi le choix malin bat le choix cher. Le coût de lecture du cache gouverne la boucle d' agents .

Un cran plus bas se tiennent GPT-5.6 Sol à 77,6 pour $0,544, Hunyuan H4 Preview à 74,6 pour $0,418, Qwen 3.8-Max à 72,0 pour $0,595. La page open-design.ai remet son badge meilleur rapport à Luna : 92 % du meilleur score pour 4 % du coût maximal. Ce ratio porte la thèse que je défends depuis le début : un modèle 5 à 13 points derrière coûte 30 à 40 fois moins. Qwen, affiché à $2 l'entrée et $6 la sortie, reste cher dans cette arène. Payer au token et payer au travail fini sont deux choses différentes ; le tableau l'enseigne.

Les trois dernières lignes ferment le tableau : Gemini 3.8 Flash 68,9 à $0,210, Muse Spark 1.3 66,6 à $0,267, Kimi K3 65,7 à $0,614. L'écart au sommet va de 21 à 24 points, avec des factures 13 à 38 fois Luna. Je lis ces lignes comme un avertissement, pas un rejet : des noms qui brillent aux classements LLM généraux peuvent pâlir dans une vitrine design. Quand le type de tâche change, l'ordre du benchmark change aussi. Chaque modèle ne convient pas à chaque vitrine.

Ma logique de choix

Ma règle tient en trois lignes : j'essaie Luna ou Haiku 5.5 sur les tâches courtes vérifiables, je reste sur Luna au-delà de 100K tokens, et j'amène Sol ou Sonnet en finale vitrine. Le schéma de routage de l'examen beam.ai dit pareil : le modèle bon marché essaie, un juge vérifie, le travail bloqué monte vers le grand. Ce que le tableau open-design.ai m'a appris : les clients voient rarement l'écart entre 90 et 83 points, mais ils voient chaque mois l'écart de facture de 24 fois. Le savoir-faire en dépense IA , c'est choisir le bon palier, pas le meilleur score.

Score per cost: value belt vs top tier
MesureRésultat
Meilleur scoreGPT-6.1 Sol 90,1
Champion valeurLuna 83,1 / $0,016
À l'honneurHaiku 5.5 82,2 / $0,018

Moments clés

  1. Ouverture du tableau de 17 lignes
  2. Trio de tête et l'écart de facture
  3. La ceinture valeur du milieu
  4. Haiku 5.5 en vedette et la ligne des 100K
  5. L'aile chère : Astra et Fable
  6. Couloir Flash et rangs inférieurs
  7. Ma règle de choix en trois lignes

Commentaire de l’IA

“J'ai fixé ce graphique pendant une heure et mon avis est net : l'écart entre le sommet et le milieu se comble par le jugement, pas par l'argent. Je n'envoie jamais le modèle coûteux sur chaque tâche ; le palier bon marché produit déjà des vitrines, et je choisis en conséquence.”

Évaluation de l’IA

La contre-analyse la plus forte : ce tableau mesure une seule vitrine, pas la puissance IA générale. Un modèle à 90 dans l'arène design peut ne pas tenir ce rang en codage agentique long ou aux examens de connaissances. Sur l'Intelligence Index artificialanalysis.ai, Sonnet 5.5 culmine à 56 près du sommet tout en tenant 86,8 et la troisième place ici ; les deux épreuves pèsent des vertus différentes. Prendre ce tableau pour un benchmark général serait une erreur, et je l'évite.

Les manques sont nets aussi : vitesse, latence, couverture des langues et comportement en contexte long sont absents. Le coût par artefact est une estimation ; ma vraie facture bouge avec le nombre de requêtes, les taux de cache et la longueur des sorties. Une requête Haiku franchissant la ligne des 100K coûte cinq fois plus, ce qu'aucune cellule ne montre. Voilà pourquoi la liste à deux paliers de la page anthropic.com compte. J'étudie les notes et les pages de prix, pas seulement les cellules.

Je note aussi l'intérêt possible : la page open-design.ai ouvre sur une page de téléchargement servant 21 agents , avec le badge meilleur rapport sur Luna. Ce cadrage n'entache pas la mesure, mais je ne laisse jamais un seul tableau décider. Je recoupe les relevés venturebeat.com, artificialanalysis.ai et beam.ai. Mon principe : un tableau éveille la curiosité, trois tableaux décident.

Le message pour les lecteurs est simple : esquissez les vitrines avec Luna, produisez en volume avec Haiku 5.5 sous un motif juge, et amenez Sol ou Sonnet devant le jury final. Surveillez la ligne des 100K tokens et gardez des ratios de lecture cache élevés. Les prix en direct openrouter.ai bougent chaque semaine, alors consultez la liste chaque mois. Dans ce réglage, je protège à la fois la qualité vitrine et la facture de fin de mois.

Sources

8 liens ; 2 d’entre eux sont aussi cités par 7 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

intelligence artificielle · modèle · benchmark · agent · llm

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages sources, leurs versions et leur origine.

LIRE AVEC LES SOURCES

Comprendre cet article.

Vérification du compte…