Retour au fil

Reset du tier list IA : GPT-6 Astra prend la couronne tandis que le calcul des abonnements réécrit le classement

Avenox met à jour son tier list IA avec GPT-6 Astra en tête, le calcul des abonnements décidant de la plupart des tiers, et les modèles locaux ouverts ainsi que les harnesses obtenant leurs propres échelles.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — djlec83pVoU
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Avenox présente cela comme une vidéo de mise à jour, pas un classement froid. Le format mêle ordre et notes de contexte et jugements personnels, ce qui compte car des dizaines de nouveaux modèles sont arrivés d'un coup et un simple tableau S-à-D cacherait le raisonnement.

GPT-5.6 Luna garde le tier S sur le rapport prix-performance. Un abonnement à 20 dollars se comporte comme un usage quasi illimité, valant des centaines de dollars en dépense mesurée, donc les utilisateurs sensibles au budget font la meilleure affaire ici. Un GPT-6 Luna à venir ne fera que renforcer l'argument de rester dans cette voie.

Terra descend à C tandis que Sol monte à S, avec une correction jointe. Terra coûte environ dix fois Luna sans justifier cet écart, tandis que le prix affiché de Sol était erroné et se situe autour de 30 dollars en sortie. Le chemin de mise à niveau attendu de Sol aux côtés d'Astra le ramène au tier supérieur.

Claude Fable 5.1, c'est-à-dire la dernière ligne Fable, reste S malgré les plaintes sur le coût et les quotas. Toute la série se lit de manière cohérente de haut en bas, et la qualité du modèle l'emporte sur la douleur tarifaire dans ce compte rendu.

DeepSeek 4.1 Flash atterrit à A après une hausse de prix. La tarification aux heures de pointe touche la barre des 1,2 dollar et la bon marché de l'ère Pro est révolue. Face à un abonnement Luna valant 300 à 400 dollars d'usage API, DeepSeek peut coûter jusqu'à trente fois plus à son public de base, même si le labo garde le respect.

GLM 5.3 Flash prend S sur le prix plus la logique d'abonnement. Les crédits API mesurés décident rarement des coûts réels, et une voie par abonnement le rend bien moins cher en pratique. MiMo tombe à C comme dépassé même pour le nettoyage de masse à bas coût, tandis que Gemini 3.8 Flash garde B pour la vitesse et la lecture vidéo malgré un appel d'outils faible et des hallucinations fréquentes.

MiniMax M3 se stabilise à B comme adéquat sans excitation. Un tier gratuit sur OpenRouter plus des applications bon marché et un écosystème croissant aident les étudiants et le travail quotidien léger. Le doute est tourné vers l'avenir, avec les lignes Claude et GPT attendues en croissance, plus une divulgation qu'aucune entreprise ne sponsorise la chaîne hormis une discussion en cours avec Kimi. Meta Muse Spark 1.3 Contributor suit comme le choix API bon marché à dix à vingt cents avec partage de données, sensé surtout sous 20 dollars d'usage mensuel, exactement comme prédit deux mois plus tôt.

Sonnet 5 passe de B à A sur une baisse vers le niveau des 10 dollars. À six ou sept dollars il serait S, car le modèle lui-même est bon et seul le prix était faux. À prix Terra, Sonnet gagne à chaque fois. Opus 5 reste un S permanent comme série quotidienne préférée pour l'étendue et les manières, tandis que Kimi K3 rejoint S pour les poids ouverts, l'auto-hébergement en entreprise sans fuite de données, un plan à 200 dollars apprécié et trois mille milliards de paramètres. La pièce manquante est une ligne Kimi plus petite pour les agents subordonnés dans la barre des un à deux dollars.

Grok 4.6 prend A sur le prix, l'écosystème et les avantages côté Cursor. Les longues exécutions non supervisées n'inspirent pas encore la même confiance qu'Astra, Fable ou Kimi. Hy4 Preview est un C sans histoire, Nemotron un D franc, et GLM 5.3 répète à S. Le problème de DeepSeek est désormais une concurrence encombrée de Luna, Muse Spark au sixième de son prix, et GLM Flash jusqu'à ce qu'il lance son propre abonnement.

GPT-6 Astra revendique le siège du haut et, dans ce compte rendu, le titre de meilleur modèle à ce jour. La lecture de scènes en trois dimensions, le repérage de fins détails, le suivi des règles, un raisonnement solide et aucune coupure de quota en milieu de plan portent l'argument. Les styles de travail diffèrent, donc certains utilisateurs peuvent ne pas être d'accord, et discuter reste plus agréable sur Fable. Le lancement est même lu comme un dommage pour l'IPO d'Anthropic, avec un nouvel Opus ou un Fable plus grand attendus bientôt.

Les modèles locaux ouverts obtiennent leur propre échelle. Qwen Max se situe à B tandis que les petits Qwen locaux 35B et 27B sautent à S pour l'usage hors ligne, le fine-tuning des banques et assureurs, et le travail qui ne doit pas fuiter les données. Gemma 4 31B monte sur une qualité ajustée à la taille, bien devant Gemini lui-même. Gemini 3.1 Pro est C, et Mistral est A uniquement parce que l'Europe n'a pas d'autre acheteur pour les banques ; les poids seuls vaudraient D.

Le classement des harnesses commence avec Antigravity à B, remonté de D par l'accès gratuit et la disponibilité d'anciens Opus malgré les renommages constants. Claude Code monte de B à A sur le contrôle à distance, la messagerie agent-à-agent et les changements d'effort en cours de tâche qui ne cassent plus le cache, avec un bon rapport prix-quotas tant que les limites ne baissent pas. Codex est un S franc sur un plan fermé à 200 dollars avec de lourds quotas et réinitialisations, utilisable dans Hermes Agent et d'autres agents, plus un navigateur et un usage ordinateur qui a configuré Cloudflare et la messagerie Workspace et construit un site en glisser-déposer. Cursor passe à A sur une infrastructure solide et des quotas en hausse après l'accord SpaceX, avec la qualité Grok et une équipe qui comprend les harnesses.

Hermes Agent est S comme assistant personnel plutôt que pur codeur, exécuté sur un serveur et piloté depuis Telegram, présenté comme capable d'automatiser une grande partie du travail de service des startups. Pi agent partage le haut du classement pour la simplicité et l'adaptabilité, avec OMP comme jumeau côté client d'un développeur turc résolvant des problèmes similaires. OpenCode est B car la harness ressemble à une application prétendant être un terminal, Kilo Code et Cline sont des C vieillissants, Devin est D, Windsurf n'est pas classé faute d'usage, et GitHub Copilot est D avec des quotas en réduction.

Les modèles média ferment le tableau. ElevenLabs est S sans vrai rival, Veo 3 est B car Seedance a ouvert un écart visible, bien que Veo puisse encore mener sur les prompts turcs et coûte moins cher ; une anecdote e-commerce voit un utilisateur passer à Seedance et y rester. Nano Banana 2 descend à B tandis que GPT Image 2.5 prend l'avantage sur la qualité, le prix et les mises à jour, utilisé ici dans Codex sous contrôle d'Astra. GPT Image 2.5 est S, Suno est S comme créateur de musique inégalé, Seedance 2.5 est S dans une ligue des champions à part, Gemini Embedding 2 est S pour l'indexation conjointe vidéo, audio et texte qui simplifie le RAG, et les embeddings Qwen sont à B. Le calcul final est personnel : 400 dollars par mois sur Claude Code plus Codex pourraient être réduits au tiers ou au quart à 95-97 pour cent de qualité, mais le travail d'orchestration plus un écart de qualité de cinq à dix pour cent rend le paiement supérieur le choix rationnel pour une production lourde et le mauvais choix pour les étudiants.

Visualization: nodesdaily AI

Commentaire de l’IA

""Je vois cette mise à jour comme un registre prix-performance plus qu'un classement de capacités, et sur ce registre, le calcul des abonnements l'emporte désormais sur les scores bruts de benchmark.""

Évaluation de l’IA

L'objection la plus forte à ce tier list est qu'il tarife la pile d'abonnements d'une seule personne, pas les modèles en vase clos. Les forfaits IA à prix fixe plient déjà sous les charges d'agents, avec des fournisseurs qui rognent discrètement les quotas et GitHub Copilot passant à l'usage mesuré. Si le calcul du tout-illimité à 20 dollars casse, plusieurs tiers S tarifiés sur la générosité des abonnements devraient être recomptés.

Ce que la vidéo ne montre pas, c'est la méthode : pas d'ensemble de test fixe, pas de durées, pas d'exécutions répétées. Les prix cités ici bougent à l'heure, des fenêtres de pointe de DeepSeek à une baisse de 75 pour cent sur les lectures de cache Fable et un chiffre par tâche autour de neuf cents sur GLM Flash. Je traite chaque nombre ci-dessous comme un instantané de septembre et je revérifie avant toute décision d'achat.

La provenance compte sur deux affirmations. La discussion de sponsoring Kimi est divulguée comme une conversation, pas un accord, et l'affirmation de 2,8 mille milliards de paramètres en poids ouverts doit être testée de manière indépendante ; les critiques externes qualifient K3 d'option à poids ouverts la plus capable mais aussi la plus chère et la plus lente d'entre elles. Le verdict Seedance tombe alors que des studios menacent ouvertement de poursuites au sujet des images d'entraînement, donc je garde la louange sur la qualité vidéo séparée du risque juridique.

Pour ma propre pile, la répartition est simple. Si je facturais moins de 20 dollars par mois d'usage mesuré, je vivrais sur des abonnements de type Luna plus des modèles locaux Qwen ou Gemma pour les données privées. Comme mon travail paie des exécutions d'agents soutenues, Codex plus Claude Code se justifie, avec Kimi K3 comme porte de sortie à poids ouverts et Seedance plus ElevenLabs uniquement pour les travaux vidéo payés.

Sources

10 liens ; 5 d’entre eux sont aussi cités par 24 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

tier list · astra · prix/performance

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…