Avenox présente cela comme une vidéo de mise à jour, pas un classement froid. Le format mêle ordre et notes de contexte et jugements personnels, ce qui compte car des dizaines de nouveaux modèles sont arrivés d'un coup et un simple tableau S-à-D cacherait le raisonnement.
GPT-5.6 Luna garde le tier S sur le rapport prix-performance. Un abonnement à 20 dollars se comporte comme un usage quasi illimité, valant des centaines de dollars en dépense mesurée, donc les utilisateurs sensibles au budget font la meilleure affaire ici. Un GPT-6 Luna à venir ne fera que renforcer l'argument de rester dans cette voie.
Terra descend à C tandis que Sol monte à S, avec une correction jointe. Terra coûte environ dix fois Luna sans justifier cet écart, tandis que le prix affiché de Sol était erroné et se situe autour de 30 dollars en sortie. Le chemin de mise à niveau attendu de Sol aux côtés d'Astra le ramène au tier supérieur.
Claude Fable 5.1, c'est-à-dire la dernière ligne Fable, reste S malgré les plaintes sur le coût et les quotas. Toute la série se lit de manière cohérente de haut en bas, et la qualité du modèle l'emporte sur la douleur tarifaire dans ce compte rendu.
DeepSeek 4.1 Flash atterrit à A après une hausse de prix. La tarification aux heures de pointe touche la barre des 1,2 dollar et la bon marché de l'ère Pro est révolue. Face à un abonnement Luna valant 300 à 400 dollars d'usage API, DeepSeek peut coûter jusqu'à trente fois plus à son public de base, même si le labo garde le respect.
GLM 5.3 Flash prend S sur le prix plus la logique d'abonnement. Les crédits API mesurés décident rarement des coûts réels, et une voie par abonnement le rend bien moins cher en pratique. MiMo tombe à C comme dépassé même pour le nettoyage de masse à bas coût, tandis que Gemini 3.8 Flash garde B pour la vitesse et la lecture vidéo malgré un appel d'outils faible et des hallucinations fréquentes.
MiniMax M3 se stabilise à B comme adéquat sans excitation. Un tier gratuit sur OpenRouter plus des applications bon marché et un écosystème croissant aident les étudiants et le travail quotidien léger. Le doute est tourné vers l'avenir, avec les lignes Claude et GPT attendues en croissance, plus une divulgation qu'aucune entreprise ne sponsorise la chaîne hormis une discussion en cours avec Kimi. Meta Muse Spark 1.3 Contributor suit comme le choix API bon marché à dix à vingt cents avec partage de données, sensé surtout sous 20 dollars d'usage mensuel, exactement comme prédit deux mois plus tôt.
Sonnet 5 passe de B à A sur une baisse vers le niveau des 10 dollars. À six ou sept dollars il serait S, car le modèle lui-même est bon et seul le prix était faux. À prix Terra, Sonnet gagne à chaque fois. Opus 5 reste un S permanent comme série quotidienne préférée pour l'étendue et les manières, tandis que Kimi K3 rejoint S pour les poids ouverts, l'auto-hébergement en entreprise sans fuite de données, un plan à 200 dollars apprécié et trois mille milliards de paramètres. La pièce manquante est une ligne Kimi plus petite pour les agents subordonnés dans la barre des un à deux dollars.
Grok 4.6 prend A sur le prix, l'écosystème et les avantages côté Cursor. Les longues exécutions non supervisées n'inspirent pas encore la même confiance qu'Astra, Fable ou Kimi. Hy4 Preview est un C sans histoire, Nemotron un D franc, et GLM 5.3 répète à S. Le problème de DeepSeek est désormais une concurrence encombrée de Luna, Muse Spark au sixième de son prix, et GLM Flash jusqu'à ce qu'il lance son propre abonnement.
GPT-6 Astra revendique le siège du haut et, dans ce compte rendu, le titre de meilleur modèle à ce jour. La lecture de scènes en trois dimensions, le repérage de fins détails, le suivi des règles, un raisonnement solide et aucune coupure de quota en milieu de plan portent l'argument. Les styles de travail diffèrent, donc certains utilisateurs peuvent ne pas être d'accord, et discuter reste plus agréable sur Fable. Le lancement est même lu comme un dommage pour l'IPO d'Anthropic, avec un nouvel Opus ou un Fable plus grand attendus bientôt.
Les modèles locaux ouverts obtiennent leur propre échelle. Qwen Max se situe à B tandis que les petits Qwen locaux 35B et 27B sautent à S pour l'usage hors ligne, le fine-tuning des banques et assureurs, et le travail qui ne doit pas fuiter les données. Gemma 4 31B monte sur une qualité ajustée à la taille, bien devant Gemini lui-même. Gemini 3.1 Pro est C, et Mistral est A uniquement parce que l'Europe n'a pas d'autre acheteur pour les banques ; les poids seuls vaudraient D.
Le classement des harnesses commence avec Antigravity à B, remonté de D par l'accès gratuit et la disponibilité d'anciens Opus malgré les renommages constants. Claude Code monte de B à A sur le contrôle à distance, la messagerie agent-à-agent et les changements d'effort en cours de tâche qui ne cassent plus le cache, avec un bon rapport prix-quotas tant que les limites ne baissent pas. Codex est un S franc sur un plan fermé à 200 dollars avec de lourds quotas et réinitialisations, utilisable dans Hermes Agent et d'autres agents, plus un navigateur et un usage ordinateur qui a configuré Cloudflare et la messagerie Workspace et construit un site en glisser-déposer. Cursor passe à A sur une infrastructure solide et des quotas en hausse après l'accord SpaceX, avec la qualité Grok et une équipe qui comprend les harnesses.
Hermes Agent est S comme assistant personnel plutôt que pur codeur, exécuté sur un serveur et piloté depuis Telegram, présenté comme capable d'automatiser une grande partie du travail de service des startups. Pi agent partage le haut du classement pour la simplicité et l'adaptabilité, avec OMP comme jumeau côté client d'un développeur turc résolvant des problèmes similaires. OpenCode est B car la harness ressemble à une application prétendant être un terminal, Kilo Code et Cline sont des C vieillissants, Devin est D, Windsurf n'est pas classé faute d'usage, et GitHub Copilot est D avec des quotas en réduction.
Les modèles média ferment le tableau. ElevenLabs est S sans vrai rival, Veo 3 est B car Seedance a ouvert un écart visible, bien que Veo puisse encore mener sur les prompts turcs et coûte moins cher ; une anecdote e-commerce voit un utilisateur passer à Seedance et y rester. Nano Banana 2 descend à B tandis que GPT Image 2.5 prend l'avantage sur la qualité, le prix et les mises à jour, utilisé ici dans Codex sous contrôle d'Astra. GPT Image 2.5 est S, Suno est S comme créateur de musique inégalé, Seedance 2.5 est S dans une ligue des champions à part, Gemini Embedding 2 est S pour l'indexation conjointe vidéo, audio et texte qui simplifie le RAG, et les embeddings Qwen sont à B. Le calcul final est personnel : 400 dollars par mois sur Claude Code plus Codex pourraient être réduits au tiers ou au quart à 95-97 pour cent de qualité, mais le travail d'orchestration plus un écart de qualité de cinq à dix pour cent rend le paiement supérieur le choix rationnel pour une production lourde et le mauvais choix pour les étudiants.
Commentaire de l’IA
""Je vois cette mise à jour comme un registre prix-performance plus qu'un classement de capacités, et sur ce registre, le calcul des abonnements l'emporte désormais sur les scores bruts de benchmark.""
Évaluation de l’IA
L'objection la plus forte à ce tier list est qu'il tarife la pile d'abonnements d'une seule personne, pas les modèles en vase clos. Les forfaits IA à prix fixe plient déjà sous les charges d'agents, avec des fournisseurs qui rognent discrètement les quotas et GitHub Copilot passant à l'usage mesuré. Si le calcul du tout-illimité à 20 dollars casse, plusieurs tiers S tarifiés sur la générosité des abonnements devraient être recomptés.
Ce que la vidéo ne montre pas, c'est la méthode : pas d'ensemble de test fixe, pas de durées, pas d'exécutions répétées. Les prix cités ici bougent à l'heure, des fenêtres de pointe de DeepSeek à une baisse de 75 pour cent sur les lectures de cache Fable et un chiffre par tâche autour de neuf cents sur GLM Flash. Je traite chaque nombre ci-dessous comme un instantané de septembre et je revérifie avant toute décision d'achat.
La provenance compte sur deux affirmations. La discussion de sponsoring Kimi est divulguée comme une conversation, pas un accord, et l'affirmation de 2,8 mille milliards de paramètres en poids ouverts doit être testée de manière indépendante ; les critiques externes qualifient K3 d'option à poids ouverts la plus capable mais aussi la plus chère et la plus lente d'entre elles. Le verdict Seedance tombe alors que des studios menacent ouvertement de poursuites au sujet des images d'entraînement, donc je garde la louange sur la qualité vidéo séparée du risque juridique.
Pour ma propre pile, la répartition est simple. Si je facturais moins de 20 dollars par mois d'usage mesuré, je vivrais sur des abonnements de type Luna plus des modèles locaux Qwen ou Gemma pour les données privées. Comme mon travail paie des exécutions d'agents soutenues, Codex plus Claude Code se justifie, avec Kimi K3 comme porte de sortie à poids ouverts et Seedance plus ElevenLabs uniquement pour les travaux vidéo payés.
Sources
10 liens ; 5 d’entre eux sont aussi cités par 24 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=djlec83pVoU
- @openai https://openai.com/index/gpt-6-astra/
Également cité par : Brain and Body: A Single-Screen Agent Setup with GPT-6 Astra on Hermes · Space Bunny Alpha: Inside OpenRouter's Free Anonymous AI Experiment · Robot-Use Agents: Why General-Purpose Models May Win Robot Control · Building a Productive Card Collection App in Minutes with Base44 and GPT-6 Astra · Price War Begins: GPT-6 Sol and Luna Halve Model Costs · Gemini 4 Leak? 10 Interactive 3D Tests Against GPT-6 Astra and Fable 5.1 · Gemini 4 Pro Leaks, GPT-6 Soul in Testing: From Arena to Google Cloud, the Week's AI Shockwave · 10,000 Agents, 88 Hours, $1 Million: AI Mastermind #39 From Code to Cash to Autonomy · Cloning a Channel With One Prompt: The $33K Video Factory Built on GPT-6 Astra and Higgsfield · GPT-6 Astra Guide: How Horizontal Power Turns the Model Into Work Done · From Hand Sketch to Realistic Villa: A Showcase Video with GPT-6 Astra and Higgsfield MCP · The $500-a-Day Claim With GPT-6 Astra: Building Three Business Models End to End (+5)
- @anthropic https://www.anthropic.com/claude-fable-and-mythos-5-1
Également cité par : Voice-Controlled TradingView: 7 Prompts for AI-Assisted Charting with GPT-6 Astra · Racing Astra and Fable 5.1 Across the Same Four Builds: Surprising Results
- @mejba https://www.mejba.me/blog/kimi-k3-open-model-review
- @deepseek https://www.deepseek.com/en/news/deepseek-v4-1-flash/
Également cité par : DeepSeek V4.1 Flash's Insane Architecture: Shared Memory That Shrinks KV Cache 437x · DeepSeek V4.1 Flash and the Split Brain: Challenging Frontier Models with 890-Byte Notes · DeepSeek V4.1 Flash Takes Over for Pro: Asymmetric Design Joins the Frontier-Agent Race · DeepSeek V4.1 Flash: Cheap, Fast and Open — yet Rough on the Test Bench
- @dataconomy https://dataconomy.com/2026/09/11/deepseek-v4-1-flash-ultralow-token-pricing/
- @z https://z.ai/blog/glm-5.3-flash
Également cité par : GLM 5.3 and Freebuff: A Fully Free AI Agent on Your Desktop
- @pcworld https://www.pcworld.com/article/3120296/flat-rate-ai-plans-are-broken-blame-ai-agents.html
- @tech-insider https://tech-insider.org/codex-vs-cursor-vs-claude-code-2026/
- @theverge https://www.theverge.com/ai-artificial-intelligence/883615/seedance-bytedance-tom-cruise-brad-pitt-jia-zhangke
Également cité par : Fitting Million-Dollar Cinema Scenes Into a Laptop: A Seedance 2.5 Experiment
tier list · astra · prix/performance