La vidéo s'ouvre sur une affirmation audacieuse : toutes les routes mènent à GLM. L'hôte explique avoir changé le titre de sa précédente vidéo à cause de la sortie de DeepSeek V4 Flash et du buzz autour du harnais OMP, et le titre est désormais de retour. Cette vidéo se lit donc comme un bilan d'environ un mois passé à parcourir le palier Flash des modèles.
Deux versions sont sur la table : GLM-5.3 (le modèle complet) et GLM-5.3-Flash, toutes deux publiées le 26 août 2026. Flash est un MoE de 320 milliards de paramètres avec environ 18 milliards actifs par token. Une conception d'attention hybride linéaire plus creuse, un entraînement nativement multimodal, une licence MIT et une fenêtre de contexte d'un million de tokens complètent le tableau. Le modèle circulait incognito sous le nom d'ox-alpha sur OpenCode et OpenRouter pendant environ une semaine avant la révélation.
La tarification est le nerf de la guerre : Flash coûte 0,075 $ par million de tokens d'entrée et 0,25 $ par million de tokens de sortie, avec une entrée en cache autour de 0,011 $. C'est environ un dixième de la fourchette de 1,4 $/4,4 $ évoquée pour le modèle complet. La thèse de la vidéo se noue ici : pour les équipes qui font tourner des charges de travail d'agents toute la journée, cette ligne décide de l'économie du projet.
Concernant l'inférence locale, les chiffres rapportés dans la vidéo sont les suivants : Flash atteint environ 170 à 180 tokens par seconde en précision native (poids FP8, tour de vision BF16), tandis que DeepSeek V2 Flash est cité près de 350 et GLM-5.2 en 3,25 bits près de 100 tokens par seconde. Le GPU de l'hôte est mort et attend son remplacement, ces chiffres doivent donc être lus comme les mesures propres de la vidéo ; les tests côté API ont été délibérément évités.
Les scores d'agents proviennent de Terminal-Bench 2.1 : 0,9 minute pour échouer, 3,2 minutes pour résoudre. L'analyse de l'hôte sort du cadre habituel : quand un humain est dans la boucle, l'échec rapide est une bénédiction, puisque vous donnez votre consigne et retournez au travail. La vitesse de résolution est en retrait par rapport à DeepSeek V4 Flash mais double environ GLM-5.2, avec la réserve que des choix de harnais comme OMP font bouger les chiffres.
La section la plus animée est la dispute sur la vision : après des publications liées à un classement de détection d'objets côté Roboflow qui donnait à GLM-5.3 un score faible, l'hôte construit son propre test. Sur la tâche de marquer chaque bananier dans une photo aérienne d'une ferme, son essai s'avère bien meilleur que le score partagé. Il note ouvertement que son matériel de test se limite à une seule image, donc ni un score ni une image ne devraient suffire à un jugement définitif.
Une leçon générale s'ensuit : les détecteurs d'objets classiques sont des constructions à tâche unique, et tout changement de tâche implique de réentraîner ou de reconstruire la scène de simulation de zéro. L'hôte emploie le mot général avec une modestie délibérée ; la revendication n'est pas une intelligence artificielle générale mais un outil largement utile, comme un modèle de langage générant du texte. C'est aussi pourquoi la vision compte : quand on conçoit une page web, un PDF ou une présentation, un modèle qui travaille avec ce qu'il voit fait la différence.
La démo robotique est la porte d'entrée de la vidéo vers le monde physique : GLM-5.3 Flash se branche sur le SDK du robot, combinant avancer, tourner, les mouvements épaule-coude-pince et l'accès caméra dans un seul modèle. Dans l'enregistrement, le modèle affine son approche avec ses roues près du bloc, puis accomplit une tâche de ramassage d'objets au sol. La remarque de l'hôte est notable : la configuration a été étonnamment facile, et elle peut être poussée plus loin.
La conclusion apporte des notes sur l'écosystème : selon le rapport de CNBC du 3 septembre 2026, Nvidia achète Hugging Face pour près de 13 milliards de dollars, changeant de mains le canal de distribution des modèles à poids ouverts. Un nouveau modèle Qwen se murmure à l'horizon, tandis que le statut de licence du coup de Meta avec Muse reste flou même dans la vidéo. Le verdict de l'hôte est net : GLM-5.3 Flash est le modèle du quotidien pour l'instant, avec des tests plus approfondis à venir une fois le matériel de retour.
Commentaire de l’IA
"« Mon avis : le palier Flash n'est plus un compromis, c'est le choix par défaut pour la plupart des travaux. Cette vidéo montre pourquoi, point par point. »"
Évaluation de l’IA
Pour défendre le camp du classement : une seule image de bananeraie n'innocente pas un modèle ; les jeux de tests standard existent précisément pour cette raison, et l'expérience de l'hôte se limite à l'unique image qu'il a pu trouver. Je prends cette objection au sérieux, mais l'inverse vaut aussi : si les images brutes des tests ne sont pas publiques, le classement ne peut pas être audité de l'extérieur, et un score faible unique peut marquer l'angle mort du test plus que le verdict sur le modèle.
Deux points restent non testés dans la vidéo. Premièrement, le travail désordonné sur de vrais dépôts avec un contexte éclaté : les tâches d'agents courtes et les essais sur image unique ne représentent pas des travaux de production multi-fichiers, où les modèles payants prennent généralement l'avantage. Deuxièmement, la dimension sécurité : confier à un modèle l'autorité sur un terminal et du matériel robotique fait reposer sur l'utilisateur l'audit de chaque commande exécutée, et la vidéo n'aborde jamais cette responsabilité.
Les chiffres proviennent d'origines mixtes, je les ai donc séparés en deux : la fourchette de prix se vérifie sur des pages de tarification indépendantes, mais les vitesses locales et les durées de Terminal-Bench sont les mesures propres de la vidéo ; le matériel et les choix de harnais les font varier, et je voudrais une mesure indépendante avant de trancher. Mon bilan : Flash est une option réelle pour les bidouilleurs qui veulent la vision et le code dans un seul modèle et tiennent à garder les données sur l'appareil, mais pas pour confier des secrets de production à des points d'accès gratuits limités par quota.
Sources
7 liens ; 2 d’entre eux sont aussi cités par 2 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=PJBZmCy1Hfg
- @eigent https://www.eigent.ai/blog/glm-5-3-flash-multimodal-model
- @pricepertoken https://pricepertoken.com/pricing-page/model/z-ai-glm-5.3-flash
- @regolo https://regolo.ai/deepseek-v4-flash-vs-qwen3-8-flash-next-vs-glm-5-3-flash-the-real-leader-in-quality-to-price-in-2
- @cnbc https://www.cnbc.com/2026/09/03/nvidia-agrees-to-buy-hugging-face-for-almost-13-billion-ai-expansion.html
Également cité par : OpenAI Astra vs Anthropic: The Next-Gen Model Wars
- @x https://x.com/skalskip92/status/2092748231998386597
- @aihubmix https://aihubmix.com/blog/glm-5-3-flash-pricing-compared-openrouter-z-ai-and-aihubmix
Également cité par : OpenCode and Local Models: The Real Power of Free AI Agents
glm-5.3-flash · z.ai · économie des agents