Une seule semaine loin de l'actualite IA suffit pour qu'une generation de modeles vous passe devant, et c'est exactement sous cette pression que Google a revele Gemini 4 Argon. Baptise Aragorn par les fans de Tolkien, le nouveau modele amiral n'est, selon l'annonce Blog Google, accessible qu'aux partenaires cybersecuritaires selectionnes du programme Fairwind de DeepMind ; l'acces elargi sera d'abord deploye aupres des clients API payants et des abonnes Google AI Ultra, avant une ouverture progressive au grand public.
Le narrateur met en avant le prix comme le detail le plus frappant, et l'enthousiasme se justifie quand on consulte la grille tarifaire de Blog Google : en periode promotionnelle, comptez 2 dollars par million de tokens en entree et 10 dollars en sortie, avec une remise de 95% sur les tokens d'entree mis en cache. Une fois la promotion terminee, la facture passera a 4 puis 20 dollars ; meme a ce niveau, Argon reste sous la plupart de ses pairs frontieres a capacite comparable.
Plus spectaculaire encore, Google pousse la limite de sortie maximale de 64 000 a un million de tokens. Ce bond signifie que le modele peut generer des centaines de milliers de tokens en une seule trajectoire sur des taches longues et multi-etapes : analyse complete d'un depot de code ou redaction integrale d'un rapport de recherche sans morcellement. Combine a une faible variance de latence, cela place Argon deja parmi les candidats credibles pour un usage professionnel quotidien intensif.
Le jugement du narrateur est net : Argon n'est peut-etre pas le meilleur modele de codage, mais sur le pur travail de connaissance textuelle, il figure parmi les options les plus convaincantes du moment. La presentation affirme que GPT-6 Astra, Fable 5.1 et meme Opus 5.5 restent derriere Argon en cognition de bureau, pendant que la fenetre de contexte d'1M tokens permet d'avaler des centaines de milliers de tokens d'un seul passage, ce qui ouvre la porte a l'analyse de corpus de la taille d'un livre ou d'archives d'entreprise entieres.
De Nouveaux Leaders aux Benchmarks
Chaque lancement se vante, mais celui-ci apporte des preuves. Le modele affiche 77,9% sur DeepSWE v1.1 pour l'ingenierie logicielle longue reelle, domine l'indice Vals qui pondere finance, code, droit et fiscalite par leur part au PIB americain, s'octroie la premiere place du AutomationBench de Zapier a 51,3%, et etablit un record de 91,7% sur le benchmark de comprehension video longue dont la methodologie est publiee sur arXiv sous le nom LVBench.
L'efficacite cout resserre encore le recit. Selon artificialanalysis.ai, Argon marque 53 points a l'Intelligence Index, egalant GPT-6 Astra (max) et devancant GPT-6.1 Sol (max) d'un point ; son cout par tache s'eleve a 1,99 dollar, soit environ 60% des 3,26 dollars d'Astra, meme s'il reste 2,7 fois plus cher que les 72 centimes de Sol. Le point le plus remarquable reste pourtant le taux d'hallucination : 15%, le plus bas jamais mesure par Artificial Analysis parmi les modeles a 45 points et plus, contre 51% pour Astra et 54% pour Sol.
La performance agentique, historiquement le maillon faible des generations Gemini, s'inverse cette fois. Argon domine AutomationBench-AA avec 78% (contre 71% pour Claude Sonnet 5.5), poste 57% sur Terminal Bench 4, et, selon la couverture de helpnetsecurity.com, est deja utilise par l'initiative Scan for Good de Wiz pour detecter des vulnerabilites critiques dans des logiciels hospitaliers. Une premiere place partagee a 68% sur CWE-bench v1 corrobore le pipeline reel de decouverte et de correction de failles.
Les retours d'usage interne a Google expliquent pourquoi le modele a mur si vite. Les chercheurs DeepMind ont gagne 40% par rapport aux bases publiees sur l'optimisation spatio-temporelle quantique ; les equipes infrastructure ont recupere plus de 300 Tio de memoire (avec des economies projetees de 500 Tio a 1 Pio) ; et pendant la migration C/C++ vers Rust de libgav1, 32 000 lignes SIMD ont ete remplacees par du Rust sur, vectorise automatiquement, 2,7 fois plus rapide. Cette boucle de production auto-ameliorante est sans doute le vrai moteur du rythme evolutif rapide.
Tests Precoces : Des Voxels a SVG
Les sequences de test partagees par le narrateur indiquent aussi un progres tangible sur la generation visuelle. Un bosquet de cerisiers en fleurs construit de plus de 106 000 voxels resiste aux variations dynamiques jour/nuit, la manette PS5 rendue en SVG frise la fidelite photographique, et les demos d'abeille mecanique, de Colisee ou d'avion 3D flottant affichent un niveau de detail et de finition bien superieur aux generations Gemini precedentes. Le narrateur previent cependant : on ne sait pas exactement lesquelles ont ete produites avec les poids finals d'Argon, donc mieux vaut decoter l'attente.
Verdict final : Argon n'est pas le premier sur chaque dimension, mais dans la triade cout-capacite-fiabilite, il est sans conteste le modele le plus equilibre de l'annee. Le codage tranchant reste la niche de GPT-6 ou Sonnet ; en revanche pour le travail quotidien, les documents longs, l'analyse multimodale et la cyber-defense, Argon semble destine, selon les mots du narrateur, a occuper le premier tiroir.
Et Les Rivaux, Que Feront-Ils ?
Commentaire de l’IA
"Mon analyse : ce lancement n'est pas le plus spectaculaire de l'annee, mais c'est peut-etre le plus intelligent. Plutot que de courir apres les titres de modele vedette, Google consolide le flanc de l'efficacite cout. Prix, capacite et fiabilite forment ici un triangle reellement equilibre."
Évaluation de l’IA
Le contre-argument le plus solide : presque tous ces chiffres proviennent de la communication Google et n'ont pas encore ete stress-testes en independant par des tiers a grande echelle ; les modeles early access se comportent souvent differemment sous les conditions reelles du public. De plus, le tarif promotionnel est temporaire : a l'expiration, le cout par tache montera de 1,99 a 3,98 dollars, reouvrant le calcul concurrentiel.
Les limites meritent autant d'attention : Argon ne produit actuellement que du texte (entree multimodale oui, generation visuelle non), la disponibilite reste restreinte a une cohorte choisie, et la robustesse des engagements du Frontier Safety Framework de Google est a surveiller plutot qu'a presumer. Les motivations commerciales du narrateur comptent aussi : une chaine financee par sponsors et newsletters a un biais structurel vers l'enthousiasme.
Implication pratique : ne migrez pas en masse avant la disponibilite generale, mais commencez a cartographier vos charges pilotes des maintenant. Analyse documentaire long contexte, travail de connaissance d'entreprise et operations cyber strategiques correspondent exactement au terrain ou un pilote Argon rentable prend son sens ; et surveillez si les leaders baissent leurs prix en reaction, car cette onde comptera plus que le lancement.
Sources
7 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — AI video report
- @blog.google Google Blog — Gemini 4 Argon announcement
- @deepmind.google Google DeepMind — Fairwind Program
- @artificialanalysis.ai Artificial Analysis — Gemini 4 Argon review
- @vals.ai Vals — Index benchmark
- @arxiv.org arXiv — LVBench methodology
- @helpnetsecurity.com Help Net Security — Argon coverage
gemini 4 argon · google deepmind · intelligence artificielle · fairwind · benchmarks llm