Retour au fil

Grok 4.7 est arrivé : Elon a-t-il tenu sa promesse ? À moitié prix, à un pas de la frontière

Livré discrètement le 21 septembre au **même prix et à la même vitesse**, **Grok 4.7** de xAI passe au crible de Matthew Berman face à la prédiction d'Elon Musk d'une parité avec Opus 5 ; le bond de **33% à 46,3% sur CursorBench 4.0**, **71% sur DeepSWE**, **38% sur Terminal-Bench 4.0** et **19,6% sur Legal** explique sa **cinquième place** derrière Fable 5.1 et Astra, tout en bouleversant le **coût par tâche** à **2 $ / 6 $**.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — MJllZbpvrAc
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Une prédiction d'Elon Musk vieille d'une semaine — Grok 4.7 devrait être au niveau d'Opus 5, pas 5.1 — a rencontré la réalité le 21 septembre lors d'un lancement silencieux à prix et vitesse identiques que Matthew Berman décortique. Le blog xAI présente Grok 4.7 comme son modèle le plus capable pour le code et le travail de connaissance : il tient plus longtemps sur les tâches difficiles, vérifie mieux son propre travail et embarque l' empilement de garde-fous le plus calibré à ce jour. Sous le capot : base plus large , apprentissage par renforcement plus long axé sur les tâches de plusieurs heures et compréhension native du harnais Grok Bot , plus une nette amélioration pour documents et présentations. Tarif gelé : 2 $ l'entrée, 0,50 $ le cache, 6 $ la sortie par million de jetons — le double en variante rapide — et un retard assumé : l'équipe aurait trop pénalisé la longueur de réponse en RL , le modèle abandonne trop tôt et ne se vérifie pas assez .

Coût et densité d'intelligence : lire CursorBench

CursorBench 4.0 mesure les agents IDE sur longue durée et le fait que xAI possède désormais Cursor pèse sur le tableau. Berman trace score en Y, coût moyen par tâche en X ; l'idéal est en haut à droite. Grok 4.7 passe de 33% à 46,3% entre low et xhigh , l'une des plus fortes progressions hors GPT-5.6 Soul . À la frontière, il reste juste derrière Opus 5 en thinking maximal , mais pour environ moitié moins cher . Une seconde vue remplace le coût par le nombre moyen de jetons de sortie par tâche ; moins c'est mieux , signe de densité d'intelligence . Dans cette optique Grok 4.7 colle Opus 5 ; Fable 5.1 gagne au score à budget jetons comparable, mais son prix par jeton plusieurs fois supérieur fait grimper la facture par tâche . Le message : le score seul ne tranche pas, le score divisé par la facture tranche .

Le troisième angle du même graphique compte les étapes par tâche , où GPT-5.6 Soul paraît le plus efficace — l'impression vécue de Berman d'un modèle allant droit au but. Fable 5.1 reste au sommet. La famille Grok est juste derrière la frontière sur étapes et jetons : bon marché en low, plus coûteuse mais plus précise en xhigh. La fiche modèle et la doc Cursor formalisent le choix : 256k standard, 500k long , avec x2 en standard et x3 en rapide au-delà de 256k , déclenché sur la seule longueur d'entrée . Cette règle fait d'une décision d'architecture une décision économique .

Côté code, DeepSWE v1.1 (DeepSuite) — le meilleur proxy du ressenti des ingénieurs en production — affiche Grok 4.7 71%, Soul 72,7%, Fable 5.1 70% ; Grok semble devant. Berman pointe la présentation sélective : le blog xAI omet Astra . Quand Astra se réajoute, Astra Max 74,1% prend la tête et le sommet réel change. AA Briefcase (travail de bureau multi-heures) voit Grok 4.7 et Fable 5.1 Max au coude à coude, tandis que Terminal-Bench 4.0 creuse : Grok 38% contre Fable 57,9% et Astra 58,2% — l'aptitude au terminal rythme la vitesse agente. Le juridique inverse la hiérarchie : Grok 19,6% domine , sur un héritage familial ( 4.6 à 15,8% ) ; Soul 2,5%, Fable 6,7%, Astra 5,4% décrochent, mais Muse Spark 1.2 à 42% les bat tous . HealthBench est à égalité, Electrical Engineering Bench à 66% place Grok deuxième derrière Astra — sans Astra, Grok gagnerait. Motif : frontière proche sur bureau et juridique, un cran derrière sur terminal et code lourd .

Prix, fenêtre de contexte et économie de la course

xAI construit son prix comme un cran sous la frontière plus offre abondante . Grok 4.7 à 2/6 $ face à Opus 5 5/25 $ et Fable 5.1 10/50 $ — environ 2× pour Soul, 5× pour Fable et Astra . La fiche et Cursor explicitent le multiplicateur longue fenêtre, mais la logique d'affaires est la surcapacité GPU : xAI a sur-investi sans demande frontière suffisante, donc baisser le prix crée l'usage . Berman relie cela à la note Gavin Baker : 62% des jetons entreprise en poids ouverts contre 38% fermés , car l'ouvert est moins cher, plus contrôlable, plus privé . Pourtant la valeur s'accumule encore chez OpenAI et Anthropic — un jeton consomme les mêmes flops, mémoire et watts , la marge migre vers l'infrastructure . Leçon : pas de réponse frontière, pas de prix frontière ; certaines industries paieront 5× pour la meilleure réponse, d'autres veulent une automatisation suffisante, pas chère .

GDPval, Briefcase et le nouveau bouclier de sécurité

L'épreuve de réalité du travail de connaissance tient en deux tables Elo : GDPval-AA Fable 1735, Grok 1695, Astra 1542 ; Briefcase Fable 1678, Grok 1657 . Pourquoi xAI montre Astra en GDPval et le tait en DeepSWE devient parlant — transparent où fort, discret où faible . L'autre titre du blog est la nouvelle pile de sécurité : résistance la plus forte aux refus et jailbreaks , Q* prompter et leadership sur le double usage (cyber, bio) pour utilité bénigne et refus sûr . Chiffres : LatchBio biosafety 62,4% au sommet , Capabilities 44,5% en xhigh , HackerBench v0.3 ne laisse passer que 3,3% des requêtes risquées . xAI ouvre un accès sur invitation pour partenaires cyber au red-team. Mécanisme : 11 benches de capacités (expression ARN, épigénomique, variant, découverte thérapeutique) moyennés, avec BioSecBench-Refusal/Surveillance/Function . Résultat : Grok conserve le savoir bio général tout en franchissant un cap capacitif à double usage , mais ces mesures sont sans garde-fous — les filtres produit sont une couche à part.

La note de lancement éprouve la grande promesse. Le post d'Elon du 12 août ‘Grok 4.7 dépassera tous les modèles actuels’ se lit désormais — proche de Fable 5 mais pas 5.1 — et Berman y voit le très typique Elon : échéances agressives, prévisions agressives , sans parier contre lui à long terme. Le mot sur le retard garde le même ton : Grok 4.7 doit cuire encore quelques jours, on a peut-être trop pénalisé la longueur ou autre chose en RL — le ‘ou autre chose’ fait sourire, mais le diagnostic reste : abandon précoce, auto-vérification insuffisante . Disponibilité immédiate : Cursor et Grok Build, plus API Grok, harnais tiers et routeurs , identité grok-4.7 . Le fil rouge de Berman est la concurrence : plus d'acteurs, mieux pour l'utilisateur ; Grok 4.7 atteindra peut-être la frontière en 4.8/4.9, mais dès maintenant il est assez proche et remarquablement rentable .

La validation externe vient de l' Artificial Analysis Intelligence Index v4.3.2 : Fable 1er, Astra 2e (ex æquo), Opus 3e, Muse Spark 1.3 Max 48 4e, Grok 4.7 (xhigh) 46 5e — GLM-4.7 et Kimi K3 juste derrière en poids ouverts. L'indice agrège dix évaluations : Briefcase, GDPval, AutomationBench, Terminal-Bench, SciCode, HLE, etc. +2 points sur 4.6 semble modeste, mais +111 Elo en Briefcase à 1657 et +90 en GDPval à 1695 signalent l'agent long terme. Le bémol confirmé : les gains viennent avec plus de jetons — ~81k de sortie par tâche pour 4.7 contre 38k pour 4.6, 60k pour Muse 1.3, 27k pour Astra . Donc l'indice seul ne raconte pas le coût ; coût par tâche et vitesse doivent être lus ensemble . Le fait que 4.7 sélectionné n'apparaisse pas en coût par intelligence tandis que 4.6 tourne autour de 2 300 $ pour l'indice ancre l'attente d'une bande bas coût similaire pour 4.7 .

Le post-scriptum de la fenêtre de contexte pèse aussi : 256k standard, 500k long pour 4.6/4.7 , 1M pour presque toute autre frontière . Invisible sous 250k, décisif pour très gros dépôts, dossiers juridiques longs ou rapports de centaines de pages . Facturation : jusqu'à 256k au tarif de base, au-delà x2 (standard) ou x3 (rapide) — le long ne dépend que de la longueur d'entrée . Cela lie arithmétique des coûts et stratégie de contexte : compresser, découper ou mettre en cache fait baisser la facture. C'est là que l'architecture devient économie .

Les premiers retours terrain sont contrastés mais instructifs. Le post de Musk ‘il y a une heure xAI passe troisième derrière Anthropic et OpenAI en code agentique’ donne le ton ; la démo de Bobby Grok 4.7 vs Kimi K3, qualifiée d’‘épouvantable’ dans la vidéo, est tempérée par Berman par réglages et harnais . Les ponts d'automatisation comme Zapier (9 000+ apps, serveur MCP, références Cursor/Nvidia/Samsung/Dropbox/Shopify, flux Gmail→Asana) montrent où le modèle brille comme levier prix/performance pour le travail de connaissance , non comme promesse creuse. Bilan sobre : Grok 4.7 n'est pas la frontière absolue, un cran derrière ; mais à moitié prix et même vitesse il transforme le ‘suffisamment bon’ en ‘hautement rationnel’ pour les équipes qui automatisent.

Visualization: nodesdaily AI

Coût par tâche : sommet code

  • Grok 4.7$3 avg
  • Opus 5$10 avg
  • Fable 5.1$15 avg
  • Muse 1.3 open~$1.5
Moyenne $/MTok ; facture réelle selon jetons et étapes.
SujetStatut
Prix Grok 4.7$2 / $6 même vitesse, 500K long
Sommet codeDeepSWE 71%, Terminal 38%: derrière
Bureau & juridiqueGDPval 1695, juridique 19,6%: proche frontière
ModèleEntrée / SortieCursorBench
Grok 4.7$2 / $646,3% xhigh
Opus 5$5 / $25~47–48%
Fable 5.1$10 / $50~52%+
Muse Spark 1.2poids ouvert42% juridique

Moments clés

  1. Pari Elon : parité Opus 5
  2. CursorBench 46,3% vs 33% écart
  3. DeepSWE 71% et retour d'Astra
  4. Terminal 38% vs 58% écart
  5. Juridique 19,6% et Muse Spark 42%
  6. Prix et ouvert 62%
  7. GDPval 1695 et bouclier

Commentaire de l’IA

"Mon premier réflexe a été de ne pas me laisser tromper par le coin supérieur droit. Le quasi-match de Grok 4.7 face à Opus 5 semble une victoire ; j'ai choisi de filtrer chaque graphique par **coût, densité de jetons et fenêtre de contexte**, car lire le score sans le prix égarerait tout choix opérationnel."

Évaluation de l’IA

Défendre d'abord le cas haussier : geler le prix tout en poussant le RL longue portée déplace réellement la frontière coût-performance , surtout pour la production bureau et juridique où la génération longue domine ; pour un acheteur optimisant le coût par tâche , payer 5× pour ~5 points de plus de Fable 5.1 peut ne pas être rationnel, et le LatchBio 62,4% / HackerBench 3,3% ajoute un filtre risque corporate.

La limite apparaît dans la méthode et la présentation. xAI possède Cursor — biais de sélection perçu ; retirer Astra du tableau DeepSWE renforce la lecture cherry-picked ; l'écart Terminal-Bench de 38% à ~58% compte pour le code agentique lourd, et le doublement des jetons de 38k à 81k gonfle la facture ; le plafond 500k vs 1M pèse sur les très gros dossiers. Certains scores sont spécifiques au harnais Grok Build et attendent réplication.

Sur la vérification c'est mitigé mais testable : blog x.ai et fiche modèle cohérents sur prix, contexte et RL ; Artificial Analysis recoupe Elo et jetons en mesure indépendante ( Briefcase 1657, GDPval 1695, ~81k ) ; llm-stats alerte sur les comparaisons inter-efforts . Pourtant le ‘meilleur’ dépend du benchmark et du harnais , et l'outlier Muse Spark 42% en juridique montre qu'un win de niche ne se généralise pas.

Lecture pratique sélective : pour les équipes à gros volume d'automatisation, tolérance d'erreur moyenne et contextes 256–500k , Grok 4.7 est un levier frappant , peut-être champion prix/performance pour juridique et documents bureau . Pour code agentique lourd en terminal et profondeur 1M , Fable/Astra/Opus restent un cran devant ; ceux qui veulent la meilleure réponse paieront encore 5×. Décidez en dollars et densité de jetons par tâche, pas au tableau d'affichage .

Sources

8 liens ; 3 d’entre eux sont aussi cités par 6 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

grok 4.7 · xai · cursorbench · deepswe · terminal-bench · tarification ia · fenêtre de contexte

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…