xAI ouvre sur la thèse que Grok 4.7 est un vrai rival de Fable et Astra pour beaucoup moins cher , et Pat Simmons la vérifie en une seule image avec trois builds lourds. Le dispositif est direct : les mêmes trois prompts sont lancés en même temps sur trois modèles — cloner un lauréat Awwwards pixel par pixel, monter une page produit 3D au scroll pour un clavier mécanique, et cloner Mario Kart sur Rainbow Road — et le tableau s'appuie sur trois mesures : durée, facture, jetons brûlés . La promesse vidéo est de montrer si un écart de prix de cinq fois se referme en qualité réelle ou s'il ne fait que bonifier le tableau. Règle d'une seule passe dès le départ ; aucun modèle n'a droit à une révision.
De la note de presse aux planches : que disent CursorBench et la facture
Le premier acte résume la note de presse clairsemée. Sur CursorBench 4.0 l'axe Y est le succès, l'axe X le coût moyen par tâche ; le coin idéal est en haut à droite. Fable 5.1 en extra-high 51,6%, Grok 4.7 à son effort maximal ~46% — à l'intérieur de quatre points — mais la voie prix s'inverse : Grok 4.7 extra-high 2 $ entrée / 6 $ sortie le million, Fable et Astra 10 $ / 50 $ . Simmons souligne que même si les scores semblent proches, le coût par tâche achevée penche nettement vers Grok, d'où l'étiquette ‘de loin le moins cher’ qui lui colle. Une note honnête reste sur le graphique : xAI possède désormais Cursor , donc un biais de perception plane ; et GBT6 Astra manque à la table CursorBench 4.0 , la comparaison est présentée de façon sélective.
La deuxième couche aligne les scores phares. Sur DeepSuite Grok 4.7 71%, Fable 5.1 70%, GPT-5.6 Soul 72,7% — Grok paraît un peu devant sur le ressenti ingénierie, du moins dans la coupe choisie par la note. Puis le travail de bureau multi-heures (type AA Briefcase) s'équilibre entre Fable, Soul et Grok ; le benchmark d'agent juridique Harvey montre Grok solide, et le raisonnement clinique place aussi Grok 4.7 au-dessus de son prédécesseur 4.6 et près de la ligne Soul/5.1 . Simmons lit la note comme volontairement lumineuse sur le travail de connaissance hors code tout en laissant l'envers caché : les tables lourdes en terminal comme Terminal-Bench inversent la picture , ce que sa slide de synthèse rend explicite — de nombreuses lignes où Grok bat Fable/Astra en bureau et juridique côtoient la note que seul AutomationBench laisse Astra quelques points devant .
Méthode : trois prompts, une passe et le banc clone-app pro
La méthode de Simmons se veut dépouillée : une seule commande bash lance les trois builds sur trois modèles en parallèle . Chaque texte de prompt sera partagé dans le post. La piste commune est one-shot — pas de second essai — ce qui exclut la réalité qu' une itération refermerait l'écart en usage quotidien , mais fige la photo brute de la frontière . La chaîne d'outils est standard : pour le clone Awwwards la skill clone-app-pro est chargée — parcourir le code, capturer des écrans, boucles QA — si bien que goût, navigation, vision et suivi d'instructions sont testés ensemble. La fin est une révélation à l'aveugle : les colonnes A/B/C sont ouvertes une par une et appariées à leurs propriétaires, avec coût et temps inscrits à côté.
Le prompt du premier build est court mais exigeant : aller sur Awwwards, choisir un site primé que tu trouves vraiment impressionnant et le reconstruire pixel par pixel ; charger la skill clone-app-pro, QA ton propre travail par captures . Simmons dit que cela sonde directement le goût — ce que le modèle trouve impressionnant, si le choix est générique ou distinctif — suivi de naviguer le site, percevoir le visuel, charger correctement la skill et construire le web . Les exigences sont minimales ; l'art réside dans la fidélité avec laquelle le modèle restitue un langage primé existant plutôt que d'inventer depuis le vide. Chaque modèle reçoit le même brief ; la divergence naît dans la génération d'assets et le report d'animation .
Clone Awwwards : trois goûts distincts, de l'ASI à la grille minimale
La colonne aveugle A s'ouvre en site corporate recrutement ASI : titre ‘ recrutement d'ingénieurs, chercheurs quantitatifs et scientifiques ML pour les firmes qui font le marché ’, devise ‘construire des outils depuis 2006’ , logos aléatoires épars, boîte de recherche morte, blocs construits en SVG et reveals au scroll étagés — fouillis mais palette équilibrée. La colonne B choisit le langage portfolio-agence Boach Studio / Club Road Coco : filtres Art direction / Brand identity / Campaign , cartes comme Post Code Football Club , lourds placeholders SVG , parfois une ligne seule se souvenant de year/language au lieu du consent — Simmons note ‘ aurait aimé des skills de génération d'images ’. La colonne C brise la routine agence avec l'expérience typographique à grille Minimal de Wim Crouwel — récit ‘ commencer par un carré, programmer un alphabet entier sur une grille minimale ’, grilles qui continuent de bouger au scroll , une longue leçon en page unique. Cette troisième est la favorite de Simmons ; sa longueur et son arc pédagogique gagnent des points bonus.
Le croisement avec les références aiguise la table. Pour la page ASI Grok a choisi la vidéo ‘Visit site’ de Box Studio sur Awwwards — ressemblance lointaine au-delà du report d'animation scroll ; là où les assets manquaient on attendait qu'il les génère , il reste cantonné à des blocs en mouvement. Pour Aspen Search la sortie Fable tombe très proche du site réel — animations partielles manquantes mais assez proche pour confondre vrai et clone , entrées de blocs et bande partenaires quasi à l'identique. Pour la grille Minimal , le choix d'Astra est le vainqueur net : reporter mouvement et grille depuis des captures surclasse les remplisseurs SVG des deux autres. La facture chiffre le goût : Fable 5.1 123 $ (environ 90M d'entrée / 1M de sortie, ~4 000 s), Astra 97 $, Grok 4.7 7 $ (~300 s) — l'étiquette à la fin du premier build colle à Grok : bon marché mais en retrait sur goût et fidélité pixel .
Scène clavier : une 3D qui s'assemble et explose au scroll
Le second build est la variante clavier de la page montre premium précédente : page produit de luxe en un seul scroll pour clavier mécanique avec modèle 3D temps réel au centre — au scroll le modèle s'assemble, explose en pièces détachées et est annoté , plus il doit réagir à la frappe . Le brief est bref : clavier mécanique premium, 3D temps réel, tout piloté par le scroll, interaction frappe, test pleine page . Simmons parcourt chaque sortie avec test de frappe et test de scroll ; son du plan de frappe, ton et texture entrent dans les notes. L'attente n'est pas la 3D seule mais son intégration web — l'animation de scroll qui la fait appartenir à la page.
La colonne un s'ouvre avec blueprint bleu et phase d'explosion ; les étiquettes se chevauchent par moments mais les pièces se rejoignent à mesure que le scroll accélère, détails ressort et feuille de contact dorée à leur place, avec par moments glitches de transition rapide et une touche qui traverse le plateau . La texture ressort en acier et or réussit, note ‘ 4 mm vers le bas, prêt ’ et ligne ‘ Less clutter, more character ’ accompagnent, avec son de frappe généré et ajouter au panier fermant la page. La colonne deux prend une avance avec meilleure 3D, scroll fluide et étiquettes placées correctement : interaction ‘ tape avec ton clavier — tape quelque chose ’, couche spec Physical Vapor Deposition (pas de laque, ne ternit ni ne s'écaille) et présentation plus maîtrisée du détail touche ; aucune pièce ne bouge quand le modèle se recompose à la fin. La colonne trois tente une lecture différente avec une texture de journal dessinée à la main ; la 3D arrive tard, plus éparse et moins complexe , étiquettes correctes mais clairsemées , la touche jaillit agressivement et le composant panier manque .
Mettre coût et charge côte à côte durcit la table. Fable 5.1 : 58 $ (24M d'entrée, 692k de sortie, ~869 s) — référence pour score et fluidité. Grok 4.7 : ~5 $ mais course bien plus longue et plus de jetons , sortie 3D simple et moins fluide . Astra : ~5 $ et qualité proche de Fable pourtant bien plus efficiente — d'où la ligne de Simmons ‘ Astra, pas aussi bon que Fable mais incroyablement efficient ’. Le gagnant ici reste la ligne Fable/Astra , le perdant Grok ; l'écart tient à l'incapacité du modèle à porter une 3D lourde en une passe et à maîtriser la physique de scroll . L'étiquette pas chère reste sur Grok, la qualité se partage entre Fable et Astra .
Prism Kart et Rainbow Road : l'épreuve physique
Le troisième build est un clone Mario Kart ; la carte est mise à jour vers Rainbow Road et le brief est articulé autour de la physique . La colonne A est Prism Kart : flux choisir n'importe quelle gomme → lancer la course affiche illustrations basiques et génération générique , mais piste type Rainbow Road et physique fantastique — contrôle facile, sensation de boost , bizarrerie ponctuelle en bord de piste quoique reproductible et jouable . Le sort des colonnes B et C se noue d'emblée : la colonne B tourne à gauche quand on pousse à droite — l'axe horizontal inversé déjà vu par Simmons sur un test Astra/Fable antérieur — laissant impression d' absence de QA ; la phrase ‘ je dois appuyer à droite pour aller à gauche ’ se répète trois fois. La colonne C est entièrement dispersée : devrait montrer d'abord les karts rivaux puis spawn aléatoire , injouable avec physique vagabonde plus le même axe inversé, atterrissant dans le bac du pire .
La facture pour une fois se retourne contre Grok. Fable 5.1 : 52 $, ~3 000 s , Astra : 11 $, ~2 000 s , Grok 4.7 : 16 $ — course plus longue, plus de jetons d'entrée/sortie pour le pire jeu . La révélation de Simmons scelle la table : meilleure physique Fable , le bug d'axe inversé se répète sur Astra , et Grok 4.7 le maillon le plus faible . Sur trois builds c'est deux défaites nettes, une défaite à la marge pour Grok ; l' avantage coût ne couvre pas le besoin de révision car pour le build trois la note demeure — ‘peu importe le nombre de runs, grimper à la ligne Astra/Fable est dur’ — le prix du pas cher devient une jouabilité perdue .
Empilés, les trois builds dessinent un motif net : Grok 4.7 reste derrière en code lourd et génération d'agents en one-shot, Fable 5.1 et Astra devant . Le récap de seconde moitié relie la note au terrain : 2 $ / 6 $ contre 10 $ / 50 $ — cinq fois sur l'entrée, huit fois sur la sortie — et cet écart est un vrai levier dans des scénarios bureau et connaissance ; la voie Grokbot ou Grok 4.7 à la place de chat work / co-work clôt les tâches quotidiennes moins cher , et la table de presse détient des lignes où Grok dépasse Fable/Astra . En revanche côté Terminal-Bench et code lourd Fable 5 (de 26% à 42%) et Astra (~59%) creusent un écart clair sur la bande ~26% de Grok ; même si DeepSuite affiche 71% avec cadrage sélectif , le tableau général maintient Grok un cran sous la frontière . D'où la note de Simmons : ‘ test de code lourd seulement, limité ’ — travail de connaissance, automation et chaînes d'agents quotidiennes absentes de la vidéo.
La clôture tient deux caveats sur la même page. D'abord la portée : trois builds, code lourd, connaissance/automation hors champ ; donc l' avantage bureau-automation de Grok mis en avant dans les benchmarks n'apparaît pas sur cette scène. Ensuite la nature one-shot : aucun second passage pour aucun modèle ; une page 3D ou un clone qui se rattraperait à l'itération est jugé sur sa première sortie . Le nœud économique s'y noue : à un cinquième du prix on peut lancer Grok quatre à cinq fois pour un Fable , pourtant la facture montante de Mario Kart et une jouabilité toujours distante suggère que même des révisions peuvent ne pas refermer l'écart . Simmons ajoute une note personnelle : il exploite deux abonnements max 20x séparés sur Chachi et Fable et frappe constamment les limites ; un rival sérieux à un cinquième du prix est une bonne nouvelle pour tout utilisateur final — ‘ dommage qu'il ne soit pas un peu meilleur ’. La lecture finale est matérielle : xAI possède le compute, Grok progressera donc et s'approchera de la ligne Fable/OpenAI ; d'ici là la règle est rotation de modèles et expérimentation . L'appel à commentaires reflète cela : que construire ensuite , laissez-le ci-dessous.
Score CursorBench (plus = mieux)
- Fable 5.151,6%
- Grok 4.746%
- Fable 5 (old)26%
- Astra (absent)—
| Sujet | Statut |
|---|---|
| Levier prix | $2/$6 vs $10/$50; 5× entrée, 8× sortie |
| Awwwards 1re passe | Grok 7 $ pas cher mais goût/fidélité derrière |
| Mur des builds lourds | Grok traîne en one-shot sur 3D et Kart |
| Build | Fable 5.1 | Astra | Grok 4.7 |
|---|---|---|---|
| Clone Awwwards | $123 / 4000s | $97 | $7 / 300s |
| Clavier 3D | $58 / 869s | ~$5 | ~$5 long |
| Mario Kart | $52 / 3000s | $11 / 2000s | $16 long |
Moments clés
- Thèse : parité Fable/Astra à 1/5 du prix
- CursorBench 46% vs 51,6% et 2$/6$
- DeepSuite 71% et lignes bureau/juridique
- Méthode : un bash pour trois one-shot
- Prompt clone Awwwards et skill
- Reveal aveugle A — recrutement ASI
- Reveal aveugle B — Boach Studio / Coco
- Reveal aveugle C — grille Minimal Crouwel
Commentaire de l’IA
"En revisionnant la vidéo je garde un seul filtre : **facture divisée par score**. Sans mettre le graphique xAI et les trois factures dans la même équation, l'étiquette 5 $ vs 58 $ raconterait seule l'histoire ; j'écris chaque paragraphe à l'aune du **coût d'une passe**, en confrontant le ‘cinq fois moins cher’ à vitesse, jetons et jouabilité."
Évaluation de l’IA
Défendre d'abord le cas haussier : tenir 2 $ / 6 $ tout en restant à quatre points sur CursorBench et battre Fable/Astra ligne par ligne en bureau, juridique et automation fait réellement baisser le coût par tâche achevée ; pour les équipes vivant dans Grokbot et le travail de connaissance multi-heures , payer 5× pour quelques points n'est pas rationnel partout, et le levier vitesse + prix rend Grok sensé.
La limite se voit sur le banc de build. La règle one-shot demande à Grok de porter 3D lourde et fidélité pixel au premier essai, et il chute sur choix de goût sur Awwwards, maturité 3D sur clavier et physique jouable sur Kart ; 5 $ contre 58 $ sur clavier est bon marché mais chevauchements d'étiquettes, glitches et panier manquant , axe inversé + physique vagabonde sur Kart et le remplissage SVG derrière 7 $ vs 123 $ sur le premier build peuvent effacer l'avantage prix. xAI possède Cursor et omet Astra de CursorBench , renforçant la lecture de curation.
Sur la vérification la table est testable : 2 $/6 $ vs 10 $/50 $ est cohérent sur la fiche, 46% / 51,6% / 71% / 72,7% / 70% se lisent directement sur le graphique vidéo et l'étiquette ‘le moins cher’ avec Fable 123 $ / Astra 97 $ / Grok 7 $ et les factures clavier/Kart sont vérifiées par les compteurs à l'écran . Pourtant, ‘meilleur’ reste sensible au benchmark et au one-shot ; Terminal-Bench autour de 26% et le code lourd hors bureau gardent Grok derrière.
Lecture pratique sélective : pour les équipes à gros volume d'automation, contexte moyen et chaînes quotidiennes sur Grokbot/harnais , Grok 4.7 est un levier fort et candidat champion prix/performance ; pour travail front-facing comme clones Awwwards pixel-perfect, pages 3D lourdes ou jeux à physique , Fable 5.1 / Astra restent un cran devant . Décidez en dollars par tâche et besoin de révision, pas au seul tableau ; rotation des modèles et expérimentation est le conseil de clôture.
Sources
6 liens ; 1 d’entre eux sont aussi cités par 4 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — Pat Simmons: Grok 4.7 No-Hype Full Review & Testing
- @x.ai https://x.ai/news/grok-4-7
Également cité par : The AI Price War: Opus 5.5, GPT-6 Sol and the Quiet Bottleneck of the Agent Era · How OpenAI's Early Self-Improvement Push, DeepSeek's Sandbox Machine and Grok 4.7 Redraw the AI Race · Grok 4.7 Is Here: Did Elon Deliver? Half the Price, One Step Off the Frontier · Grok 4.7: Elon's Big Promise Tested on the Leaderboard and the Wallet
- @artificialanalysis.ai https://artificialanalysis.ai/models/grok-4-7
- @cursor.com https://cursor.com/docs/models/grok-4-7
- @awwwards.com https://www.awwwards.com/
- @threejs.org https://threejs.org/docs/
grok 4.7 · xai · fable 5.1 · astra · cursorbench · deepsuite · clone awwwards