Retour au fil

Même jeu, deux modèles : l'un est sorti joli, l'autre amusant

Fireship a donné à OpenAI GPT-6 Astra et Anthropic Fable 5.1 le même brief de jeu : un simulateur de lancement de fusée. Astra a livré des graphismes éblouissants en 26 minutes mais un gameplay plat ; le plus lent Fable a produit un jeu plus profond et plus agréable. Au deuxième tour, Astra a surpris avec un code d'interface impeccable.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — 2Xiljy4xzbc
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

La vidéo s'ouvre sur le post social de Jensen Huang, PDG de Nvidia, félicitant l'équipe d'OpenAI et déclarant que le nouveau modèle Astra a atteint l'intelligence artificielle générale. L'hôte souligne immédiatement la tension dans cet éloge, puisque le même post note que le modèle a été entraîné sur plus de 100 000 processeurs graphiques Grace Blackwell, avec 400 000 autres en route. Un vendeur de matériel célébrant une révolution logicielle donne le cadre comique de l'histoire.

La base de la comparaison est concrète : Astra a été déployé auprès des utilisateurs ordinaires via un abonnement Pro mensuel de 100 dollars. L'hôte envoie à Astra et à Fable 5.1 le même brief de jeu au même moment et juge les résultats en les jouant côte à côte. L'objectif n'est pas des scores synthétiques mais ce que ressent un vrai joueur.

Les fonctionnalités phares d'Astra sont listées en premier : des jeux jouables en 3JS, des scènes détaillées dans Blender, et la compatibilité avec les moteurs Unity et Unreal. Le modèle est décrit comme le premier à dépasser le benchmark de généralisation Arc, conçu pour résister à la mémorisation, tandis qu'Opus d'Anthropic se situe autour de 30 %. Néanmoins, l'enthousiasme pour le benchmark est freiné : une équipe de Berkeley avait déjà atteint 99 % plusieurs mois auparavant avec un modèle différent et un puissant harnais d'exécution.

Le sujet du test vient des enfants de l'hôte : un simulateur de lancement de fusée où l'on personnalise une fusée et l'envoie en orbite. Décrite aux deux modèles avec les mêmes mots, l'idée est choisie pour mesurer la qualité visuelle et la profondeur du jeu à la fois. L'objectif n'est pas une démo superficielle mais quelque chose de jouable pendant des heures.

Astra remporte la course avec une large avance, livrant un jeu jouable en environ 26 minutes. Au premier lancement, les graphismes semblent détaillés et presque impeccables, et l'interface semble également soignée. Pourtant, l'interface ressemble fortement à la vague de jeux créés par machine circulant sur les réseaux sociaux, avec une formule évidente. Le plan de la fusée tournant autour du globe impressionne, mais le jeu lui-même ne peut pas vraiment être qualifié d'agréable.

Du côté de Fable, l'image s'inverse. Le modèle termine beaucoup plus lentement ; l'interface semble construite avec une ancienne bibliothèque web, et les scènes 3D sont loin d'être aussi détaillées que celles d'Astra. Mais une fois que l'on commence à jouer, l'écart se creuse : la personnalisation de la fusée est beaucoup plus complexe, et les calculs scientifiques poussent l'ensemble vers un simulateur sérieux. Des chemins variés vers le succès et l'échec, ainsi que des animations d'explosion plus cool, rendent le gameplay clairement plus amusant.

Les enfants prennent place pour juger et le verdict se divise : le petit de 3 ans préfère le jeu Astra plus simple, celui de 8 ans le Fable plus complexe. Cette division rend difficile de déclarer un seul vainqueur, car l'âge et les attentes modifient le résultat. Malgré tout, la distance qu'Astra a parcourue en matière de graphismes en quelques mois est considérée comme incontestable.

Le deuxième examen est une tâche d'interface : construire le design Horse Tender sans erreurs. Astra produit en 21 minutes quelque chose de similaire à ce que Fable a fait il y a des mois, seulement plus propre et plus élégant. L'hôte dit avoir passé des heures à vérifier chaque ligne de code et n'a pas pu trouver une seule erreur ; le seul défaut est un visuel décalé de quelques pixels. Cette section très comique souligne le soin du modèle pour le code d'interface.

Le segment sur le sponsor de la vidéo, Mobbin, est lié au problème d'uniformité des interfaces créées par machine : une archive de plus de 600 000 écrans d'applications réelles peut être utilisée comme référence pour les outils de codage. Au lieu de générer un cliché de dégradé violet à partir d'une page blanche, le modèle étudie les motifs partagés des meilleures applications. Chaque suggestion renvoie à son écran source, ce qui permet de contrôler les motifs "hallucinés".

La vue d'ensemble est la suivante : l'hypothèse selon laquelle les développeurs de jeux étaient à l'abri de l'automatisation s'est effondrée. Le bond graphique d'Astra depuis son prédécesseur de juillet est important, et le soi-disant fossé concurrentiel semble comblé. La conclusion avertit qu'une vague de contenu 3D prêt à l'emploi pourrait rendre Internet encore plus bruyant.

En bref, la vidéo attribue deux premières places distinctes au lieu d'un seul verdict : Astra est en tête en termes de vitesse et de visuels, Fable 5.1 en termes de jouabilité et de profondeur. La question de l'intelligence générale est délibérément laissée en suspens comme une blague, un pixel décalé devenant la petite preuve qui met fin aux grandes affirmations.

Commentaire de l’IA

"« Ce qui m'a marqué, c'est l'écart entre la vitesse et le plaisir ; voir la jouabilité l'emporter sur l'esthétique, jugé par ses propres enfants, a été une leçon pour moi aussi. »"

Évaluation de l’IA

Pour défendre l'autre côté, ce qu'Astra offre n'est pas anodin : un jeu esthétique qui s'ouvre sans erreurs en une demi-heure est un produit fini pour la plupart des utilisateurs. Le plaisir est personnel, et une impression ponctuelle peut prendre un écart comblable pour un écart permanent une fois les invites affinées. Sous cet angle, la vidéo pourrait sous-estimer la valeur pratique d'Astra tout en louant la profondeur de Fable.

Les limites de la méthode sont visibles : un seul brief, un seul genre, un jugement non aveugle et deux très jeunes juges. Le coût des jetons, le nombre de tentatives et les options d'affinage sont absents du rapport, pourtant personne ne livre une première sortie en production réelle. Le score mesure donc les moyennes des premiers essais, et non le plafond de l'un ou l'autre modèle.

Deux points nécessitent une attention particulière en matière de vérifiabilité. Premièrement, la critique selon laquelle les interfaces créées par machine se ressemblent toutes correspond exactement au message du sponsor vendant une archive d'interfaces ; la critique peut être vraie tandis que l'alignement des intérêts mérite tout de même une note. Deuxièmement, les pourcentages Arc et les scores d'indice d'intelligence indépendants sont de seconde main, et quiconque se basant sur eux devrait confirmer les chiffres sur des pages de mesure indépendantes.

Mon approche pratique est la suivante : je commencerais avec Astra là où la vitesse de démonstration est importante pour améliorer le cadre visuel, et je consulterais des modèles de type Fable là où la profondeur et la conception des systèmes sont importantes. Au lieu de la loyauté envers un seul modèle, planifier deux passes distinctes, une pour l'esthétique et une pour la jouabilité, semble être la démarche la plus intelligente.

Sources

6 liens ; 2 d’entre eux sont aussi cités par 2 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

programmation · même · jeu · modèles · sorti · joli · nodesdaily

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…