Retour au fil

Le premier candidat sérieux post-Transformer : que promet l'architecture BDH de Pathway ?

L'architecture Dragon Hatchling (BDH) de Pathway et son modèle de raisonnement BDH-CQ de 150 millions de paramètres atteignent 29,5 % sur ARC-AGI-1 à 0,0007 $ par tâche, redéfinissant la frontière coût-efficacité en raisonnant dans un espace latent récurrent plutôt qu'en chaîne de pensée verbalisée.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — 9hf8JzDvWUo
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Krish Naik revient après des mois sans analyse d'article dédiée et met l'architecture Dragon Hatchling (BDH) de Pathway à l'ordre du jour. La question de la miniature est directe : BDH va-t-il remplacer les Transformers ? Son résumé rapide : BDH est présenté comme le chaînon manquant entre les Transformers et les modèles du cerveau, introduit avec l'article du 30 septembre 2025 sur Hugging Face. Le petit modèle de raisonnement construit dessus, BDH-CQ, atteint un nouveau point de coût-efficacité sur ARC-AGI-1 avec seulement 115 à 150 millions de paramètres.

Pourquoi les Transformers pensent cher ?

Laissez-moi expliquer étape par étape pourquoi une nouvelle architecture est nécessaire. Quand vous demandez à ChatGPT, Claude ou Gemini de résoudre un simple puzzle de 20 chocolats — donner 7 à un frère, 6 à une sœur, combien reste-t-il ? — le modèle épelle chaque étape intermédiaire en mots : 20 moins 7 font 13, 13 moins 6 font 7. C'est le Chain-of-Thought, qui force le calcul interne à passer par le langage. Comme un élève qui doit dire chaque résultat à voix haute, le modèle dépense des tokens pour penser. Les tokens signifient latence et coût. Pathway appelle cela le goulot d'étranglement des tokens : on peut exécuter des milliards d'opérations en interne, mais ne porter qu'un étroit canal de tokens vers l'étape suivante.

Le second goulot est la mémoire. Un Transformer possède deux mémoires différentes : le savoir à long terme figé dans les poids pendant l'entraînement, et un cache KV indexé par tokens qui gonfle avec le contexte et se réinitialise à chaque session. Les longs contextes font enfler le cache et poussent vers des contournements comme la résumé ou les bases vectorielles externes. Construire un agent au quotidien revient à réécrire le carnet à chaque fois. La thèse de BDH est que la mémoire doit vivre sur les synapses elles-mêmes, pas à l'extérieur ; l'expérience doit s'accumuler et changer la façon de traiter le problème suivant. Les nouveaux exemples au moment de l'inférence devraient directement mettre à jour la mémoire interne — la différence entre un employé à son premier jour et la même personne un an plus tard.

Comment Dragon Hatchling fonctionne

BDH s'inspire du réseau sans échelle du cerveau. Dans un cerveau, chaque neurone ne se connecte pas à tous les autres ; quelques hubs très connectés coexistent avec de nombreux nœuds faiblement connectés dans un graphe clairsemé mais efficace. BDH modélise le langage comme une dynamique de graphe distribué locale plutôt que comme des multiplications denses de matrices. Chaque nœud ne parle qu'à ses voisins, la mémoire est portée par les poids des arêtes (synapses) plutôt que par les seuls états des nœuds, et le noyau d'interaction est restreint à des signaux épars de type spike. Le raisonnement est formalisé comme un processus de repondération des arêtes. Comme modèle jouet, imaginez un réseau d'oscillateurs : les nœuds s'attirent mutuellement en phase et se verrouillent sur un rythme partagé.

La variante adaptée au GPU est BDH-GPU. Ici le graphe est transformé en système à espace d'état compatible tenseur. L'attention linéaire est alignée sur la dimension des neurones, les activations sont maintenues éparses et positives, et un bloc ReLU-lowrank remplace le MLP du Transformer. ReLU aide à propager les signaux de type chaîne de Markov tout en préservant la modularité. L'objectif d'ingénierie est pratique : utiliser LSH pour déplacer les vecteurs clés vers l'orthant positif, accroître la capacité pour les longs contextes et obtenir naturellement des synapses monosémantiques — chaque synapse réglée sur un concept — ainsi que des activations éparses. Pathway rapporte que les deux émergent naturellement dans les mesures.

BDH-CQ : apprendre en contexte, raisonner dans l'espace latent

BDH-CQ est la spécialisation raisonnement de l'architecture — le nom se développe en In-Context Learning with Recurrent Latent Reasoning. La logique est simple : vous montrez quelques exemples, le modèle résout la nouvelle tâche uniquement à partir de ces démonstrations. Il fonctionne en deux phases. 1) Apprentissage en contexte : à mesure que les exemples arrivent, une mémoire récurrente est mise à jour, comme accumuler des notes à court terme à l'intérieur. 2) Raisonnement latent récurrent : quand la requête arrive, le modèle ne décode pas sa pensée mot à mot ; il raffine itérativement la solution dans un état latent de haute dimension et ne décode que les réponses candidates. Aucune étape intermédiaire n'est verbalisée, aucun paramètre mis à jour, aucun réentraînement pour la tâche.

Le terrain d'évaluation choisi est ARC-AGI-1. Le benchmark donne au système une poignée de paires entrée-sortie de grilles colorées, chaque tâche avec une règle cachée différente, et lui demande d'appliquer la règle à une nouvelle grille. Un puzzle peut décaler un motif de couleur vers la droite ; le suivant exige une transformation complètement différente. L'ensemble d'évaluation public est là où BDH-CQ atteint 29,5 % pass@2 avec un coût d'inférence calculé de 0,0007 $ par tâche — moins d'un dixième de cent. Sur le même leaderboard, GPT 5.6 Luna (Low) atteint 34,2 % mais coûte environ 11 fois plus, même après la baisse de prix d'OpenAI du 30 juillet. Le résultat a été reproduit lors d'une évaluation boîte noire indépendante et dans une réplication par Lukasz Kaiser, co-auteur de l'article Transformer de 2017.

L'évolutivité est la partie que la vidéo souligne. Pathway montre des résultats d'entraînement précoces jusqu'à 600 milliards de paramètres et pointe vers une loi d'échelle semblable à celle des Transformers. La force historique des Transformers était la prédictibilité : donnez-lui plus de données et de paramètres et il continue de s'améliorer. Si BDH suit la même courbe, le changement d'architecture offre non seulement de l'efficacité mais aussi une trajectoire de croissance. Naik note que l'article présente cela comme une preuve précoce, prometteuse mais encore à ses débuts.

Que signifie cela au-delà des grilles colorées ? En empruntant l'analogie de Pathway, pensez à planifier un voyage complexe multi-pays : vols, visas, budgets, météo, horaires d'ouverture et préférences se contraignent mutuellement. Quand un vol est annulé, un système capable devrait savoir ce qui reste valide et ce qui doit être reconstruit de façon cohérente. Ce n'est pas juste de la récupération ; il faut raisonner à travers des contraintes qui interagissent. BDH vise à gérer ces situations avec un état interne continuellement mis à jour plutôt qu'un patch de mémoire externe.

En bref, la vidéo converge vers un message : la taxe en tokens que nous payons pour raisonner n'est pas une loi de l'intelligence mais un choix d'architecture. BDH tente de transformer l'attention en mémoire synaptique et de tisser ensemble apprentissage en contexte et raisonnement latent en un seul tissu. Nous l'avons vu jusqu'ici sur un benchmark limité avec un modèle de 150 millions de paramètres ; le tableau ne sera complet qu'après des tests à plus grande échelle, en intégration production et sur des suites de raisonnement plus difficiles.

Visualization: nodesdaily AI

Moments clés

  1. Qu'est-ce que BDH ? Premier regard sur Dragon HatchlingPathway présente BDH comme le chaînon manquant entre Transformers et modèles du cerveau.
  2. La taxe token : pourquoi chaque étape devient un motL'exemple des 20 chocolats révèle le coût caché du Chain-of-Thought
  3. Goulot mémoire et carnet externeLe cache KV gonfle, les agents sont forcés d'écrire vers des stores vectoriels externes
  4. Graphe inspiré du cerveau : comment les synapses se souviennentRéseau sans échelle et raisonnement comme repondération d'arêtes
  5. BDH-CQ : apprendre en contexte, raisonner en latentLes exemples mettent à jour la mémoire récurrente, la solution se raffine en état latent
  6. 29,5% sur ARC-AGI-1 à 0,0007 $Une nouvelle frontière d'efficacité à moins d'un dixième de cent par tâche

Commentaire de l’IA

"Pour moi, la vraie promesse de BDH n'est pas le point de pourcentage mais la façon dont il réduit la facture de la réflexion : ne plus devoir transformer chaque étape de raisonnement en token pourrait enfin rendre le raisonnement scalable en production."

Évaluation de l’IA

En prenant la thèse BDH au sérieux dans sa version la plus forte, elle se lit ainsi : le moyen le plus propre de réduire le coût du raisonnement dans les modèles de langage n'est pas une chaîne de pensée plus longue mais une architecture capable de porter la pensée sans la transformer en mots. Supprimez le goulot des tokens et latence et facture chutent, vous laissant tester silencieusement davantage de solutions candidates dans le même budget. Obtenir 29,5 % sur ARC-AGI-1 — où la règle change à chaque tâche — pour moins d'un dixième de cent par tâche abaisse le prix unitaire de l'intelligence, et la réplication indépendante par Lukasz Kaiser renforce la crédibilité.

Les limites sont tout aussi claires. D'abord, BDH-CQ est un petit modèle spécialisé pour les puzzles de grilles colorées ; la même efficacité n'a pas encore été montrée sur le raisonnement général, les maths, le code ou les longs documents. Ensuite, le signal jusqu'à 600 milliards repose sur des observations d'entraînement précoces, pas sur un modèle complet au-delà de 150 millions affrontant les modèles frontières du leaderboard. Enfin, l'article Hugging Face et le rapport BDH-CQ ont été publiés à des étapes différentes ; les métriques opérationnelles comme la latence, l'empreinte mémoire et le comportement de récupération d'erreur en production ne sont pas encore publiques.

Sur la vérifiabilité, le tableau est assez transparent : le score officiel sur le leaderboard ARC Prize est montré à côté d'un coût calculé à partir du temps matériel par tâche, avec le rapport de test boîte noire indépendant lié. Mais les coûts de comparaison pour certains modèles reflètent la tarification API, donc ce n'est pas strictement à pommes égales ; et ARC-AGI-1 lui-même est fortement axé sur l'abstraction visuelle et ne représente pas un à un les tâches d'agents du monde réel. Un verdict plus solide exigerait le même protocole sur ARC-AGI-2 ou des benchmarks d'agents en direct.

L'enseignement pratique : si vous devez porter le raisonnement en production où il doit être facturable, l'approche BDH est une piste expérimentale convaincante. Pour un raisonnement à haut volume et faible coût — extraction continue de règles, petites boucles d'agents ou recherche à budget contraint — essayer un modèle de 150 millions de paramètres a du sens. Pour des décisions critiques pour la sécurité ou à enjeux financiers élevés, il n'existe pas encore de preuve qu'il remplace les modèles généralistes frontières ; le pari architectural doit encore faire ses preuves à l'échelle.

Sources

7 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

bdh · dragon hatchling · pathway · arc-agi · post-transformer

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…