Krish Naik regresa tras meses sin un análisis dedicado a un paper y pone la arquitectura Dragon Hatchling (BDH) de Pathway en agenda. La pregunta de la miniatura es directa: ¿reemplazará BDH a los Transformers? Su resumen rápido: BDH se presenta como el eslabón perdido entre los Transformers y los modelos del cerebro, introducido con el paper del 30 de septiembre de 2025 en Hugging Face. El pequeño modelo de razonamiento construido encima, BDH-CQ, alcanza un nuevo punto de costo-eficiencia en ARC-AGI-1 con solo 115 a 150 millones de parámetros.
Por qué los Transformers piensan caro
Déjame desglosar paso a paso por qué se necesita una nueva arquitectura. Cuando le pides a ChatGPT, Claude o Gemini resolver un sencillo puzzle de 20 chocolates — dar 7 a un hermano, 6 a una hermana, ¿cuántos quedan? — el modelo deletrea cada paso intermedio en palabras: 20 menos 7 son 13, 13 menos 6 son 7. Eso es Chain-of-Thought, que obliga a la computación interna a pasar por el lenguaje. Como un alumno que debe decir cada resultado en voz alta, el modelo gasta tokens para pensar. Tokens significan latencia y coste. Pathway lo llama el cuello de botella del token: puedes ejecutar miles de millones de operaciones por dentro, pero solo puedes llevar un estrecho canal de tokens al siguiente paso.
El segundo cuello de botella es la memoria. Un Transformer tiene dos memorias distintas: el conocimiento a largo plazo horneado en pesos congelados durante el entrenamiento, y una caché KV indexada por tokens que crece con el contexto y se reinicia cada sesión. Los contextos largos hinchan la caché y empujan hacia soluciones como resumir o bases vectoriales externas. Construir un agente en la vida diaria se siente como reescribir el cuaderno desde cero cada vez. La tesis de BDH es que la memoria debe vivir en las propias sinapsis, no fuera; la experiencia debe acumularse y cambiar cómo se aborda el siguiente problema. Los ejemplos nuevos en inferencia deberían actualizar directamente la memoria interna — la diferencia entre un empleado en su primer día y la misma persona un año después.
Cómo funciona Dragon Hatchling
BDH toma su pista de la red libre de escala del cerebro. En un cerebro no cada neurona se conecta con todas las demás; unos pocos hubs muy conectados coexisten con muchos nodos escasamente conectados en un grafo disperso pero eficiente. BDH modela el lenguaje como dinámica de grafo distribuido local en lugar de multiplicaciones densas de matrices. Cada nodo habla solo con vecinos, la memoria la llevan los pesos de las aristas (sinapsis) más que los estados de nodos solos, y el kernel de interacción se restringe a señales dispersas tipo spike. El razonamiento se formaliza como un proceso de reponderación de aristas. Como modelo de juguete, imagina una red de osciladores: los nodos tiran de sus fases mutuamente y se bloquean en un ritmo compartido.
La variante amigable para GPU es BDH-GPU. Aquí el grafo se convierte en un sistema de espacio de estados compatible con tensores. La atención lineal se alinea con la dimensión de neuronas, las activaciones se mantienen dispersas y positivas, y un bloque ReLU-lowrank reemplaza al MLP del Transformer. ReLU ayuda a propagar señales tipo cadena de Markov preservando la modularidad. El objetivo de ingeniería es práctico: usar LSH para mover vectores clave al ortante positivo, aumentar capacidad para contexto largo y obtener naturalmente sinapsis monosemánticas — cada sinapsis sintonizada a un concepto — junto con activaciones dispersas. Pathway reporta que ambas emergen naturalmente en las mediciones.
BDH-CQ: aprender en contexto, razonar en espacio latente
BDH-CQ es la especialización de razonamiento de la arquitectura — el nombre se expande a In-Context Learning with Recurrent Latent Reasoning. La lógica es simple: muestras unos pocos ejemplos, el modelo resuelve la nueva tarea solo a partir de esas demostraciones. Funciona en dos fases. 1) Aprendizaje en contexto: a medida que los ejemplos fluyen, se actualiza una memoria recurrente, como acumular notas a corto plazo dentro. 2) Razonamiento latente recurrente: cuando llega la consulta, el modelo no decodifica su pensamiento palabra por palabra; refina iterativamente la solución en un estado latente de alta dimensión y solo decodifica respuestas candidatas. Ningún paso intermedio se verbaliza, ningún parámetro se actualiza, ningún reentrenamiento para la tarea.
El campo de pruebas elegido es ARC-AGI-1. El benchmark entrega al sistema un puñado de pares entrada-salida de rejillas de colores, cada tarea con una regla oculta diferente, y le pide aplicarla a una nueva rejilla. Un puzzle puede desplazar un patrón de color a la derecha; el siguiente necesita una transformación completamente distinta. El conjunto de evaluación público es donde BDH-CQ alcanza el 29,5% pass@2 con un coste de inferencia calculado de 0,0007 $ por tarea — menos de una décima de centavo. En el mismo leaderboard GPT 5.6 Luna (Low) alcanza el 34,2% pero cuesta unas 11 veces más, incluso tras el recorte de precio de OpenAI del 30 de julio. El resultado se reprodujo en una evaluación independiente de caja negra y en una replicación por Lukasz Kaiser, coautor del paper Transformer de 2017.
La escalabilidad es la parte que el vídeo enfatiza. Pathway muestra resultados tempranos de entrenamiento hasta 600 mil millones de parámetros y apunta a una ley de escalado similar a la de los Transformers. La fuerza histórica de los Transformers fue la predictibilidad: dale más datos y parámetros y sigue mejorando. Si BDH sigue la misma curva, el cambio arquitectónico ofrece no solo eficiencia sino un camino de crecimiento. Naik señala que el paper lo enmarca como evidencia temprana, prometedora pero aún al inicio.
¿Qué significa esto más allá de las rejillas de colores? Tomando prestada la propia analogía de Pathway, piensa en planificar un viaje complejo multi-país: vuelos, visados, presupuestos, clima, horarios de apertura y preferencias se constriñen entre sí. Cuando se cancela un vuelo, un sistema capaz debe saber qué sigue válido y qué debe reconstruirse coherentemente. No es solo recuperación; necesita razonar a través de restricciones que interactúan. BDH apunta a manejar tales situaciones con un estado interno continuamente actualizado en lugar de un parche de memoria externa.
En resumen, el vídeo converge en un mensaje: el impuesto en tokens que pagamos por razonar no es una ley de la inteligencia sino una elección de arquitectura. BDH intenta convertir la atención en memoria sináptica y tejer juntos el aprendizaje en contexto con el razonamiento latente en un solo tejido. Lo hemos visto hasta ahora en un benchmark limitado con un modelo de 150 millones de parámetros; el cuadro no estará completo hasta que se pruebe a mayor escala, en integración de producción y en suites de razonamiento más difíciles.
Momentos clave
- ¿Qué es BDH? Primer vistazo a Dragon Hatchling
Pathway presenta BDH como el eslabón perdido entre Transformers y modelos del cerebro.
- El impuesto del token: por qué cada paso se vuelve palabra
El ejemplo de los 20 chocolates revela el coste oculto del Chain-of-Thought
- Cuello de botella de memoria y cuaderno externo
La caché KV se hincha, los agentes se ven forzados a escribir en stores vectoriales externos
- Grafo inspirado en el cerebro: cómo recuerdan las sinapsis
Red libre de escala y razonamiento como reponderación de aristas
- BDH-CQ: aprender en contexto, razonar en latente
Los ejemplos actualizan la memoria recurrente, la solución se refina en estado latente
- 29,5% en ARC-AGI-1 a 0,0007 $
Una nueva frontera de eficiencia a menos de una décima de centavo por tarea
Comentario de la IA
"Para mí la verdadera promesa de BDH no es el punto porcentual sino cómo abarata la factura de pensar: no tener que convertir cada paso de razonamiento en un token podría por fin hacer que el razonamiento sea escalable en producción."
Evaluación de la IA
Tomando la tesis BDH en serio en su versión más fuerte, se lee así: la forma más limpia de recortar el costo del razonamiento en modelos de lenguaje no es una cadena de pensamiento más larga sino una arquitectura capaz de portar el pensamiento sin convertirlo en palabras. Elimina el cuello de botella del token y tanto la latencia como la factura caen, dejándote probar silenciosamente más soluciones candidatas dentro del mismo presupuesto. Lograr el 29,5% en ARC-AGI-1 — donde la regla cambia en cada tarea — por menos de una décima de centavo por tarea baja el precio unitario de la inteligencia, y la replicación independiente por Lukasz Kaiser añade credibilidad.
Los límites son igualmente claros. Primero, BDH-CQ es un modelo pequeño especializado en puzzles de rejillas de colores; la misma eficiencia aún no se ha mostrado en razonamiento general, matemáticas, código o documentos largos. Segundo, la señal hasta 600 mil millones se basa en observaciones tempranas de entrenamiento, no en un modelo a escala completa por encima de 150 millones enfrentándose a modelos frontera en el leaderboard. Tercero, el paper de Hugging Face y el informe BDH-CQ se publicaron en etapas distintas; métricas operativas como latencia, huella de memoria y comportamiento de recuperación de errores en producción aún no son públicas.
En verificabilidad el cuadro es bastante transparente: la puntuación oficial en el leaderboard ARC Prize se muestra junto a un costo calculado a partir del tiempo de hardware por tarea, con el informe de prueba de caja negra independiente enlazado. Pero los costos de comparación para algunos modelos reflejan precios de API, por lo que no es estrictamente manzana con manzana; y el propio ARC-AGI-1 está muy enfocado en abstracción visual y no representa uno a uno las tareas de agentes del mundo real. Un veredicto más sólido requeriría el mismo protocolo en ARC-AGI-2 o benchmarks de agentes en vivo.
La conclusión práctica: si necesitas llevar el razonamiento a producción donde debe ser facturable, el enfoque BDH es un carril experimental convincente. Para razonamiento de alto volumen y bajo costo — extracción continua de reglas, pequeños bucles de agentes o investigación con presupuesto limitado — probar un modelo de 150 millones de parámetros tiene sentido. Para decisiones críticas de seguridad o financieras de alto riesgo, aún no hay evidencia de que reemplace a los modelos frontera de propósito general; la apuesta arquitectónica aún tiene que probarse a escala.
Fuentes
7 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — Krish Naik: BDH post-Transformer explicado para todos
- @pathway.com https://pathway.com/research/bdh-explainer/brain-inspired-ai-architecture
- @pathway.com https://pathway.com/introducing-bdh-cq
- @pathway.com https://pathway.com/blog/pathway-150m-model-breaks-arc-agi-1-cost-efficiency-frontier
- @huggingface.co https://huggingface.co/papers/2509.26507
- @arxiv.org https://arxiv.org/html/2608.09888
- @arxiv.org https://arxiv.org/html/2509.26507v1
bdh · dragon hatchling · pathway · arc-agi · post-transformer