La factura eléctrica de la inteligencia artificial impresiona: en el escenario base, la demanda de los centros de datos rondaría los 945 TWh en 2030 , cerca del 3 % del consumo mundial, con un crecimiento anual cercano al 15 %. Lo más sorprendente es que alrededor del 80 % de la energía de un cálculo se iría en mover datos, no en la operación en sí. Dicho de otro modo, los chips pasan más tiempo esperando y transportando que pensando, y ese desperdicio silencioso dispara los costes.
Mientras tanto, los modelos se vuelven gigantescos: desde 5 billones de parámetros, la trayectoria apunta a 10 000-40 000 billones , repartidos entre decenas de miles de aceleradores. Pero un chip sigue limitado por su retícula de fabricación , el tamaño máximo que impone la litografía, y por la memoria RAM cercana disponible junto al cómputo. Ya no cabe un modelo entero en un solo chip, y cada fragmento debe conversar sin pausa con los demás, lo que multiplica los intercambios.
Para explicar el atasco, el relato vuelve a los orígenes con el protocolo TCP/IP , el lenguaje común que permitió comunicar máquinas distintas en Internet. Los clústeres de IA empezaron con esa misma lógica: redes generalistas, flexibles y baratas, pero poco optimizadas para el tráfico masivo y sincronizado del entrenamiento. Cuando miles de chips deben intercambiar gradientes al mismo instante, las colas, las retransmisiones y la latencia convierten aquella flexibilidad histórica en una desventaja medible.
Del protocolo de red al muro del cómputo
Nvidia respondió con NVLink , una interconexión propietaria muy veloz: la sexta generación alcanzaría 3,6 TB/s por GPU, mientras el enlace C2C del NVL72 rondaría 1,8 TB/s, unas siete veces PCIe Gen6. El salto de Hopper a Blackwell habría multiplicado por 50 los tokens por vatio. Pero ese rendimiento tiene precio: un ecosistema cerrado y carísimo, lo que el relato llama el acantilado del cómputo , ese punto donde añadir chips casi no aporta porque la red se satura.
Aquí entra en escena la arquitectura UnifiedBus de Huawei, impulsada por el módulo LinkBlade . Una precisión útil: el nombre Pirium mencionado en la conversación corresponde oficialmente a UnifiedBus. La idea unifica los tráficos internos en una sola trama rápida y retira unos 196 kilómetros de cable de cobre en un SuperPod de 4 096 NPU. Menos cables significan menos conectores, menos fallos y menos energía perdida, con una red más simple de operar a gran escala.
La segunda palanca es la memoria distante , que permite a un chip tomar prestada directamente la memoria de un equipo vecino. El acceso tomaría unos 100 nanosegundos , unas 500 veces más que un registro local, pero infinitamente menos que un viaje al almacenamiento lento. Para modelos inmensos, ese compromiso lo cambia todo: en vez de duplicar terabytes por todas partes, los aceleradores comparten un espacio común, lo que reduce copias, suaviza picos y mantiene el cálculo siempre alimentado.
Memoria, cobre y luz: la apuesta UnifiedBus
Queda el cuello del maestro , ese punto central que reparte el trabajo y espera a que todos terminen antes de seguir. En la inferencia moderna, la caché KV agrava el fenómeno: cada token generado conserva sus claves y valores, y esa memoria conversacional debe acompañar la petición por todo el sistema. Si el coordinador centraliza demasiadas decisiones, los aceleradores quedan ociosos mientras los datos viajan, y el rendimiento global se hunde aunque cada chip sea excelente.
La física también impone límites: el cobre solo lleva bien la señal en torno a un metro , más allá las pérdidas y el calor se disparan. De ahí el salto a la óptica entre bastidores , con módulos enchufables y luego coempaquetados: la tecnología NPO y después CPO acerca la conversión óptica a pocos milímetros del chip. El Atlas 960E ilustra el avance con 4 096 NPU, 8 EFLOPS en FP8 y 16 EFLOPS en FP4, solo 5 500 módulos Hi-ONE frente a 48 000 módulos 800G, y más de 550 kW ahorrados.
Para medir la eficiencia real, el relato recurre al MFU , el cociente entre rendimiento útil y pico teórico, popularizado en torno a PaLM en 2022. Un MFU del 40-60 % ya se considera bueno, mientras muchos clústeres rondarían el 30 %. Las pruebas destacadas prometen tres ganancias combinadas: transferencias más cortas, esperas menores y chips mejor alimentados con datos. Juntos, esos efectos elevarían notablemente la utilización sin cambiar la litografía de los procesadores.
Finalmente, Huawei muestra su hoja de ruta: el Atlas 950 adoptaría UnifiedBus 2.0 en el último trimestre, mientras el 960E sigue sin fecha firme y el Ascend 960 apuntaría a 2027. Como dato notable, la licencia sería abierta, con 30 000 descargas en 26 países, y un objetivo de un error por cada 100 millones de bits frente a uno por cada 100 000 antes. De fondo, la ley de Logic Folding y Tau , presentada en ISCAS 2026, esboza chips apilados donde lógica y memoria se acercan de forma duradera.
Momentos clave
Comentario de la IA
"El relato es claro y didáctico: el problema ya no es solo la potencia de los chips, sino el coste de mover los datos. La demostración de Shanghái convence en la física, aunque el entusiasmo pide contraste con cifras independientes. Un aporte útil para entender la infraestructura de la IA."
Evaluación de la IA
El contraargumento más serio es la generalidad de las ganancias: una interconexión unificada brilla con tráfico denso y sincronizado, pero muchas cargas reales son heterogéneas, con fases de cálculo, lectura y espera. En un clúster de 100 000 NPU donde solo el 20 % de la actividad llevaría un modelo dado, las mejoras medidas en un SuperPod de muestra no se trasladan automáticamente a todo el parque.
Los límites también están en la verificación independiente: topologías exactas, versiones de software, lotes de prueba y condiciones térmicas las describe sobre todo el proveedor. Las cifras de fiabilidad, como la doble fibra con un tiempo medio entre fallos de un mes, exigen larga experiencia operativa, y la falta de fecha para el 960E obliga a distinguir la demostración de la disponibilidad comercial.
El contexto del presentador importa: el viaje a Shanghái, organizado con Huawei, da un acceso raro a los laboratorios pero crea un sesgo natural de simpatía. Los ingenieros entrevistados defienden su arquitectura con convicción, y ángulos críticos como costes de migración, dependencia del proveedor o sanciones y controles de exportación quedan poco explorados en el relato.
En la práctica, la lección para el lector es simple: antes de sumar aceleradores, audite la red, la memoria compartida y el MFU real de sus cargas. Las ganancias prometidas por UnifiedBus y LinkBlade son verosímiles en el papel, pero un decisor prudente exigirá pruebas replicadas, coste total de propiedad y una estrategia de salida antes de reconstruir su infraestructura.
Fuentes
9 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube YouTube — Two Bit da Vinci
- @huawei.com Huawei — UnifiedBus architecture announcement
- @huawei.com Huawei — Atlas 960E SuperPod launch
- @iea.org IEA — Energy and AI demand report
- @developer.nvidia.com Nvidia — NVLink scale-up network
- @huawei.com Huawei — Tau scaling law Logic Folding
- @zeroentropy.dev ZeroEntropy — MFU concept guide
- @hpcwire.com HPCwire — AI interconnect at scale
- @semiengineering.com SemiEngineering — CPO in AI data centers
inteligencia artificial · huawei · unifiedbus · centros de datos · nvlink · energía