Volver al inicio

NVIDIA DSX: el plano que convierte cada megavatio en tokens con refrigeración líquida direct-to-chip a 45 °C

NVIDIA DSX unifica red eléctrica, energía y refrigeración en una sola pila de diseño-simulación-operaciones para fábricas de IA; junto con la refrigeración líquida direct-to-chip a 45 °C, DSX MaxLPS que ofrece hasta un 40 % de capacidad adicional y el DSX Flex flexible ante la red, apunta a un PUE cercano a 1,05 y densidades de rack superiores a 120 kW para producir más tokens por megavatio.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — cf40vNN5_Js
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Lo que separa una fábrica de IA de un centro de datos tradicional es que la propia instalación se convierte en el producto. Tanto el informe como los cinco vídeos repiten la misma idea: si el diseño, la red eléctrica, la energía y la refrigeración no se coingenian, cada megavatio se desperdicia. Los ingresos ahora se miden en tokens por vatio, por lo que cualquier vatio inactivo es ingreso perdido. NVIDIA DSX entra para unificar diseño, simulación, despliegue y operaciones en un solo sistema inteligente.

DSX no es un producto único, sino una plataforma y un plano. Construido en torno a la generación Vera Rubin, su diseño de referencia trata cada capa, desde el chip hasta la red eléctrica, como una sola pila. Con un gemelo digital en Omniverse, la distribución, la energía y la refrigeración se simulan antes de que llegue un solo rack y los errores se detectan en pantalla. Cuando el sitio se enciende, DSX OS toma el control para aprovisionar, monitorear y autorreparar la infraestructura, convirtiendo componentes de muchos proveedores en una capacidad multiinquilino confiable.

En su núcleo está la idea de que la energía es la restricción de producción, encarnada por DSX MaxLPS. Muchos sitios sobredimensionan para los picos y dejan hasta un 40 % de capacidad varada. MaxLPS afirma gestionar dinámicamente la energía entre GPU, racks y cargas de trabajo para entregar hasta un 40 % más de cómputo dentro del mismo presupuesto. Los vatios varados se recuperan de rack en rack y el suavizado dentro del rack aplana los picos de corriente. Las opciones de planificación MaxP, MaxQ y MaxLPS producen diferentes cantidades de GPU por MW fijo, con MaxLPS usando la potencia media efectivamente utilizada.

El sistema nervioso de esa orquestación es DSX Exchange. Actúa como puente entre IT y OT como un bus de eventos abierto construido sobre NATS, hablando MQTT 3.1.1, persistiendo con JetStream y federándose mediante nodos hoja. Un clúster HA de tres nodos, ACL a nivel de topic con OAuth2/mTLS/NKey y un despliegue declarativo con Helm/ArgoCD permiten que las señales de la instalación hablen el mismo idioma. Entonces, agentes como Phaedrus pueden equilibrar en tiempo real los sistemas de refrigeración y eléctricos.

La flexibilidad ante la red eléctrica vive en DSX Flex. Las señales de la red para reducción de carga, respuesta a la demanda y eventos de precios se leen en vivo y las interpretan agentes de Emerald AI que ralentizan o posponen cargas de trabajo. La misma capa orquesta la energía híbrida entre la red, las renovables in situ y el almacenamiento. En lugar de ser un sumidero unidireccional, la fábrica de IA se convierte en un activo flexible que alivia la red. Los vídeos señalan que llegarán 100 gigavatios de nueva capacidad de fábricas de IA antes de fin de década; sin flexibilidad, esa escala tensaría las redes.

La cadena de validación de diseño es demasiado compleja para una sola herramienta. Los activos SimReady se gobiernan en PTC Windchill PLM, la ingeniería de sistemas basada en modelos se realiza en Dassault Systèmes, y Jacobs finaliza el diseño en su aplicación Omniverse a medida. Las térmicas externas se simulan en Siemens Star-CCM+, las térmicas internas en Cadence Reality, la eléctrica en ETAP y la red en DSX Air de NVIDIA. La puesta en servicio virtual mediante Procore comprime luego los plazos de construcción y reduce sorpresas en el sitio.

Otra palanca en la distribución de energía es el 800 VDC. La corriente continua de alta tensión transporta más potencia con menos pérdidas de cobre y facilita el escalado. Combinado con MaxLPS, la envolvente de energía fija del sitio se usa de manera más eficiente y disminuye la necesidad de recablear con cada generación de GPU. Mencionado brevemente en el informe, este detalle importa para los racks densos de clase Rubin.

El avance en refrigeración es la refrigeración líquida direct-to-chip a 45 °C. Una placa fría de cobre se asienta sobre el dado; el refrigerante que entra a 45 °C absorbe el calor en la fuente y sale cerca de 55 °C. El refrigerante es un circuito cerrado de 75 % de agua y 25 % de propilenglicol, bombeado desde una unidad de distribución de refrigerante a través de los servidores y de vuelta. Los híbridos anteriores refrigeraban líquidamente solo GPU y CPU mientras el resto seguía con aire; la generación Rubin se describe como el primer diseño totalmente refrigerado por líquido, sin ventiladores en ningún lugar.

La magia de los 45 °C es eliminar los chillers. La refrigeración por aire convencional depende de chillers y torres de enfriamiento que queman energía y agua en los días calurosos. Cuando el agua de entrada tolera 45 °C, muchos climas pueden funcionar sin chiller con enfriadores secos. El blog de NVIDIA señala que en climas favorables esto puede reducir el agua de refrigeración de la instalación de unos 2,6 millones de galones por megavatio al año con sistemas de torre a casi cero. Refrigerar con agua más caliente que un jacuzzi suena contraintuitivo, y sin embargo el silicio se mantiene dentro de los límites validados dentro de la placa fría.

La tabla comparativa del informe hace tangible la brecha. La refrigeración por aire se sitúa en un PUE de 1,5 a 1,8 mientras que el líquido a 45 °C baja hacia 1,05. La densidad es de 15 a 20 kW por rack con aire frente a 120 kW o más con líquido. El agua y el impacto ambiental también divergen: torres de evaporación abiertas frente a un circuito cerrado con pérdidas casi nulas. Leídos en conjunto, muestran que la refrigeración líquida recorta no solo la factura energética, sino también las de terreno y agua.

La escalabilidad y la cultura de pruebas son los otros diferenciadores de hardware de DSX. La Enterprise Reference Architecture se construye sobre una unidad escalable de cuatro nodos, construida y validada de extremo a extremo en los laboratorios de NVIDIA, creciendo de forma predecible de cuatro a ocho, doce y dieciséis nodos. Los socios OEM Cisco, Dell, HPE, Lenovo y Supermicro someten sus ofertas a una junta de revisión de diseño. Los clientes, por tanto, no compran una lista de materiales, sino una arquitectura de confianza.

Estas arquitecturas vienen en tres sabores. RTX Pro AI Factory para aceleración universal en la entrada, HGX para IA de alto rendimiento en el medio, NVL72 para entrenamiento a escala giga y modelos frontera en la cima. Todas se apoyan en NVIDIA Certified Systems y Spectrum-X Ethernet con NVLink y topologías de red escalables. Una empresa puede empezar en un nivel y expandirse a otro mientras las suposiciones de red y operativas se mantienen consistentes, reduciendo el riesgo.

Sobre el hardware, el Enterprise Validated Design completa la pila. En el pastel de cinco capas de Jensen, las tres capas inferiores son energía-chip-infraestructura, las capas superiores son modelos y aplicaciones; las arquitecturas de referencia cubren la parte inferior, los diseños validados la superior. El ciclo de vida se plantea como un volante de datos: selección de datos, curación, entrenamiento y ajuste fino, habilidades de agentes, despliegue y observabilidad, y luego la retroalimentación de los rastros de producción al siguiente ciclo de desarrollo. Cada compartimento alberga software probado conjuntamente por NVIDIA y proveedores independientes.

La propia fábrica de NVIDIA se presenta como prueba viviente. Internamente, unos cuarenta mil empleados generan cuatro billones de tokens al mes y doscientos millones de solicitudes de inferencia al día con una disponibilidad cercana al 99,9 %, con una demanda interna que crece un 40 % mes a mes. ChipNeMo, usado a diario por casi los cinco mil ingenieros de hardware y en evolución desde hace tres años, destaca. En IT, la desviación de tickets y el autoservicio escalaron en escritorios virtuales 24/7 donde los agentes operan de forma autónoma; un sistema dimensionado inicialmente para mil usuarios estalló hasta veinticinco mil solicitudes cuando el uso de agentes se disparó.

La escala del ecosistema muestra por qué DSX es más que papeleo. Foxconn, Schneider Electric, Vertiv, Bechtel y Caterpillar construyen infraestructura física según la especificación DSX; PTC, Dassault, Siemens, Cadence y ETAP cubren la simulación, y Procore la ejecución en campo. El ejemplo de IREN, una asociación de múltiples capas sobre un portafolio global de 5 gigavatios que comienza con un acuerdo de nube de 60 megavatios en Childress, ancla la estrategia. A esta escala, cada mes de retraso se plantea como miles de millones en ingresos perdidos.

De cara al futuro, dos temas dominan. Uno es la planificación de capacidad híbrida de nube más local; con ciclos de adquisición de 6 a 9 meses, un colchón en la nube es crítico para satisfacer la demanda. El otro es la computación confidencial para llevar modelos frontera a las instalaciones de forma segura, con pesos cifrados y de protección demostrable mientras los datos de la empresa permanecen dentro de su perímetro. Juntos decidirán la tokenomía de las industrias reguladas preocupadas por el cumplimiento y la movilidad de los datos.

Visualization: nodesdaily AI

Comentario de la IA

""Al leer el informe junto con cinco vídeos, mi conclusión es clara: NVIDIA ya no vende solo chips, está convirtiendo el edificio mismo en producto — un movimiento pragmático pero profundamente vinculante.""

Evaluación de la IA

Fortaleciendo al máximo el contraargumento, la promesa de eficiencia de DSX es inseparable de la escala y el compromiso. Construir según la especificación DSX hace que absorber la próxima generación de NVIDIA sea dramáticamente más barato, pero el mismo edificio se vuelve costoso si luego quieres ASIC o una GPU rival. Como señala FrontierNews, dado que las capas de edificio, energía, refrigeración y control están dimensionadas para el perfil prospectivo de NVIDIA, la elección racional te mantiene con el mismo proveedor. Eso es a la vez un codiseño que eleva el rendimiento y un cautiverio silencioso.

Sobre las limitaciones y la metodología, destacan tres carencias. Primero, cifras como el 40 % de capacidad adicional y un PUE cercano a 1,05 asumen una envolvente de energía fija y un clima favorable; cambia la mezcla de cargas, la temperatura ambiente o las restricciones de un sitio existente y la misma tabla ya no se sostiene. Segundo, con el promedio de la industria en 1,55 en 2022 y los mejores sitios de hiperescala ya en 1,2, la ganancia incremental de DSX depende de dónde empieces. Tercero, las bandejas totalmente refrigeradas por líquido traen costos operativos — riesgo de fugas, ventanas de servicio y fiabilidad de las CDU — que carecen de amplios datos de campo; un circuito cerrado ahorra agua, pero una mezcla de glicol y sus unidades de distribución exigen su propia disciplina.

Sobre la verificabilidad y los incentivos, divido el panorama. Las afirmaciones medibles — rangos de PUE, densidad de 120 kW o más, agua de 2,6 millones de galones por megavatio al año hacia cero, tablas de GPU por MW — están abiertamente documentadas en documentos y blogs de NVIDIA, pero todas medidas dentro de la referencia DSX simulada en Omniverse, de clase Rubin. Contrastes de estudios de Eaton y ASME que muestran alrededor de un 27 % de caída en el consumo de la instalación con un 75 % de transición al líquido ayudan a validar la dirección, pero la factura final sigue variando según el clima, la tarifa y la carga de trabajo. En cuanto a los incentivos, operadores como IREN eligen racionalmente DSX para blindarse ante el futuro; esa elección también preconfigura el poder de negociación para la próxima generación.

Mi conclusión práctica es esta: el codiseño de DSX tiene más sentido donde la inferencia es continua, los presupuestos de tokens explotan y los datos deben permanecer en las instalaciones por cumplimiento. Partir de la unidad escalable de cuatro nodos y avanzar hacia HGX y NVL72 es convincente, especialmente con casos de ROI medibles como ChipNeMo y la desviación de tickets. Si las cargas son esporádicas, el clima es cálido y el sitio existente no puede albergar fácilmente circuitos líquidos, empezar en híbrido y planificar solo los pods nuevos refrigerados por líquido es más sano. Yo decidiría no por la etiqueta de PUE, sino por los tokens por megavatio y la factura del agua.

Fuentes

11 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

nvidia dsx · fabrica ia · refrigeracion liquida · 45c · maxlps · pue · vera rubin

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…