Volver al inicio

IA de escritorio: ejecutar los modelos Nemotron en local con DGX Spark y Station

El episodio Nemotron Labs de NVIDIA muestra cómo los modelos Nemotron 3 de pesos abiertos se ejecutan en local en DGX Spark y DGX Station; recetas oficiales, especificaciones y la pila de agentes NemoClaw se reúnen en esta guía.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — WWp_RFBn34M
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Inteligencia sin factura de nube: Nemotron se muda a casa

El episodio Nemotron Labs del canal NVIDIA Developer abre con una afirmación llamativa: algunos de los modelos abiertos más capaces ya funcionan en una caja del salón. El presentador pone a la familia Nemotron 3 en el centro y muestra cómo convertir estos modelos en un servicio vivo sobre DGX Spark y DGX Station. El playbook oficial de Build.nvidia.com promete lo mismo: un servidor de inferencia de estilo productivo en un solo DGX Spark, tras una API compatible con OpenAI . Es decir, un punto de acceso real que se interroga con curl y se conecta a agentes y herramientas IDE.

Primero, la familia. Según la página Nemotron 3 de Research.nvidia.com, la familia anunciada el 15 de diciembre de 2025 tiene tres miembros: Nano, Super y Ultra. Los tres comparten una arquitectura híbrida Mamba-Transformer MoE que promete mucho mayor rendimiento con igual o mejor precisión que los Transformers clásicos. Los rasgos comunes también imponen: diseño de expertos LatentMoE sensible al hardware en Super y Ultra, capas de predicción multitoken que aceleran la generación larga, entrenamiento en precisión NVFP4 y contexto de hasta 1 millón de tokens . La postformación aporta refuerzo multientorno y control del presupuesto de razonamiento en inferencia.

Tres hermanos: Nano, Super y Ultra

El pequeño Nano se lee como una lección de eficiencia. Según las cifras de la página Research, el modelo solo activa 3.200 millones de parámetros (3.600 con embeddings) para un tamaño total de 31.600 millones. Y aun así supera a modelos mucho mayores como GPT-OSS-20B y Qwen3-30B-A3B-Thinking-2507. En un solo H200, con 8K de entrada y 16K de salida, alcanza 3,3 veces el rendimiento de Qwen3-30B-A3B y 2,2 veces el de GPT-OSS-20B. También lidera en RULER en contexto largo, y sus pesos se publican en FP8 y BF16 con recetas y conjuntos Nemotron-CC.

El mediano Super, publicado el 10 de marzo de 2026, sube el listón. Según la página Super de Research, este MoE de 12.000 millones de parámetros activos y 120.000 millones en total es el primero de la serie en combinar LatentMoE, capas MTP y preentrenamiento en NVFP4. Las cifras son directas: 2,2 veces el rendimiento de GPT-OSS-120B y 7,5 veces el de Qwen3.5-122B con 8K de entrada y 64K de salida, además de liderar RULER con un millón de tokens. Puntos de control NVFP4, FP8 y BF16 más datos abiertos: los resultados salen del laboratorio y se descargan.

Un superordenador en el escritorio: Spark y Station

El hardware vale la mitad de la historia. Según la página DGX Spark de Nvidia.com, el equipo ofrece 1 petaFLOP de rendimiento IA en FP4 gracias al superchip GB10 Grace Blackwell , y sus 128 GB de memoria unificada permiten inferencia hasta 200.000 millones de parámetros y ajuste fino hasta 70.000 millones. La red ConnectX une hasta cuatro sistemas Spark para escalar a 700.000 millones de parámetros . El formato compacto y eficiente apunta a agentes siempre activos.

La mayor DGX Station mueve la vara del escritorio al centro de datos. Según la página Station de Nvidia.com, combina el superchip GB300 Grace Blackwell Ultra con 748 GB de memoria coherente y 20 petaFLOPS de cómputo IA, con desarrollo, ajuste e inferencia en local hasta 1 billón de parámetros . Su tarjeta ConnectX-8 de 800 gigabits por segundo puede enlazar dos Stations. Llega con pila Ubuntu preconfigurada y bibliotecas CUDA-X, más telemetría BMC y Redfish para gestión de flotas.

¿Cómo se instala todo en la práctica? La respuesta está en el repositorio NVIDIA/dgx-spark-playbooks de GitHub y las recetas de Build.nvidia.com. Para Nano la receta es simple: vLLM en Docker (imagen v0.20.0), pesos locales Nemotron-3-Nano Omni y servidor en el puerto 8000. Para Super hay dos vías: vLLM con analizador de razonamiento o TensorRT-LLM (1.3.0rc9) con trtllm-serve y fichero de configuración. Ambas piden terminal Linux, acceso GPU en Docker y token de Hugging Face para pesos protegidos; la primera instalación tarda decenas de minutos, pero el riesgo es bajo.

El mensaje real de la segunda mitad son los agentes. Según la entrada de junio de 2026 en Developer.nvidia.com, NVIDIA acorta el camino del desembalaje al agente local: con el software de junio de 2026, las actualizaciones inalámbricas dejan de imponerse al instalar, y el plan abierto NemoClaw instala en un comando modelo, armazón de agente y entorno aislado OpenShell . El rendimiento crece con Qwen3.6, y los equipos que desbordan una máquina reciben un montaje guiado de clúster multinodo . La lógica es clara: el contexto sensible queda en el dispositivo y el coste por token cae a cero.

En conclusión: la frontera entre alquilar nube y comprar un superordenador de escritorio se estrecha. Spark encaja con equipos sensibles a la privacidad, desarrolladores de agentes permanentes y ajustes hasta 70.000 millones de parámetros; Station mira a laboratorios que rozan el billón. En ambos casos, la primera factura es el hardware y la espera de descargas: los modelos son abiertos, pero electricidad, disco y mantenimiento los paga el dueño.

Visualization: nodesdaily AI

Momentos clave

  1. Apertura: por qué Nemotron funciona en local
  2. Recetas de instalación para Nano y Super
  3. Comparativa de hardware Spark y Station
  4. Cierre sobre agentes locales y NemoClaw

Comentario de la IA

"Ejecutar grandes modelos sin factura de nube ni datos fuera de casa por fin parece viable, y las cifras acompañan. Aun así, lea con la insignia de NVIDIA presente: los números impresionan, pero la verificación independiente es obligada."

Evaluación de la IA

El contraargumento más fuerte viene de la nube: un H200 alquilado por horas ejecuta el mismo Nano con más flexibilidad, sin compra, electricidad ni mantenimiento, y la mejora se hace en un clic. Los multiplicadores de 3,3 y 7,5 citados por el presentador son además medidas de NVIDIA; las reproducciones independientes en cargas variadas se limitan a las comparaciones elegidas de las páginas Research. Lo que los formatos de 4 bits como NVFP4 restan en precisión varía por tarea y pide cautela, sobre todo en contexto largo.

También hay ausencias. El episodio ignora realidades de escritorio como consumo y ruido de ventiladores; cuánto suena una caja de agente permanente en el salón es un misterio. Sin precios en páginas oficiales y listados de tiendas volátiles. Los pesos protegidos que exigen token de Hugging Face y licencias se omiten. Y este artículo es en sí una síntesis web: la palabra exacta del episodio era inaccesible, el contenido compila recetas y páginas de producto.

El interés del orador es evidente: producción de NVIDIA Developer cuyo fin es invitar al ecosistema, vender DGX y hacer crecer NIM y CUDA. Eso no falsifica las cifras, pero enmarca el relato: hardwares rivales, configuraciones AMD y Apple, incluso pilas ligeras con llama.cpp quedan de figurantes. Los datos de NVIDIA Research son informes de empresa, no artículos revisados por pares.

Lección práctica para el lector: si su equipo ya construye agentes, mantiene datos fuera de la nube y trabaja en torno a 200.000 millones de parámetros, Spark es un candidato serio con menor coste de prueba que la nube. Pero para unos pocos ensayos mensuales, el alquiler aún gana. Antes de decidir, mida su propia carga, compruebe ruido y consumo en persona, y luego abra la cartera.

Fuentes

8 enlaces; 1 de ellos también citados por 1 otra noticia. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

nemotron · dgx spark · dgx station · ia local · modelos abiertos · nemoclaw

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…