Volver al inicio

Huawei traslada la memoria de la IA de la RAM al SSD

Huawei presenta el OceanStor M900 como un almacenamiento de contexto capaz de llevar la caché KV al SSD a gran escala. Las cifras anunciadas impresionan, pero aún deben confirmarse en despliegues independientes.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — h-VFo6nIqo0
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

¿Y si el próximo cuello de botella de la IA no estuviera en el cálculo sino en dónde duerme la memoria? Esa es la apuesta de Huawei con el OceanStor M900, un sistema que traslada la memoria de contexto desde la RAM al SSD , con un clúster anunciado de 64 Po de caché, 40 To/s de ancho de banda agregado y unos 60 microsegundos de latencia, un salto enorme frente a los milisegundos habituales, según los documentos técnicos publicados en huawei.com que presentan esta ruptura como una nueva capa de memoria para la era de los agentes.

De la memoria escasa al almacenamiento de contexto

El anuncio se escenificó en Huawei Connect 2026 , en Shanghái , durante la intervención inaugural de David Wang sobre la base material del mundo agéntico. Allí defendió la idea del context memory storage, una capa dedicada a guardar y recuperar al instante los contextos de diálogo, tal como resume la crónica publicada en unite.ai que repasa el discurso y las ambiciones para la infraestructura china.

Para entenderlo ayuda pensar en la caché KV como un cuaderno donde el modelo anota lo ya calculado para no repetirlo con cada palabra. Cuando una conversación roza el millón de tokens, ese cuaderno se vuelve gigantesco y desborda la memoria de los aceleradores. Los agentes autónomos , que encadenan herramientas, búsquedas y razonamientos largos, agravan la presión porque multiplican idas y vueltas que se pagan en latencia y energía.

El trasfondo económico lo hace casi inevitable, porque la HBM sigue siendo cara y escasa, reservada sobre todo a las GPU más demandadas. La DRAM convencional alivia un tiempo, pero topa rápido en capacidad y presupuesto ante contextos gigantes. El SSD cambia la ecuación por su precio por terabyte muy inferior, y el análisis del Memory Wall publicado en trendforce.com muestra cómo el superciclo en torno a HBM3e y DDR5 empuja a buscar capacidad alternativa.

Una arquitectura pensada para una inferencia duradera

Huawei responde con una jerarquía de memoria explícita donde el SSD funciona como extensión direccionable de la caché, unida por UnifiedBus en un solo salto. El camino evita la CPU anfitriona gracias a una ruta directa entre NPU y memoria flash, un bypass de CPU que reduce copias inútiles, y las páginas de producto recogidas en huawei.com concretan la escala con 16 To compartidos por tarjeta NPU, 64 To por unidad y casi 7 Po por rack denso.

Queda la duda letal del flash: el desgaste por escrituras constantes, porque la caché se reescribe sin parar con cada conversación. Huawei presume de un control KV-aware que ajusta granularidad, compresión y reparto de escrituras a los patrones reales de inferencia. Ese software permitiría 24 DWPD de resistencia, una vida útil multiplicada por 16 (x16) y tres años estables, cifras que retoma el análisis publicado en blocksandfiles.com al subrayar el papel central del software.

En rendimiento, el fabricante habla de un caudal de tokens duplicado (2x) en tareas de programación asistida y un TTFT reducido a la mitad , con una espera mucho menor hasta la primera palabra. Son, por ahora, afirmaciones de parte, porque no hay ni prueba independiente, ni precio público, ni ficha completa que permita reproducir las mediciones, una cautela que también recoge la cobertura publicada en blocksandfiles.com sobre demostraciones controladas por proveedores.

Una señal industrial, no un caso aislado

La idea, además, no camina sola, porque NVIDIA explora una vía paralela con su Context Memory apoyada en DPU BlueField-4 para la generación Rubin . Allí promete hasta 5x más peticiones por segundo con una eficiencia muy superior, según las notas técnicas alojadas en developer.nvidia.com que desde marzo de 2026 describen esa memoria desagregada como palanca clave para las fábricas de IA.

Del lado investigador, el proyecto Mooncake de Moonshot AI ya había mostrado la oportunidad y la dificultad de descargar la caché KV al SSD. La oportunidad es clara: reciclar prefijos y rozar el 95 por ciento de reutilización en ciertas trazas. La dificultad también, entre latencia de rescate, amplificación de lecturas y orquestación fina, como explica la síntesis abierta en kvcache.ai con métodos, datos y equilibrios.

Conviene mantener la cabeza fría: la física no ha cambiado y un flash seguirá siendo más lento que una HBM pegada al cómputo. El cerrojo se desplaza al ecosistema de software , los conectores y la confianza de los operadores, porque la memoria no es el razonamiento y un gran recordatorio no vuelve más inteligente a un modelo. Lo que viene se decidirá en despliegues reales de los hiperescalares, únicos capaces de decir si el SSD se vuelve memoria de verdad.

Visualization: nodesdaily AI

Momentos clave

  1. RAM to SSD claim
  2. Connect 2026 intro
  3. KV cache notebook
  4. UnifiedBus single hop
  5. NVIDIA CMX parallel
  6. Limits and outlook

Comentario de la IA

"El tema merece más que un anuncio vistoso, porque toca el coste real de la inferencia en la era de los agentes. Cruzamos la presentación en vídeo con la documentación y la prensa especializada para separar lo probado de lo prometido. El resultado ilumina una vía seria, sin ocultar sus puntos ciegos."

Evaluación de la IA

El contraargumento más sólido sigue siendo la física: 60 microsegundos son una marca notable para flash, pero quedan muy lejos de la HBM que alimenta el cálculo. Si la reutilización de la caché cae o los accesos se vuelven aleatorios, la ventaja anunciada puede diluirse y la red vuelve a ser el cuello de botella.

Faltan sobre todo pruebas independientes: ninguna medición reproducible en condiciones reales, ningún precio público, ninguna ficha completa ni detalles de la configuración tras la duplicación del caudal. Tampoco se conoce la compatibilidad con las pilas de software dominantes, el consumo a escala de rack ni el comportamiento tras meses de escritura intensiva.

El narrador tiene un incentivo claro en el relato geopolítico, ese en el que China sortea la escasez de HBM con ingeniería de sistemas. Ese enfoque hace el vídeo más atractivo para quien busca rupturas, pero también puede suavizar las reservas y convertir anuncios comerciales en certezas técnicas.

Para un operador, la consecuencia práctica es abrir un piloto acotado antes que rediseñar toda la arquitectura: medir la tasa de aciertos con sus propias cargas, calcular el coste total con desgaste y software, y comparar con la memoria desagregada rival. El tema merece seguimiento cercano, con el veredicto pendiente de los primeros despliegues en hiperescalares.

Fuentes

7 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

huawei · memoria ia · caché kv · ssd · centros de datos

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…