Et si la prochaine bataille de l'IA se jouait moins dans les puces que dans l'endroit où dort leur mémoire ? C'est le pari de Huawei avec l'OceanStor M900, un système qui fait basculer la mémoire de contexte depuis la RAM vers le SSD , avec un cluster annoncé à 64 Po de cache, 40 To/s de débit agrégé et environ 60 microsecondes de latence, soit un effondrement face aux accès classiques en millisecondes, selon les documents techniques détaillés publiés sur huawei.com qui décrivent cette rupture comme une nouvelle couche mémoire pour l'ère agentique.
Du manque de mémoire au stockage de contexte
L'annonce a été mise en scène à Huawei Connect 2026 à Shanghai , lors de la présentation inaugurale de David Wang consacrée aux fondations matérielles du monde agentique. Le dirigeant y a défendu l'idée d'un context memory storage, une couche dédiée à la conservation et au rappel instantané des contextes de dialogue, comme le résume le compte rendu publié sur unite.ai qui détaille le discours et les ambitions affichées pour les infrastructures chinoises.
Pour comprendre l'enjeu, il faut visualiser le KV cache comme un carnet où le modèle note tout ce qu'il a déjà calculé pour ne pas tout recommencer à chaque mot. Quand une conversation atteint un million de tokens, ce carnet devient immense et déborde de la mémoire vive des accélérateurs. Les agents autonomes , qui enchaînent outils, recherches et longs raisonnements, aggravent encore cette pression en multipliant les allers-retours dont le coût se paie en latence et en énergie.
Le contexte économique rend ce déplacement presque inévitable, car la HBM reste chère et rare, captée en priorité par les GPU les plus demandés. La DRAM classique soulage un temps les serveurs, mais elle plafonne vite en capacité et en budget face aux contextes géants. Le SSD change l'équation par son prix au téraoctet très inférieur, et l'analyse du Memory Wall publiée sur trendforce.com montre bien comment le supercycle autour de HBM3e et DDR5 pousse les opérateurs à chercher des relais de capacité.
Une architecture pensée pour l'inférence durable
Huawei répond par une hiérarchie mémoire explicite où le SSD devient une extension adressable du cache, reliée par UnifiedBus en un seul saut. Le trajet évite le processeur hôte grâce à un chemin direct entre NPU et mémoire flash, ce qui installe un bypass CPU et réduit les copies inutiles, et les pages produits relayées sur huawei.com précisent l'échelle visée avec 16 To partagés par carte NPU, 64 To par unité et près de 7 Po par rack dense.
Reste la question qui tue pour le flash : l'usure en écritures permanentes, car le cache se réécrit sans cesse au fil des conversations. Huawei met en avant un pilotage KV-aware qui adapte la granularité, la compression et la répartition des écritures aux motifs réels de l'inférence. Ce logiciel permettrait 24 DWPD d'endurance, une durée de vie multipliée par 16 (x16) et trois ans de fonctionnement stable, des ordres de grandeur repris par l'analyse publiée sur blocksandfiles.com qui insiste sur le rôle central du logiciel.
Sur le plan des performances, le constructeur avance un débit de tokens doublé (2x) sur des charges de codage assisté et un TTFT divisé par deux , le délai avant le premier mot chutant nettement. Ces gains restent toutefois des allégations, car il n'existe à ce jour ni test indépendant, ni prix public, ni fiche complète permettant de reproduire les mesures, une prudence que souligne aussi l'éclairage publié sur blocksandfiles.com autour des résultats sociaux et des démonstrations orchestrées par les fournisseurs.
Un signal industriel plus qu'un coup isolé
L'idée n'est d'ailleurs pas isolée, car NVIDIA explore une voie parallèle avec son Context Memory adossé aux DPU BlueField-4 pour la génération Rubin . Le groupe y promet jusqu'à 5x plus de requêtes par seconde et une efficacité très supérieure, selon les billets techniques hébergés sur developer.nvidia.com qui décrivent dès mars 2026 cette mémoire désagrégée comme un levier majeur pour les usines d'IA.
Côté recherche, le projet Mooncake de Moonshot AI avait déjà montré l'intérêt et la difficulté d'un délestage du KV cache vers le SSD. L'opportunité est claire : recycler les préfixes de requêtes et viser plus de 95 pour cent de réutilisation sur certaines traces. La difficulté l'est tout autant, entre latence de rappel, amplification des lectures et orchestration fine, comme l'explique la synthèse ouverte sur kvcache.ai qui documente méthodes, jeux de données et arbitrages.
Il faut donc garder la tête froide : la physique n'a pas changé, un flash restera toujours plus lent qu'une HBM collée au calcul. Le verrou se déplace vers l' écosystème logiciel , les connecteurs et la confiance des opérateurs, car la mémoire n'est pas le raisonnement et un vaste rappel ne rend pas un modèle plus intelligent. La suite se jouera dans les déploiements réels chez les hyperscalers, seuls capables de dire si le SSD devient durablement de la mémoire.
Moments clés
Commentaire de l’IA
"Le sujet mérite mieux qu'un simple effet d'annonce, car il touche au coût réel de l'inférence à l'ère des agents. Nous avons croisé la présentation vidéo avec la documentation et la presse spécialisée pour démêler le prouvé du promis. Le résultat éclaire une piste sérieuse, sans en gommer les angles morts."
Évaluation de l’IA
Le contre-argument le plus fort reste la hiérarchie physique : 60 microsecondes, c'est remarquable pour du flash, mais cela demeure des ordres de grandeur au-dessus de la HBM qui alimente le calcul. Si le taux de réutilisation du cache chute ou si les accès deviennent aléatoires, le gain promis peut fondre et le réseau redevient le goulot.
Il manque surtout des preuves indépendantes : aucune mesure reproductible en conditions réelles, aucun prix public, aucune fiche complète ni détail sur la configuration de test du doublement de débit. On ignore aussi la compatibilité avec les piles logicielles dominantes, la consommation à l'échelle du rack et le comportement après des mois d'écritures intensives.
Le présentateur a un intérêt évident pour le récit d'un basculement géopolitique, où la Chine contournerait la pénurie de HBM par l'ingénierie système. Cet angle rend la vidéo percutante et capte un public friand de ruptures, mais il peut aussi lisser les réserves et transformer des annonces commerciales en certitudes techniques.
Pour un opérateur, la conséquence pratique est d'ouvrir un pilote ciblé plutôt que de parier une architecture entière : mesurer le taux de hits sur ses propres charges, chiffrer le coût total avec endurance et logiciel, et comparer avec la désagrégation mémoire concurrente. Le dossier vaut une veille active, avec un verdict suspendu aux premiers déploiements chez les hyperscalers.
Sources
7 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube - Eastern Engine video
- @huawei.com Huawei - official announcement
- @unite.ai Unite.AI - M900 report
- @blocksandfiles.com Blocks and Files - analysis
- @developer.nvidia.com NVIDIA Developer - CMX blog
- @kvcache.ai KVCache.ai - Mooncake article
- @trendforce.com TrendForce - Memory Wall insight
huawei · mémoire ia · kv cache · ssd · datacenter