L'explosion de la mémoire contextuelle de l'IA frappe le mur de stockage alors que la pénurie de NAND resserre son emprise

L'inférence de l'intelligence artificielle entre dans une nouvelle ère définie non pas par le seul calcul, mais par une demande croissante de mémoire contextuelle que les architectures de stockage traditionnelles n'ont jamais été conçues pour gérer.

L'inférence n'a pas heurté un mur de calcul, mais un mur de mémoire contextuelle. À mesure que les charges de travail de l'IA évoluent d'invites ponctuelles à des sessions agents multi-tours avec des fenêtres contextuelles d'un million de jetons, le volume de données de cache clé-valeur atteint les pétaoctets, dépassant ce que les niveaux de mémoire GPU et DRAM peuvent absorber. La pénurie mondiale de NAND est passée d’un sujet de discussion au niveau de la chaîne d’approvisionnement à un risque opérationnel important pour les organisations ayant des charges de travail élevées en matière d’IA. Le défi consiste à remodeler la façon dont les entreprises de stockage abordent la conception d'usines IA, selon Betsy Chernoff (photo, à gauche), responsable principale de l'IA et du marketing produit chez WekaIO Inc.

« Si vous y réfléchissez à partir du point où nous avons commencé il y a à peine un an, les gens ne faisaient que des invites à un seul coup », a déclaré Chernoff. « Mais au fur et à mesure de notre croissance, vous avez vu des choses comme le multi-tours, la concurrence, de nombreux utilisateurs, de nombreux cycles de conversations différents. Ensuite, en plus de cela, la longueur du contexte elle-même a augmenté. Tout cela a augmenté de façon exponentielle la quantité de mémoire requise pour ces systèmes. « 

Chernoff et Ace Stryker (à droite), directeur du marketing et de l'écosystème de l'IA chez Solidigm, une marque de SK hynix NAND Product Solutions Corp., se sont entretenus avec Gemma Allen de theCUBE lors de la conférence et exposition Nvidia GTC AI, lors d'une diffusion exclusive sur theCUBE, le studio de diffusion en direct de SiliconANGLE Media. Ils ont expliqué comment la mémoire contextuelle crée un tout nouveau niveau de stockage dans les clusters d'IA et pourquoi la pénurie actuelle de NAND rend l'efficacité plus critique que jamais. (* Divulgation ci-dessous.)

La mémoire contextuelle crée un nouveau niveau de stockage

Lors du GTC 2026, Nvidia a annoncé BlueField-4 STX, une architecture de référence modulaire qui insère une couche de mémoire contextuelle dédiée entre les GPU et le stockage traditionnel. La première implémentation à l'échelle du rack inclut la nouvelle plate-forme de stockage de mémoire contextuelle Nvidia CMX, qui étend la mémoire GPU avec une couche contextuelle hautes performances pour les systèmes d'inférence et agents évolutifs. L'annonce valide une direction vers laquelle Weka et Solidigm se dirigent, selon Stryker.

« On a l’impression que le stockage a bénéficié d’une promotion cette année », a-t-il déclaré. « Ce troisième travail consiste en de nouveaux nœuds dédiés spécifiquement au stockage de la mémoire contextuelle ou du cache KV. Il s'agit d'un tout nouveau niveau de stockage dans un cluster d'IA. Et, franchement, le marché était déjà assiégé et ressentait une demande intense avant cette annonce. »

Weka se prépare à ce changement depuis qu'il a dévoilé Augmented Memory Grid au GTC 2025. Lors du salon de cette année, Chernoff a souligné une preuve de concept de niveau production avec Firmus qui a permis d'améliorer jusqu'à 6 fois le nombre de jetons par seconde, soulignant l'impact réel du stockage de cache KV persistant.

« Lorsque nous parlons de chiffres concernant le débit des jetons et que nous parlons de choses telles que le fait que les clients n'auront jamais à recalculer un autre jeton inutilement, tout cela a un impact sur votre retour sur investissement », a déclaré Chernoff. « Et cela inclut également notre partenariat avec Solidigm, car nous ne pouvons pas faire cela sans vous. »

Voici l'interview vidéo complète, faisant partie de la couverture par SiliconANGLE et theCUBE de la conférence et exposition Nvidia GTC AI :

(* Divulgation : Solidigm a sponsorisé ce segment de theCUBE. Ni Solidigm ni les autres sponsors n'ont de contrôle éditorial sur le contenu de theCUBE ou SiliconANGLE.)

Photo : SiliconANGLE

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine