L'inférence de l'IA obtient un nouveau niveau à mesure que les fenêtres contextuelles s'agrandissent

L’infrastructure de stockage de l’IA devient un problème de planification de plus en plus important à mesure que les organisations passent de la formation sur modèles à l’IA agentique. À mesure que les agents raisonnent, agissent et réévaluent, ils construisent des contextes plus longs et génèrent davantage de données auxquelles ils doivent accéder rapidement lors de l'inférence.

L’IA agentique change également la forme du problème des données. Les interactions s’allongent et produisent davantage d’informations. Dans le même temps, la taille, l'importance et le mouvement des données dans l'infrastructure peuvent tous affecter la rapidité avec laquelle une application répond, selon Scott Shadley (photo, à gauche), directeur de la planification technologique chez Solidigm Inc.

« L'une des belles choses qui se sont produites avec cette IA agentique, ou même simplement avec l'ère de l'IA, c'est que les gens commencent à prêter attention au stockage », a-t-il déclaré. « Ce qui est unique à cette époque particulière, c'est qu'elle n'est plus uni ou bidimensionnelle. Nous avons une ampleur et une croissance des données en taille, en importance et tous les autres aspects volumétriques de cela. Mais en fin de compte, cela se résume à ce bit de données et à la vitesse à laquelle ce bit de données se déplace d'un point A à un point B. « 

Shadley, ainsi qu'Anat Heilper (au centre), directrice de l'architecture IA chez Vast Data Inc., et Ben Lee (à droite), directeur de la gestion des solutions chez Super Micro Computer Inc., se sont entretenus avec Rob Strechay de CUBE Research lors de la série d'interviews du Supermicro Open Storage Summit. Ils ont discuté de la façon dont les technologies respectives des sociétés s'intègrent, alors que l'expansion des fenêtres contextuelles et des caches KV crée de nouvelles demandes de stockage et de mémoire pour l'IA agentique.

L'infrastructure de stockage IA rapproche le cache KV du calcul

À mesure que les fenêtres contextuelles s'étendent, la mémoire de l'unité de traitement graphique ne peut à elle seule contenir tout ce dont une charge de travail agent a besoin pendant l'inférence. L'infrastructure de stockage d'IA doit donc fournir des niveaux supplémentaires qui équilibrent la proximité, la capacité et la vitesse, chaque couche gérant une partie différente de la charge de données, selon Shadley.

« En réfléchissant à cette architecture – et vous devez placer ce contexte quelque part – ce contexte peut commencer à vivre dans ce qui était autrefois une zone interdite », a-t-il déclaré. « Les disques SSD ont donc trouvé un nouveau foyer. L'une des particularités de ce niveau 3,5 que nous créons est qu'il ne pourrait pas exister tant que nous n'aurons pas des éléments tels que les SSD (Non-Volatile Memory Express). »

Ce niveau intermédiaire fait partie d’une architecture plus vaste. Solidigm fournit des disques SSD qui offrent un accès rapide aux données mises en cache, Supermicro les intègre dans des systèmes à l'échelle du rack et le système d'exploitation AI de Vast Data fournit le stockage réseau et les services de données nécessaires pour utiliser, gérer et protéger ces données parallèlement à des charges de travail d'IA plus larges, a noté Heilper.

« Lorsque nous parlons de cache (clé-valeur), qui constitue une optimisation très importante qui peut être réalisée dans l'inférence de l'IA… il s'agit essentiellement de la capacité de remplacer le calcul par le stockage », a-t-elle déclaré. « C'est très important car nous savons tous que le GPU est très, très cher. Lorsque vous avez des taux de réussite du cache KV très élevés, nous économisons sur le calcul et réduisons considérablement la latence. »

L’infrastructure de l’IA a besoin d’espace pour évoluer

La proposition Context Memory eXtension, ou CMX, de Supermicro cible les organisations disposant de grands clusters d'IA et de demandes de données substantielles ; d'autres déploiements peuvent nécessiter différentes combinaisons de mémoire, de disques SSD locaux et de stockage réseau. La valeur plus large de l'entreprise réside dans la composition de ces éléments de base autour de la charge de travail de chaque client, plutôt que de traiter une architecture comme une réponse universelle, selon Lee.

« Nous pensons que résoudre le problème nécessitera tout le rack, car vous ne pouvez pas simplement acheter plus de GPU avec plus de (mémoire à large bande passante)… c'est très cher », a-t-il déclaré. « Tout le cache KV débordera naturellement du GPU, HBM, vers la mémoire système, vers le SSD local et vers le stockage réseau. Mais il existe une nouvelle définition industrielle pour essayer de combler le vide, et ils l'appellent G3.5, qui est la solution CMX. Il s'agit d'un niveau de cache KV très natif pour l'IA qui peut répondre à la demande. « 

Vast Data a testé le déchargement du cache KV avec des partenaires dans différents environnements logiciels. Ces expériences visent à montrer comment l'architecture se comporte lorsque le contexte mis en cache est intégré aux charges de travail d'inférence de production, selon Heilper.

« Avec Nvidia Dynamo, nous avons montré que nous avons réussi à obtenir un délai d'obtention du premier jeton 20 fois plus rapide, ce qui signifie que la latence que vous percevez en tant qu'utilisateur est nettement plus rapide », a-t-elle déclaré. « De plus, (nous avons) constaté une économie de 90 % sur le temps GPU. »

Ces résultats dépendent d’une infrastructure de stockage IA capable d’adapter les performances et la capacité de stockage à la charge de travail. Selon Shadley, le SSD orienté performances D7-PS1010 et le disque de capacité D5-P5336 de Solidigm abordent différents points de la hiérarchie. Supermicro intègre ces composants dans des systèmes qui peuvent être configurés en fonction des exigences du client.

« Ce n'est pas la seule définition d'une pile hiérarchique », a déclaré Shadley. « C'est la primaire actuelle que tout le monde utilise comme référence, mais elle continue d'évoluer et elle est unique. Être très proactif avec votre client ou votre fournisseur pour mieux comprendre ce qu'ils savent de ce dont vous avez besoin n'est plus transactionnel. Ces conversations transactionnelles au niveau de la valeur sont désormais ce qui va déterminer l'avenir de notre déploiement de ce type d'architectures. « 

Restez à l'écoute pour la vidéo complète, une partie de la couverture par SiliconANGLE et theCUBE de la série d'interviews Supermicro Open Storage Summit.

(* Divulgation : TheCUBE est un partenaire média payant pour la série d'interviews du Supermicro Open Storage Summit. Ni Supermicro, le sponsor de la couverture de l'événement theCUBE, ni les autres sponsors n'ont de contrôle éditorial sur le contenu de theCUBE ou SiliconANGLE.)

Photo : SiliconANGLE

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine