Le stockage multiniveau réécrit l’économie de l’inférence de l’IA

Alors que l’inférence devient la charge de travail dominante dans l’infrastructure d’IA, les architectures de stockage multiniveaux apparaissent comme une méthode clé pour contrôler les coûts et améliorer les performances.

Ces architectures combinent des niveaux de capacité flash, de stockage objet et basés sur disque, permettant aux entreprises de gérer les flux de travail de formation et d'inférence tout en maximisant la productivité du GPU et les économies économiques. Super Micro Computer Inc. a collaboré avec ses partenaires pour résoudre un problème fondamental : comment satisfaire efficacement le besoin des agents d'IA d'accéder au cache clé-valeur, ou KV, où les données de flux de travail sont stockées.

« Ce que nous voyons réellement sur le marché, ce sont des solutions massives et monolithiques à ces problèmes, et à mesure qu'ils diminuent, ces problèmes sont différents », a déclaré Paul McLeod (photo, en haut à droite), directeur produit du stockage chez Supermicro. « Nos partenaires définis par logiciel ont fait preuve d'une grande créativité pour adapter leurs produits à certains domaines clés très spécifiques. C'est là que nous constatons une croissance énorme pour prendre en charge tous les KV agents que les gens essaient de stocker pendant de plus longues périodes pour les réintégrer dans l'IA. »

McLeod s'est entretenu avec Rob Strechay de CUBE Research pour la série d'interviews Supermicro Open Storage Summit, lors d'une diffusion exclusive sur theCUBE, le studio de diffusion en direct de SiliconANGLE Media. Il a été rejoint par Angela Gill (en bas, à gauche), directrice de l'activation des partenaires chez Intel Corp. ; Jonathan Prout (en haut, à gauche), directeur du développement commercial des mémoires chez Samsung Semiconductor Inc. ; Marc Tanguay (en bas, au centre), directeur principal du marketing produit pour les disques durs chez Western Digital Corp.; Anthony Lembo (en bas, à droite), vice-président de l'ingénierie des systèmes mondiaux chez WekaIO Inc. ; et Greg DiFraia (en haut, au centre), vice-président senior de l'IA et des partenariats d'alliance chez Scality Inc.

Ils ont expliqué comment les entreprises peuvent optimiser l'économie de l'infrastructure de l'IA, où différents niveaux de stockage s'intègrent dans les flux de travail de formation et d'inférence, et comment maximiser la productivité des GPU sans simplement acheter plus de matériel. (* Divulgation ci-dessous.)

Nouvelles solutions de stockage multi-niveaux

L'un des thèmes centraux du panel était de savoir pourquoi la hiérarchisation du stockage a du sens aujourd'hui, car toutes les charges de travail d'IA ne sont pas égales. Les agents créent un large éventail de demandes de données sur différents types de stockage, tels que les fichiers, les objets et le flash, ainsi que les plates-formes GPU et CPU.

Intel a répondu à cette nouvelle réalité avec des solutions telles que sa technologie QuickAssist, un accélérateur matériel intégré à certains processeurs Intel.

« Grâce à des technologies telles que QuickAssist d'Intel, nous pouvons déplacer la compression et le chiffrement du logiciel vers le matériel », a noté Gill. « Cela se traduit directement par des cycles de processeur plus utilisables… une latence plus faible et, surtout, une meilleure efficacité énergétique à grande échelle. Le stockage n'est plus sur la voie lente. Il doit évoluer à la vitesse de calcul. »

Pour que le stockage évolue à la vitesse de calcul, il doit être capable de s'adapter à l'évolution des demandes de traitement. Chez Western Digital, cela implique de rééquiper sa gamme de disques durs, ou HDD, Ultrastar afin de fournir la capacité et les performances nécessaires aux charges de travail d'IA de haute intensité.

«Ajouter de la capacité de stockage n'est pas aussi simple que simplement ajouter un autre rack», a déclaré Tanguay. « Nous devons travailler dans le cadre des empreintes existantes. Avec Ultrastar, nous en sommes à notre disque dur CMR de 28 téraoctets, qui est le disque qui a été qualifié et testé pour fonctionner avec tous les produits de Supermicro. Nous passons à 30 téraoctets dans nos disques durs à technologie Ultrastar CMR avant la fin de cette année. « 

Maximiser les ressources GPU

La collaboration de Supermicro avec ses partenaires de stockage défini par logiciel s'est concentrée sur la recherche de solutions innovantes pour maximiser l'utilisation du GPU. Scality intègre l'accès au stockage direct par GPU dans sa plate-forme en combinant un support flash haute vitesse avec S3. Cela permet aux pipelines de formation et d’inférence d’IA de diffuser des données directement du stockage d’objets vers la mémoire GPU.

« Nous devons augmenter l'utilisation aussi haut que possible, et pour ce faire, vous devez vraiment penser aux choses différemment », a déclaré DiFraia. « Nous faisons des choses sur le niveau extrêmement chaud avec le stockage S3 et GPU direct et S3 sur RDMA, le niveau chaud, le niveau chaud et même le niveau froid. Parce que lorsque nous regardons la topologie pour les clients, il s'agit du cycle de vie, quand vous parlez de dizaines ou de centaines de pétaoctets ou même d'exaoctets, tout ne vivra pas en flash. « 

La mémoire requise pour traiter les exigences du cache KV a parfois dépassé la mémoire GPU et les ressources système disponibles, créant un goulot d'étranglement pour l'inférence de l'IA. Pour résoudre ce problème, Samsung Semiconductor a développé une extension de mémoire évolutive tout en conservant les performances du GPU.

« Nous examinons ces différentes exigences au niveau du stockage de cache KV et nous avons développé des solutions pour répondre à chacune d'entre elles », a expliqué Prout. « Avec des performances locales sur nœud pour les GPU, nous avons développé le PM1723. Il s'agit d'un disque Gen 6 pour des performances extrêmes. Il atteint jusqu'à 28,4 Go par seconde de débit en lecture séquentielle et jusqu'à 6,6 millions d'IOPS en lecture aléatoire. »

De nombreuses entreprises sont confrontées à un scénario dans lequel le stockage des charges de travail d’inférence d’IA nécessite un compromis entre performances et coût. Résoudre ce compromis nécessite une ingénierie minutieuse et une sélection de la technologie de stockage optimale pour minimiser le mouvement des données pour chaque besoin basé sur l'IA.

« Équilibrer les coûts, les aspects économiques et les performances est vraiment difficile, surtout si vous examinez ces charges de travail et ce qu'elles font », a déclaré Lembo au CUBE.  » Du point de vue du serveur GPU, comment puis-je éliminer le mouvement des données et atterrir au même endroit ? La simplicité opérationnelle est l'un des facteurs vraiment sous-estimés qui n'est parfois pas pris en compte lorsque vous essayez d'optimiser l'infrastructure. « 

Restez à l'écoute pour l'interview vidéo complète, qui fait partie de la couverture par SiliconANGLE et theCUBE de la série d'interviews Supermicro Open Storage Summit.

(* Divulgation : TheCUBE est un partenaire média payant pour la série d'interviews du Supermicro Open Storage Summit. Ni Supermicro, le sponsor de la couverture de l'événement theCUBE, ni les autres sponsors n'ont de contrôle éditorial sur le contenu de theCUBE ou SiliconANGLE.)

Photo : SiliconANGLE

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine