L’infrastructure d’inférence de l’IA devient un défi au niveau système à mesure que les organisations mettent en production des applications génératives et agentiques. Les performances des unités de traitement graphique restent essentielles, mais la latence de stockage, la bande passante du réseau, le mouvement des données et la consommation électrique déterminent de plus en plus le coût et la vitesse de production des jetons.
Les exigences varient également selon la charge de travail. Le chat interactif donne la priorité à la latence, l'inférence par lots met l'accent sur le débit et les systèmes agents créent des contextes en expansion. Dans le même temps, la génération augmentée par récupération et les usines d'IA multi-locataires intensifient les demandes à travers la pile, selon Ka Wai Leung (photo, au centre), gestion des produits de solutions d'IA chez IBM Corp.
« Vous devez comprendre quel type de charge de travail », a-t-il déclaré. « En fonction de la charge de travail, vous comprenez les caractéristiques de la charge de travail et vous construisez votre système en fonction de celle-ci. C'est ainsi que vous évoluez. »
Leung ; William Li (à gauche), directeur général de la gestion des solutions chez Super Micro Computer Inc. ; et Anders Graham (à droite), directeur principal du marketing et du développement commercial des SSD chez Kioxia Holdings Corp., se sont entretenus avec Rob Strechay de theCUBE pour la série d'interviews Supermicro Open Storage Summit, lors d'une diffusion exclusive sur theCUBE, le studio de diffusion en direct de SiliconANGLE Media. Ils ont discuté de la manière dont les exigences en matière de charge de travail, les architectures de données et la conception coordonnée des infrastructures façonnent les performances d'inférence à grande échelle. (* Divulgation ci-dessous.)
L'infrastructure d'inférence d'IA commence par la charge de travail
Les charges de travail de formation dépendent généralement d'un débit séquentiel élevé pour alimenter les modèles et effectuer les opérations de point de contrôle sans laisser les GPU inactifs. Selon Graham, l'infrastructure d'inférence de l'IA met davantage l'accent sur les lectures et écritures aléatoires à faible latence, en particulier lorsque les applications récupèrent en permanence des informations propriétaires ou récemment mises à jour pour fournir du contexte.
« Je pense que nous sommes maintenant dans l'année de l'inférence… une faible latence est essentielle », a-t-il déclaré. « Nous voyons également une génération augmentée par récupération… dans laquelle vous allez essentiellement fournir un contexte supplémentaire aux modèles à la volée en utilisant de nouvelles données ou des données propriétaires, tout ce qui est nécessaire pour recycler le modèle. »
L'inférence de production dépend également de la fraîcheur et de la fiabilité du contexte fourni aux modèles. Cette exigence devient plus difficile lorsque les informations structurées, non structurées et multimodales s'étendent sur les mainframes et d'autres environnements d'entreprise, selon Leung.
« Je pense que le premier défi concerne… les comptes d'entreprise, où les données sont dispersées partout. Comment pouvez-vous, en tant qu'organisation ou architecte, fournir l'accès à tous ces types de données sans ingérer ces quantités massives dans vos usines d'IA ? La gravité des données – la souveraineté des données – est une considération importante. »
La conception full-stack maintient l’efficacité de l’inférence
L’efficacité énergétique est une autre considération essentielle dans l’infrastructure d’inférence d’IA, car les centres de données sont confrontés à des limites en termes d’énergie et de capacité physique disponibles. En comparant ses nouveaux disques CM9 basés sur BiCS8 avec la génération CM7 précédente, Kioxia a mesuré des améliorations significatives des opérations d'entrée/sortie de lecture et d'écriture aléatoires par seconde et par unité de puissance, selon Graham.
« Si nous examinons la charge de travail aléatoire… vous obtenez des mesures similaires où la lecture aléatoire (est) d’amélioration de 76 % et l’écriture aléatoire d’amélioration de plus de 100 % », a-t-il déclaré. « Passer aux technologies de nouvelle génération et tirer parti des nouvelles technologies NAND est un excellent moyen d’obtenir une meilleure efficacité énergétique. »
La conception de référence de Supermicro combine un environnement de calcul Nvidia Corp. HGX B300 avec les disques IBM Storage Scale Erasure Code Edition et Kioxia. L'architecture utilise un niveau de stockage hautes performances pour prendre en charge les charges de travail sensibles à la latence et peut ajouter un niveau de capacité pour les données plus froides, a noté M. Li.
« Le stockage joue le rôle le plus important au cœur des solutions globales pour centres de données ; nous l'appelons Data Center Building Block Solutions », a-t-il déclaré. « Vous n'avez pas besoin de vous adresser à différents fournisseurs pour rechercher une intégration de rack de serveur, un déploiement de refroidissement liquide, un déploiement de stockage ; vous pouvez… vous adresser à Supermicro et travailler avec tous les partenaires très actifs, y compris IBM (et) Kioxia, pour vous fournir également d'autres solutions logicielles. »
Nvidia, IBM et Supermicro ont testé IBM Storage Scale en tant que cache KV partagé. L'approche permet de réutiliser le contexte précédemment calculé sans conserver toutes les données mises en cache dans la mémoire GPU ou la RAM système limitée, et le test a produit des réponses en moins d'une seconde jusqu'au premier jeton sur les longueurs d'invite testées. L'équipe de Nvidia a ensuite demandé qu'un trafic important soit ajouté au réseau Spectrum-X pour tester comment son avantage en matière de débit par rapport à une ligne de base non mise en cache persisterait dans le monde réel, selon Leung.
« Le nombre a un peu diminué, mais je pense que de 4,8 requêtes par seconde à environ 3,6, donc au lieu de 22 fois, c'est 18 fois plus efficace », a-t-il déclaré. « C'est parce que nous avons bombardé le réseau avec beaucoup de bruit pour essayer d'imiter les conditions du monde réel. »
Restez à l'écoute pour l'interview vidéo complète, qui fait partie de la couverture par SiliconANGLE et theCUBE de la série d'interviews Supermicro Open Storage Summit.
(* Divulgation : TheCUBE est un partenaire média payant pour la série d'interviews du Supermicro Open Storage Summit. Ni Supermicro, le sponsor de la couverture de l'événement theCUBE, ni les autres sponsors n'ont de contrôle éditorial sur le contenu de theCUBE ou SiliconANGLE.)