La concurrence en IA full-stack passe des composants aux plateformes

L’adoption mondiale de l’intelligence artificielle a remodelé de nombreux paysages au cours des dernières années, y compris la dynamique concurrentielle du secteur technologique lui-même.

Il fut un temps où le meilleur modèle de semi-conducteurs ou de services cloud pouvait dicter une grande partie du marché. Cette époque a cédé la place à un nouveau paradigme dans lequel l’intégration du silicium, des logiciels, des réseaux et de l’écosystème des développeurs est la plus importante. Comme l'a récemment noté l'équipe de recherche de CUBE, la base de la concurrence s'est déplacée des composants individuels vers des plates-formes complètes.

Ce changement déterminera à terme l’économie de l’IA, l’usine d’IA occupant le centre de l’infrastructure de l’entreprise. Ce qui différenciera les gagnants des perdants sera leur capacité à générer de la valeur pour les clients grâce aux investissements en IA.

« Nous nous diversifions et nous divergeons de manière assez active », a déclaré Ilya Tabakh (photo), vice-président de l'innovation chez TensorWave Inc. « Quand les gens introduisent ces nouveaux concepts de réflexion profonde ou d'agent ou des choses qui modifient l'équilibre GPU/CPU, en grande partie, qu'essayez-vous de faire ? Nous pouvons parler de jetons, mais en fin de compte, les gens sont intéressés par la création de valeur. En fin de compte, (si) j'y mets un watt ou un dollar ou autre, est-ce que j'obtiens le truc ? que j’attendais ? C’est un nouveau chapitre là-bas.

Tabakh s'est entretenu avec Dave Vellante de CUBE Research pour la série d'entretiens exclusifs « Beyond The GPU: The Full-Stack Fight for Enterprise AI » avec theCUBE, le studio de diffusion en direct de SiliconANGLE Media. Les dirigeants de Supermicro, AMD, Vast Data, TensorWave et Crusoe ont discuté de l'importance croissante du stockage, des réseaux et des écosystèmes ouverts, ainsi que de ce qu'il faut pour construire la prochaine génération d'infrastructure d'IA d'entreprise. (* Divulgation ci-dessous.)

Plateforme d'intelligence artificielle open source

La création de valeur nécessite un cadre capable d'intégrer divers outils et technologies pour la formation et l'inférence de l'IA. Pour fournir ce support, TensorWave a introduit ScalarLM, une plate-forme d'IA entièrement open source pour la formation, le réglage fin et la gestion de grands modèles de langage. ScalarLM fonctionne sur une architecture indépendante du GPU, prenant en charge les processeurs AMD et Nvidia sans nécessiter de modifications de code.

« Nous avons fait beaucoup de travail pour aider les gens à réfléchir à la manière de réduire le délai de rentabilisation », a déclaré Tabakh au CUBE. « (ScalarLM) combine l'inférence et la formation et l'idée générale est de contourner cette conversation du genre : « Hé, construisons un centre de données et connectons-le au réseau informatique. » Il s'agit davantage de se concentrer sur : « Puis-je régler et former une application, un modèle pour mon cas d'utilisation spécifique ? » En minimisant ce délai de rentabilisation, les organisations sont en mesure de comprendre ce que cela va prendre et de baser leur charge de travail.

L'adoption par TensorWave d'une plate-forme d'IA open source met en évidence la manière dont les entreprises technologiques s'efforcent d'offrir à leurs clients une gamme plus large d'options. Les différentes architectures développées autour de l'IA nécessitent un écosystème ouvert, selon Linda Yang, directrice de la gestion des produits IA chez Super Micro Computer Inc.

« Quand je pense à un écosystème ouvert ou à une architecture ouverte, c'est là que vous avez un terrain de jeu qui permet différentes architectures, différentes piles de logiciels qui peuvent fonctionner librement et de la manière la plus efficace possible sur ce terrain de jeu », a déclaré Yang. « Regardez nos clients partenaires… nous travaillons en étroite collaboration pour définir ce que nous entendons par écosystème ouvert. Nous travaillons en étroite collaboration les uns avec les autres, nous nous aidons mutuellement à définir ensemble ce qui est le mieux pour notre client commun. »

La capacité de concevoir des systèmes ouverts a également façonné l'approche de Crusoe, qui cherche à construire une infrastructure d'IA durable. Umair Piracha, directeur principal de la chaîne d'approvisionnement et de l'approvisionnement stratégique pour Crusoe Cloud chez Crusoe Inc., considère la flexibilité et la liberté de choix comme des ingrédients clés de la prochaine vague de valeur de l'IA spécifique à l'industrie.

« L'objectif n'est pas de normaliser une seule technologie », a déclaré Piracha. « L'objectif est de normaliser les résultats tout en conservant la liberté de choix. La conception des systèmes est ouverte. La raison pour laquelle nous sommes avec AMD est à cause de l'architecture ouverte. Et les systèmes avec Supermicro, qui nous aident vraiment, sont évolutifs. Nous pouvons échanger des choses ; nous pouvons échanger des calculs. »

Construire un écosystème néocloud

La flexibilité décrite par Piracha a été un élément clé dans l’essor des néoclouds, des fournisseurs de cloud spécialisés axés sur l’IA et axés sur la fourniture de la puissance de calcul nécessaire à la prochaine génération d’applications et de charges de travail. En plus d'avoir accès aux GPU, les entreprises doivent également prendre en compte les processeurs, les accélérateurs, le stockage, le refroidissement, la mise en réseau et la portabilité des logiciels.

Un écosystème néocloud comprenant AMD, Supermicro, Crusoe et TensorWave s'efforce de rassembler ces éléments dans un cadre intégré. Pour AMD, cela implique de concevoir des architectures qui supportent les besoins des néoclouds et de leurs utilisateurs.

« Si vous regardez la transition que nous effectuons, notre classe d'architecture actuelle, à la pointe de la technologie, est constituée de nos GPU MI355X, et nous en avons huit qui sont étroitement connectés dans un pod », a déclaré Ted Marena, directeur du développement du marché, OEM/ODM des centres de données GPU AI chez AMD. « À mesure que nous passons à notre prochaine génération, le MI455X, nous l'étendons jusqu'à ce que vous disposiez désormais de 72 GPU, étroitement interconnectés. Ainsi, le réseau évolutif et évolutif s'est considérablement accru pour permettre une communication plus rapide et pour fournir les réponses et les réponses plus rapidement. C'est plus rentable pour les néoclouds et pour les clients. « 

L’essor des néoclouds a également offert aux entreprises clientes une alternative aux services fournis par les hyperscalers traditionnels. Il s'agit d'un sous-produit d'une infrastructure plus dense, dans laquelle les GPU interconnectés représentent un modèle différent, selon Tabakh de TensorWave.

« Les hyperscalers ont beaucoup d'applications, ils ont des logiciels, ils ont différents types de charges et ce sont de très bons généralistes », a déclaré Tabakh. « Le néocloud et un centre de données d'IA dense sont un nouveau type de demande. La physique de base est que vous avez besoin de plus de GPU, plus étroitement connectés. Être un généraliste ne vous sert pas bien parce que vous disposez d'une flotte existante. Vous avez un mélange d'expertise assez large, et beaucoup de ces choses ne sont pas applicables dans ce contexte de type industriel à haute densité. « 

Éliminer les goulots d'étranglement du stockage

L’introduction de nouvelles technologies peut également créer de nouveaux goulots d’étranglement. Les accélérateurs d’IA ne peuvent apporter de la valeur que lorsqu’ils reçoivent les données à une vitesse efficace, ce qui exerce davantage de pression sur les réseaux et le chemin d’entrée-sortie du système.

Une combinaison du processeur EPYC d'AMD, du serveur H14 de Supermicro et du système d'exploitation AI de Vast Data est conçue pour fournir un cadre équilibré et efficace pour le stockage à l'ère de l'IA.

« Le stockage est une charge de travail unique dans le monde de l'informatique, car il doit équilibrer l'extraction de données, la lecture des données d'un ensemble de disques SSD, mais aussi leur transfert via le câble », a déclaré John Mao, vice-président du développement commercial mondial chez Vast Data Inc. « Vous voyez ce va-et-vient constant. Vous pressez le ballon du côté SSD, puis c'est le réseau qui devient gonflé et goulot d'étranglement. Vous faites l'autre côté avec le réseau, et ensuite les SSD deviennent le goulot d'étranglement. C'est un exercice d'équilibre constant que nous constatons, ce qui rend tout cela amusant.

Pour éviter d'éclater ce ballon, les trois sociétés se sont concentrées sur la possibilité pour les processeurs d'orchestrer le flux de données vers les GPU. Ce travail a impliqué de nouvelles générations de processeurs AMD qui exploitent l'architecture PCIe pour améliorer la bande passante, selon Penny Tseng, qui aide à diriger le développement du marketing produit chez AMD.

« Vers novembre, AMD lancera sur le marché le premier processeur PCIe Gen 6 à partir de x86 », a déclaré Tseng au CUBE. « Cela peut aider le GPU à accéder aux bonnes données. Le CPU offre une bande passante mémoire supplémentaire qui déplace les données plus rapidement que de génération en génération. Le CPU AMD peut continuer à augmenter les performances, offrant une double bande passante pour rattraper ce dont le GPU avait besoin. « 

Le travail d'AMD sur le marché des processeurs est devenu plus urgent avec l'essor de l'IA agentique. Alors que les entreprises déploient de plus en plus d’agents pour effectuer des tâches autonomes, elles ont besoin d’une infrastructure de données adaptée pour prendre en charge ces charges de travail.

« Avec l'essor de l'IA agentique, il est prouvé que le SSD est indispensable pour cette ingestion de données et les plates-formes de niveau données », a expliqué Ben Lee, directeur de la gestion des solutions chez Supermicro. « Mais comme vous disposez d'un SSD rapide, vous avez absolument besoin d'un processeur à haute vitesse. Le processeur peut non seulement servir de pont pour toutes ces voies PCIe pour le SSD, mais aussi pour la carte NIC, et également fournir des puissances de calcul suffisantes pour faire face à cette charge de travail. Nous essayons de travailler en étroite collaboration avec AMD et Vast pour résoudre ce problème. « 

Nouveau processeur pour l'IA agentique

À mesure que les systèmes d’entreprise fiables convergent avec les applications et les agents basés sur l’IA, il devient encore plus essentiel que les différents éléments de l’infrastructure de l’IA fonctionnent ensemble.

En mai, AMD a annoncé que son processeur EPYC de nouvelle génération, nommé « Venice », accélérait sa production à Taiwan. AMD s'efforce d'intégrer Venice dans la famille de serveurs Supermicro tout en fournissant une infrastructure à l'échelle rack plus large et des améliorations en termes de performances et d'efficacité.

« Venice elle-même, de la façon dont je la décrirais, est la solution la plus performante qui sera sur le marché du côté x86 », a déclaré Derek Dicker, vice-président de l'Enterprise Business Group chez AMD. « Génération après génération, nous verrons une augmentation des performances de 70 % dans le produit lui-même. Nous proposons le délai de commercialisation du PCIe Gen 6 avec un écosystème que nous construisons autour, toujours en partenariat avec Supermicro. »

Pour Supermicro, le lancement de Venice offre plusieurs façons d'améliorer sa gamme de produits serveurs avec le nouveau processeur EPYC. Celles-ci incluent l'intégration avec le châssis d'ordinateur mince monté en rack de Supermicro, connu dans l'industrie sous le nom de « boîte à pizza », ainsi que des systèmes informatiques plus denses, selon Vik Malyala, directeur commercial de Supermicro.

« Lorsque nous avons commencé à examiner Venise, l'une des choses que nous avons commencé à examiner était de savoir dans quels environnements elle allait être déployée en dehors de la manière traditionnelle », a déclaré Malyala au CUBE. « Par exemple, nous avons nos boîtes à pizza standard 1U, 2U avec un seul ou deux sockets. Ensuite, nous avons étendu cela à un ordinateur dense, comme FlexTwin, qui est constitué de plates-formes refroidies par liquide. Ensuite, nous y avons intégré un commutateur pour ceux qui voulaient avoir un ordinateur dense, mais dans un format, disons, plus petit comme un SuperBlade. Et les gammes de produits s'étendent les unes après les autres. »

Voici la liste de lecture exclusive de la série de vidéos « Au-delà du GPU : le combat Full-Stack pour l'IA d'entreprise » :

https://www.youtube.com/watch?v=videoseries

(* Divulgation : TheCUBE est un partenaire média payant pour la série de vidéos « Au-delà du GPU : The Full-Stack Fight for Enterprise AI ». Ni Supermicro, le sponsor de la couverture de l'événement de theCUBE, ni les autres sponsors n'ont de contrôle éditorial sur le contenu de theCUBE ou SiliconANGLE.)

Photo : SiliconANGLE

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine