Malgré les progrès rapides de l’intelligence artificielle, le monde de l’entreprise est toujours confronté à un problème de pipeline de données.
Plus de 80 % des données d’entreprise ne sont pas structurées et 99 % de ces données sont obscures pour l’IA car il n’existe pas de solution simple pour les interroger, selon les experts du secteur. Pourtant, les organisations tentent toujours de créer des systèmes d’IA qui nécessitent un accès cohérent et gouverné à ces informations, tout en relevant les défis de la fragmentation et de l’interopérabilité des données.
En conséquence, les lacs de données et les architectures Lakehouse apparaissent comme des composants essentiels de la pile d'IA moderne, et les principaux acteurs du secteur, notamment Advanced Micro Devices Inc., Super Micro Computer Inc. et MinIO Inc., travaillent sur des solutions pour résoudre les problèmes liés au pipeline de données.
« D'après ce que nous constatons, les entreprises clientes d'aujourd'hui n'ont pas de gros problème de calcul, mais elles ont en réalité un problème de pipeline de données », a déclaré Varun Selvaraj (photo, au centre), responsable du développement commercial de l'IA d'entreprise chez AMD. « Ce qui se passe, c'est que ces clients se trouvent désormais avec d'énormes quantités de données non structurées où leur infrastructure n'est vraiment pas à l'échelle de l'IA. Lentement, la transition s'opère non plus vers le calcul, mais plutôt vers les données, en les déplaçant à travers le système. Avec quelle efficacité pouvez-vous déplacer ces données entre les systèmes ? »
Selvaraj s'est entretenu avec Rob Strechay pour la série d'interviews Supermicro Open Storage Summit, lors d'une diffusion exclusive sur theCUBE, le studio de diffusion en direct de SiliconANGLE Media. Il a été rejoint par Albert Tan (à gauche), architecte de solutions chez Supermicro, et Greg DeMichillie (à droite), vice-président du marketing produit et technique chez MinIO. Ils ont discuté de la manière dont les entreprises devraient aborder les architectures Lakehouse, du rôle des normes ouvertes et de la manière dont les lacs de données évoluent pour prendre en charge à la fois l'analyse traditionnelle et les charges de travail d'IA modernes. (* Divulgation ci-dessous.)
Prise en charge du stockage pour le pipeline de données
L’un des facteurs à l’origine du problème du pipeline de données est que le traitement de l’IA dépend des systèmes de calcul CPU et GPU qui doivent constamment recevoir d’énormes quantités d’informations. C'est là que le stockage peut jouer un rôle central dans la conception des environnements Lakehouse, selon DeMichillie.
« Non seulement vous devez alimenter un processeur, mais la couche de stockage est la base pour garantir que vous tirez réellement parti de l'une des ressources les plus coûteuses dont vous disposez, à savoir le GPU », a déclaré DeMichillie au CUBE. « Garder ceux qui sont nourris de manière productive est un élément essentiel de la conception d'une maison de lac IA. Pour construire une maison de lac moderne, vous voulez vraiment éliminer la fragmentation. Vous voulez donc toutes vos données dans un seul environnement de stockage, et nous sommes en mesure de le faire jusqu'à l'échelle de l'exaoctet. «
Alors que les lacs de données et les Lakehouses émergent comme des composants clés de la pile d'IA moderne, Supermicro et ses partenaires travaillent avec leurs clients pour consolider les données tout en maintenant flexibilité et ouverture. La société travaille avec MinIO et sa plateforme AIStor, qui fournit un support natif pour les tables Apache Iceberg et le catalogue Iceberg REST. Supermicro s'appuie sur les systèmes AMD EPYC pour équilibrer les ressources CPU, les voies PCIe et la mémoire sur toute la couche de données.
« Open est vraiment axé sur la flexibilité, le choix et la qualité », a déclaré Tan. « Ce que signifie pour nous « open », c'est que nous sommes capables de rassembler ces « blocs Lego » et de les adapter à ce dont vous avez besoin au moment où vous en avez besoin et dans la taille dont vous avez besoin. Supermicro rassemble tout cela. Nous effectuons nos tests pré-validés afin que vous sachiez avec certitude que lorsque vous recevez cela dans votre centre de données, il est pré-validé et prêt à l'emploi.
Iceberg prend en charge la fonctionnalité de base de données
L'intégration de solutions ouvertes telles qu'Apache Iceberg a été un élément important dans l'évolution des lacs de données. Iceberg transforme les magasins d'objets cloud en lacs de données transactionnels hautes performances, permettant une fonctionnalité de base de données complète et une flexibilité multimoteur sans dépendance vis-à-vis d'un fournisseur.
« Du côté des lacs de données, je pense qu'il est difficile d'exagérer à quel point Iceberg a été un gros problème », a déclaré DeMichillie. « Si vous y repensez, il n'y a pas si longtemps, chaque base de données avait son propre format propriétaire. L'idée d'un format de table ouverte était tout simplement dingue… mais nous constatons vraiment maintenant une adoption généralisée incroyable. Cela nous a permis de faire des choses vraiment intelligentes comme intégrer la prise en charge d'Iceberg dans le niveau de stockage. «
L’essor de l’IA générative a conduit les entreprises dans un monde où les systèmes doivent être soigneusement équilibrés avec les bonnes E/S, la bonne mémoire et la bonne bande passante, ainsi que le bon dimensionnement du GPU. C'est l'une des priorités des trois partenaires dans le développement de solutions offrant le niveau de performance nécessaire tout en déplaçant de grandes quantités de données entre les systèmes.
« Ce que nous constatons aujourd'hui, c'est que ces systèmes sont vraiment complexes », a expliqué Selvaraj. « C'est là que nous intervenons ensemble en tant que MinIO, AMD et Supermicro. Nous pouvons aborder les performances de l'ensemble de la solution, qu'il s'agisse de la pile logicielle ou du matériel. La couche de données ne tombe pas en panne au niveau d'un seul composant, mais elle rompt avec l'ensemble du système, il est donc très important pour nous de nous assurer que l'ensemble du système est équilibré et que les données sont conçues pour circuler en continu. «
Restez à l'écoute pour la vidéo complète, qui fait partie de la couverture par SiliconANGLE et theCUBE de la série d'interviews Supermicro Open Storage Summit.
(* Divulgation : TheCUBE est un partenaire média payant pour la série d'interviews du Supermicro Open Storage Summit. Ni Supermicro, le sponsor de la couverture de l'événement theCUBE, ni les autres sponsors n'ont de contrôle éditorial sur le contenu de theCUBE ou SiliconANGLE.)