La mise en réseau ouverte de co-conception soutient la stratégie Helios d'AMD à grande échelle

L'infrastructure de l'IA subit un changement fondamental à mesure que l'unité de déploiement passe du rack de serveur à l'ensemble du centre de données, faisant de la mise en réseau ouverte de co-conception une priorité de conception de premier ordre plutôt qu'une réflexion après coup.

Cette réorganisation était pleinement visible cette semaine alors qu'Advanced Micro Devices Inc. a profité de son événement Advancing AI 2026 pour affirmer que sa plate-forme à l'échelle du rack Helios ne peut pas réussir sans une ouverture radicale des réseaux. La société a expliqué comment la consommation mensuelle de jetons a augmenté de 158 fois en seulement deux ans, une trajectoire qui place le débit, la fiabilité et la programmabilité du réseau au centre de la conception du système d'IA, selon Soni Jiandani (photo de droite), vice-président senior et directeur général d'AMD.

« Le rôle du réseau ne fait qu'augmenter car si vous devez fournir ces systèmes à grande échelle avec des performances, une haute disponibilité et ce type de consommation de jetons de 158X en deux ans, le réseau est fondamental pour proposer une approche équilibrée », a déclaré Jiandani. « Avec l'évolution vers ces grands modèles frontières et l'IA agentique, le réseau ne pourrait pas être plus fondamental. »

Jiandani et Omar Baldonado (à gauche), directeur principal du centre de données et des réseaux IA chez Meta Platforms Inc., se sont entretenus avec Dave Vellante de theCUBE lors de l'événement AMD Advancing AI, lors d'une diffusion exclusive sur theCUBE, le studio de diffusion en direct de SiliconANGLE Media. Ils ont discuté de la manière dont la mise en réseau ouverte de co-conception sous-tend la stratégie Helios à l'échelle du rack d'AMD, du rôle d'Ethernet dans les déploiements back-end de l'IA et de la manière dont les charges de travail agents intensifient les demandes de mise en réseau. (* Divulgation ci-dessous.)

Un réseau de co-conception ouvert facilite le partage d’une infrastructure d’IA

Ce réseau de co-conception s'étend profondément dans la structure elle-même, où AMD et Meta ont construit conjointement l'interconnexion évolutive qui lie les GPU d'Helios en un seul pool de ressources. Ce travail reflète un tournant plus large de l’industrie, dans la mesure où Ethernet a désormais dépassé InfiniBand dans les déploiements de réseaux back-end d’IA.

« Nous avons collaboré très étroitement avec Meta pour nous assurer que l'Ultra Accelerator Link, ou UALink, sur Ethernet… devienne le tissu réunissant tous les GPU », a déclaré Jiandani. « Nous avons 50 % de mémoire en plus que notre concurrent. Comment apporter des attributs de haute disponibilité ? Parce que désormais, le domaine de défaillance est constitué de dizaines de GPU agissant comme un seul avec beaucoup de mémoire.

L'ouverture inhérente à ce partenariat remonte au rôle précoce de Meta dans la création de l'effort de mise en réseau de l'Open Compute Project, une approche qui a directement façonné Helios, a noté Baldonado. Les exigences en matière de mise en réseau s'accentuent à mesure que les charges de travail d'inférence et d'agent impliquent simultanément l'accès au processeur, le stockage et le traitement distribué.

«Le réseautage a besoin d'ouverture, car il s'agit de relier les choses ensemble», a déclaré Baldonado. « De nombreuses technologies différentes à travers la pile doivent interopérer et fonctionner ensemble. »

L’évolution vers l’IA agentique intensifie encore cette complexité, car les charges de travail lourdes en contexte nécessitent de vastes données de cache clé-valeur, ou KV, partagées entre les serveurs et le stockage. Les unités de traitement de données d'AMD, ou DPU, sont en train d'être positionnées pour absorber ce fardeau, libérant ainsi les GPU et les CPU pour des travaux à plus forte valeur ajoutée, a noté Jiandani.

« Aucune entreprise ne peut résoudre ce problème seule », a déclaré Jiandani. « Avoir la possibilité de co-concevoir, de co-développer et de réfléchir à l'endroit où atterrira la prochaine génération de charges de travail vous donne l'opportunité non seulement d'apporter le meilleur des actifs dont nous disposons, mais également d'apporter le meilleur des actifs avec nos clients. »

Voici l'interview vidéo complète, qui fait partie de la couverture de SiliconANGLE et theCUBE sur le Événement AMD Advancing AI :

(* Divulgation : TheCUBE est un partenaire média payant pour l'événement AMD Advancing AI. Ni AMD, le sponsor de la couverture de l'événement theCUBE, ni les autres sponsors n'ont de contrôle éditorial sur le contenu de theCUBE ou SiliconANGLE.)

Photo : SiliconANGLE

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine