L'infrastructure d'IA agentique doit prendre en charge le travail entre les décisions d'un modèle à mesure que les agents passent de la réponse aux questions à l'exécution des tâches.
Les unités centrales de traitement gèrent une grande partie de cette exécution, tandis que les unités de traitement graphique alimentent le raisonnement du modèle. Ces rôles complémentaires façonnent le déploiement prévu du processeur Vera par Nvidia Corp. avec CoreWeave Inc., selon Hannah Coutand (photo, à droite), directrice du marketing produit, Vera CPU, chez Nvidia.
« La raison pour laquelle Vera est si importante est que nous reconnaissons qu'une co-conception extrême signifie que nous examinons l'ensemble de l'usine d'IA et que nous voulons nous assurer de résoudre tous les goulots d'étranglement inefficaces », a-t-elle déclaré. « Nous avons reconnu que le processeur devenait l'un d'entre eux. Nous n'avons pas décidé de dire : » Allons construire des processeurs « . Nous avons décidé de résoudre ce goulot d’étranglement.
Coutand et Harsh Banwait (à gauche), directeur principal des produits chez CoreWeave, se sont entretenus avec Dave Vellante et John Furrier de theCUBE Research lors de l'événement Fully Connected, lors d'une diffusion exclusive sur theCUBE, le studio de diffusion en direct de SiliconANGLE Media. Ils ont discuté des exigences en matière de processeur, des performances du sandbox et de la sécurité de l'infrastructure. (* Divulgation ci-dessous.)
L’infrastructure d’IA agentique met les performances du processeur sous pression
Alors que la formation et l’inférence sont de plus en plus étroitement liées, l’infrastructure doit s’adapter à la fois au calcul des modèles et aux environnements dans lesquels les agents agissent. Les appels d'outils, les appels d'interface de programmation d'applications et les requêtes SQL augmentent le travail d'exécution géré par les processeurs, a expliqué Coutand.
« Je pense que le volume joue certainement un rôle », a-t-elle déclaré. « C'est pourquoi avoir un processeur qui gère extrêmement bien ce type d'appels, avec des cœurs rapides et robustes, une bande passante mémoire élevée et une faible latence, il gère à la fois le fonctionnement dans ce nouveau monde… et constitue une excellente base pour des cas d'utilisation simplement agentiques (et) un apprentissage par renforcement. »
CoreWeave a annoncé son intention d'offrir une capacité de processeur Vera autonome aux côtés de son infrastructure existante. Son offre Sandboxes fournit des environnements isolés dans lesquels les agents peuvent exécuter des tâches pendant l'apprentissage par renforcement et l'inférence, a expliqué Banwait.
« Tout récemment, nous avons également testé cela avec les processeurs Vera, et nous étions fiers de partager que nous avons constaté une amélioration d'environ 3 fois les performances en termes de temps de démarrage du Sandbox », a-t-il déclaré. « Pour nous, il s'agit d'une combinaison très importante pour obtenir les performances dont nous avons besoin du silicium et offrir à nos clients l'expérience qu'ils attendent d'un produit. »
Coordonner la sécurité et les performances dans l’ensemble de l’usine IA
La sécurité façonne également l’infrastructure d’IA agentique. La plateforme Open Agent Safety de Nvidia combine les contrôles d'exécution OpenShell avec Nvidia Sentry fonctionnant sur des unités de traitement de données BlueField-4 pour fournir une couche indépendante de surveillance et d'application.
« Ils sont tous dans un seul plateau Vera Rubin, qui comprend le processeur Vera ainsi que le DPU ; tout cela est inclus dans la même infrastructure matérielle », a déclaré Coutand. « Ainsi, Open Agent Safety Platform, le moteur d'exécution sécurisé, qui est OpenShell, s'exécute sur le processeur Vera dans ce plateau, et DOCA Sentry s'exécute sur la partie DPU. »
L’exploitation de cette infrastructure nécessite une attention particulière à l’alimentation, au refroidissement et à l’automatisation. La mise en réseau, les processeurs et le stockage figurent également dans les priorités techniques de CoreWeave, a expliqué Banwait.
« Tout cela doit pouvoir suivre le rythme », a-t-il déclaré. « Nous allons continuer à nous concentrer là où se trouve le goulot d'étranglement, de sorte que lorsque l'ensemble du système progresse, il le fasse de manière cohérente. Sinon, le maillon le plus faible de la chaîne retient tout cela. »
Voici l'interview vidéo complète, faisant partie de la couverture par SiliconANGLE et theCUBE de l'événement Fully Connected :
(* Divulgation : TheCUBE est un partenaire média payant pour l'événement Fully Connected. Ni CoreWeave, le sponsor de la couverture de theCUBE, ni les autres sponsors n'ont de contrôle éditorial sur le contenu de theCUBE ou SiliconANGLE.)