L'accélérateur d'inférence dédié de Nvidia, Groq 3 LPX, entre en pleine production pour dynamiser les agents d'IA

Le fabricant de puces Nvidia Corp. affirme que son accélérateur d'inférence dédié à l'intelligence artificielle Groq 3 LPX est désormais entré en pleine production alors qu'il s'efforce de maintenir sa domination dans le monde du calcul de l'IA.

La nouvelle puce, annoncée aujourd'hui au Hot Chips 2026, est décrite comme une extension spécialement conçue pour la plate-forme phare de centre de données Vera Rubin de Nvidia. Selon Nvidia, il est conçu pour offrir des vitesses de génération de jetons ultra-rapides, nécessaires pour exécuter des charges de travail d'IA agentique hautement réactives. Le fabricant de puces a déclaré que le fournisseur de néocloud Nebius Group NV était déjà devenu le premier client à s'engager à utiliser la nouvelle puce.

L'inférence est le jargon de l'industrie de l'IA pour désigner le processus d'exécution de modèles d'IA entièrement formés en production, et elle se concentre de plus en plus sur des agents d'IA autonomes capables d'effectuer des tâches au nom des humains. Ces agents doivent être capables de tout faire : raisonner et planifier, écrire et exécuter du code, inspecter les fichiers système et utiliser des outils tiers en boucle continue. Ils peuvent rapidement analyser des milliers de jetons à travers ces chaînes complexes, mais cela entraîne parfois une « latence de décodage » massive qui peut créer des retards frustrants.

Pour éviter que cela ne se produise, les centres de données d’IA ont besoin d’architectures de calcul plus spécialisées, capables de séparer l’énorme traitement contextuel de la génération de jetons, afin d’augmenter la vitesse à laquelle les agents d’IA peuvent raisonner et travailler.

C'est là qu'intervient la plate-forme rackable Vera Rubin NVL72. Elle est alimentée par des dizaines d'unités de traitement graphique Vera Rubin les plus puissantes de Nvidia, conçues pour gérer l'ingestion et le traitement du contexte à grande échelle. Désormais, avec l’ajout de Groq 3 LPX, il peut décharger ces charges de travail de décodage sur les nouveaux accélérateurs.

Selon Nvidia, Groq 3 LPX permet un déploiement complet à l'échelle d'un rack pour exploiter jusqu'à 256 accélérateurs LP30, reliés par ses interconnexions de puces à bande passante ultra élevée. Cela signifie que les LPU peuvent fonctionner en tandem avec les GPU pour calculer chaque étape de la chaîne de raisonnement d'un agent IA, agissant comme un moteur d'inférence unifié conçu pour l'échelle de l'entreprise.

Nvidia a déclaré que cela contribuerait à éliminer le compromis entre le débit et les temps de réponse. Groq 3 LPX donne aux agents IA la possibilité d'analyser de longues fenêtres contextuelles, de vérifier les données, d'appeler des outils tiers et d'effectuer des itérations sur les tâches en plusieurs étapes les plus complexes en temps réel, sans créer de retards pour les utilisateurs. Il dispose également de données tierces pour étayer cette affirmation. Lors de tests de référence effectués par Artificial Analysis, il a été démontré que Groq 3 LPX produisait un record de 3 400 jetons par seconde lors de l'exécution du modèle agent open source Gemma 4 31B avec une fenêtre contextuelle de 100 000 jetons. Le fabricant de puces estime que cela le rend quatre fois plus réactif aux charges de travail sensibles à la latence par rapport aux plates-formes concurrentes, ce qui signifie que les tâches agentiques en plusieurs étapes peuvent être effectuées en quelques minutes au lieu d'heures.

La nouvelle puce a été construite à l'aide d'une technologie sous licence d'un petit fabricant de puces appelé Groq Inc. Nvidia a payé à la startup la somme colossale de 20 milliards de dollars en décembre pour pouvoir accéder à sa technologie, et a également embauché son fondateur Jonathan Ross et son président Sunny Madra dans le cadre de cet accord. Groq, à ne pas confondre avec le modèle Grok AI de SpaceX Corp., développe des processeurs spécifiquement axés sur l'inférence plutôt que sur la formation en IA.

Le fondateur et directeur général de Nvidia, Jensen Huang, a déclaré que son entreprise avait déjà révolutionné les performances et l'efficacité de l'inférence de l'IA avec ses plates-formes Grace Blackwell et NVL72. « Vera Rubin étend cela avec des configurations d'usine d'IA optimisées pour la charge de travail, conçues pour l'ère de l'IA agentique », a-t-il déclaré. « Nous repoussons les limites des performances avec LPX pour une génération ultra-rapide de jetons. Cela transforme la façon dont l'intelligence est produite, offrant un autre pas de géant en termes de débit, d'efficacité et de réactivité de l'IA. »

Nebius est l'une des premières entreprises à accepter de déployer les puces Groq 3 LPX. Il a déclaré qu'il les utiliserait dans Nebius Token Factory, sa plate-forme d'inférence de production, pour fournir aux clients des vitesses de génération de jetons plus extrêmes pour leurs applications agentiques les plus réactives.

« La génération est la phase d'inférence qui détermine la réactivité réelle d'un système d'IA, et c'est exactement ce pour quoi Groq 3 LPX est conçu pour accélérer », a déclaré Danila Shtan, directrice de la technologie de Nebius. « En tant que premier cloud d'IA à le mettre en production via Nebius Token Factory, nous veillons à ce que chaque étape de la boucle d'un agent soit instantanée. »

Nvidia avait bien plus à dire sur Hot Chips. Il a révélé avoir inscrit SpaceX comme son dernier client phare. La société de fusées spatiales et d’IA prévoit de construire son architecture d’IA de nouvelle génération autour de la plateforme Vera Rubin. Plus précisément, il a annoncé qu'il déploierait les unités centrales de traitement Vera de Nvidia pour les tâches d'orchestration, d'exécution d'outils et de simulation gourmandes en CPU qui couvrent les centres de données terrestres et les satellites orbitaux.

Le fabricant de puces a également présenté plusieurs technologies complémentaires pour les usines d'IA, notamment Spectrum-X Multiplane, une nouvelle architecture Ethernet optimisée pour l'IA qui divise les connexions des serveurs en chemins parallèles pour faire évoluer d'énormes clusters pouvant contenir jusqu'à 512 000 GPU. Ensuite, il y a Nvidia Scale-In, une nouvelle plate-forme logicielle d'infrastructure qui décharge et accélère la sécurité, la mise en réseau et la gestion des données des principaux nœuds de calcul hôtes, et Nvidia NVLink Fusion, qui permet aux processeurs personnalisés et aux unités de traitement de données de se connecter à ses systèmes de rack NVLink de sixième génération.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine