Positron AI Inc., un développeur d'appareils d'inférence n'incluant pas de mémoire à large bande passante, a annoncé aujourd'hui avoir levé 875 millions de dollars de financement.
NEA, Atreides Management, Valor Equity Partners, Andra Capital, SemiAnalysis Capital et Silicon Graphics Inc. et le co-fondateur de Netscape Inc., Jim Clark, ont dirigé le cycle de série C. Ils ont été rejoints par plus d’une douzaine d’investisseurs institutionnels. Positron vaut désormais 5 milliards de dollars, soit une multiplication par cinq par rapport à février.
Les grands modèles de langage déplacent fréquemment les données entre les circuits informatiques et mémoire des cartes graphiques sous-jacentes. La vitesse à laquelle ils le font est mesurée par une métrique appelée bande passante mémoire. Plus la bande passante mémoire d’une puce est élevée, plus elle peut effectuer l’inférence rapidement.
Les cartes graphiques de qualité serveur sont livrées avec de la mémoire HBM, la variété RAM avec la bande passante mémoire la plus élevée du marché. L’offre de HBM est actuellement bien inférieure à la demande. De plus, il y a une pénurie d'interconnexions utilisées pour intégrer la mémoire HBM aux circuits informatiques des cartes graphiques.
Positron, basée à Reno, au Nevada, affirme avoir évité la crise de la chaîne d'approvisionnement. La société fabrique des appareils d'inférence qui remplacent HBM par LPDDR5X, une variété de mémoire principalement utilisée dans les smartphones.
LPDDR5X est plus facilement disponible que HBM et coûte moins cher. Cependant, il y a un problème majeur : sa bande passante mémoire est nettement inférieure, ce qui se traduit généralement par une inférence plus lente. Positron affirme avoir trouvé un moyen de combler l'écart de performances.
Selon l'entreprise, la plupart des accélérateurs d'intelligence artificielle utilisent moins de 30 % de la bande passante mémoire de leurs modules HBM. En revanche, les appareils d'inférence de Positron débloquent plus de 90 % du débit de LPDDR5X. La société affirme que l’utilisation accrue du matériel compense la différence dans les performances théoriques maximales.
Le système phare de la société s'appelle Titan. Il est livré avec jusqu'à 18,4 téraoctets de LPDDR5X pouvant fournir 23,68 térabits par seconde de bande passante mémoire. Selon Positron, ce grand pool de RAM permet à une seule appliance Titan d'exécuter un LLM avec 32 000 milliards de paramètres et une fenêtre contextuelle de 10 milliards de jetons.
Titan effectue des calculs d'inférence à l'aide d'une puce personnalisée appelée Asimov. Le processeur est construit autour d'un réseau systolique, un ensemble de modules informatiques identiques comprenant chacun une mémoire colocalisée. Asimov utilise sa mémoire colocalisée pour stocker les poids LLM, des valeurs numériques qui jouent un rôle important dans la génération des résultats LLM.
Le réseau systolique de la puce est pris en charge par des modules optimisés pour exécuter des fonctions d'activation. Ce sont des extraits de code qui déterminent lequel des réseaux neuronaux d'un LLM doit participer à une tâche d'inférence. De plus, Asimov comprend des cœurs d’unité centrale de traitement qui fonctionnent comme une « trappe de secours programmable ». Ils peuvent prendre en charge des tâches pour lesquelles les autres modules de la puce ne sont pas optimisés.
Chaque appareil Titan comprend jusqu'à huit puces Asimov. Les clients peuvent relier plusieurs systèmes en clusters comprenant jusqu'à 16 384 accélérateurs.
Titan et Asimov ne sont pas encore en production. Selon Positron, les données de simulation indiquent qu'un rack de serveur alimenté par son silicium peut traiter jusqu'à 26 fois plus de jetons par dollar que l'appliance Blackwell GB300 NVL72 de Nvidia Corp.
« Notre objectif est maintenant d'enregistrer Asimov, de mettre Titan en production et d'adapter la fabrication pour répondre à la demande qui nous attend », a déclaré le PDG Mitesh Agrawal. « Ce financement nous donne les ressources nécessaires pour faire exactement cela. »
Positron prévoit d'enregistrer Asimov à la fin de l'année en utilisant le nœud de trois nanomètres de Taiwan Semiconductor Manufacturing Co. La production de masse devrait emboîter le pas au second semestre 2027. Parallèlement, Positron accélérera la fabrication de ses appareils Titan. Cet effort mettra l’accent sur l’obtention des engagements d’approvisionnement en LPDDR5X de la part des partenaires.