L'accord de série A a également attiré plus d'une demi-douzaine d'autres participants. Le groupe comprenait John Doerr, président de Kleiner Perkins, et Naveen Rao, ancien chef du groupe de produits d'intelligence artificielle d'Intel.
L’équipe fondatrice de Volantis possède également de solides références dans le secteur. La société emploie des ingénieurs qui ont travaillé auparavant chez de grands fabricants de puces tels que Nvidia Corp. et Broadcom Inc. Leurs réalisations techniques incluent la première implémentation commerciale de CoWoS, une interconnexion largement utilisée dans les unités de traitement graphique.
La vitesse à laquelle les données transitent entre les cœurs de traitement d'un GPU et la mémoire à large bande passante contribue largement aux performances du modèle d'IA. Elle est mesurée par une métrique appelée bande passante mémoire. Plus un GPU dispose de bande passante mémoire, plus il peut effectuer l'inférence rapidement.
Volantis développe une architecture de puce optimisée pour l'inférence, construite autour d'une interconnexion de mémoire personnalisée. Selon l’entreprise, la technologie fournit une bande passante mémoire plus de 30 fois supérieure aux accélérateurs actuels.
Le moyen le plus simple d'augmenter la bande passante mémoire d'un GPU consiste à ajouter davantage de modules de mémoire. Aujourd'hui, le nombre de modules de mémoire pouvant être placés sur un GPU est limité par les câbles qui les relient aux cœurs de traitement du GPU. Ces fils mesurent jusqu'à cinq millimètres de long. Les modules de mémoire doivent être placés dans la plage de cinq millimètres des fils, ce qui limite le nombre total de modules pouvant tenir sur une puce.
L'architecture de puce de Volantis comprend des fils d'interconnexion d'une portée supérieure à 200 millimètres. Selon l'entreprise, cette portée étendue permet d'équiper un accélérateur d'IA de plus de 220 chipsets mémoire. Le résultat est une augmentation significative de la bande passante mémoire.
Les interconnexions mémoire de Volantis sont basées sur une conception optique, ce qui signifie qu'elles transmettent des données sous forme de lumière. La lumière est générée par des dispositifs microscopiques appelés VCSEL. Un VCSEL comprend trois composants principaux : un puits dit quantique et deux miroirs. Le puits quantique transforme une partie de l’électricité qui traverse la puce hôte en lumière, tandis que les miroirs l’amplifient.
Les VCSEL sont plus faciles à fabriquer que les lasers que les dispositifs de réseau optique utilisent généralement pour générer du laser. Résultat : ils coûtent souvent moins cher. Un autre avantage des VCSEL est qu’ils peuvent être fabriqués à partir d’un composé appelé arséniure de gallium. Il est plus facilement disponible que les matériaux les plus couramment utilisés pour produire des lasers miniatures.
Volantis expédiera ses puces avec un appareil d'inférence de centre de données appelé A-1. Le système fait environ un tiers de la taille d’un rack de serveur standard. Selon la société, il dispose de 10 téraoctets de mémoire avec 250 térabits par seconde de bande passante mémoire. Volantis estime que le système sera capable de traiter jusqu'à 10 000 jetons par seconde lors de l'exécution d'un modèle comportant 20 000 milliards de paramètres.
« Cela permettra d'inférencer des frontières en temps réel, de redémarrer la mise à l'échelle des lois et d'activer des bases de code entières dans des fenêtres contextuelles », a écrit le co-fondateur et PDG de Volantis, Tapa Ghosh, dans un communiqué. article de blog. « Pour commencer, imaginez un agent de codage qui accomplit une tâche en 30 secondes au lieu de 30 minutes. »
Volantis prévoit de commencer à expédier son système A-1 l'année prochaine.