Quelques semaines après avoir clôturé un tour de table de 300 millions de dollars soutenu par Nvidia Corp., Etched Inc. a annoncé aujourd'hui avoir levé 700 millions de dollars supplémentaires.
Etched a été lancé en 2021 dans le but de concevoir des puces optimisées pour des modèles d'intelligence artificielle spécifiques. L’entreprise s’est ensuite tournée vers la création d’accélérateurs d’inférence prenant en charge diverses architectures de modèles. Selon Etched, son premier prototype de puce est sorti d'une chaîne de production de Taiwan Semiconductor Manufacturing Co. plus tôt cette année. La société a recruté Jane Street, l'investisseur principal du cycle d'aujourd'hui, comme premier client peu de temps après.
La société d'investissement a installé un rack alimenté par Etched dans son centre de données le mois dernier. Par ailleurs, la startup de puces a construit un cluster d’IA de deux mégawatts dans son siège social de San Jose, en Californie. Les clients potentiels utilisent le cluster pour tester ses puces.
Les performances d'un accélérateur d'IA sont influencées par la quantité de chaleur qu'il génère. Plus sa température de fonctionnement est basse lors de l'exécution de charges de travail exigeantes, plus il peut effectuer de calculs par seconde. L’un des moyens les plus efficaces d’abaisser la température de fonctionnement d’une puce consiste à diminuer la tension qui la traverse.
Etched indique que les blocs mathématiques de sa puce, ou circuits optimisés pour les mathématiques, fonctionnent à moins de la moitié de la tension de la plupart des accélérateurs d'IA. En conséquence, le processeur peut fournir « plusieurs fois la densité de FLOP » offerte par ses concurrents. La densité des FLOP est une mesure des performances d'un processeur.
Etched n'a pas révélé comment fonctionnent ses blocs mathématiques optimisés en tension. Les grands modèles de langage effectuent deux types principaux d'opérations mathématiques lors de l'inférence : les calculs de produits scalaires et les multiplications matricielles. Les blocs mathématiques sont probablement optimisés pour ces tâches.
Un calcul de produit scalaire transforme deux rangées de nombres en un seul nombre. De telles opérations alimentent le mécanisme d’attention de l’architecture du transformateur. Les multiplications matricielles, quant à elles, impliquent des structures mathématiques qui peuvent être visualisées sous forme de feuilles de calcul remplies de nombres. Ils sont utilisés non seulement par les mécanismes d'attention LLM, mais également par d'autres composants du modèle.
Etched expédie son silicium dans le cadre de racks conçus sur mesure. L'un des principaux arguments de vente de la conception est une interconnexion développée en interne qui relie les puces de chaque appareil. Selon le Wall Street Journal, l'interconnexion peut accomplir certaines tâches de communication qui prennent 4 000 millisecondes aux puces concurrentes en 700 millisecondes. Une milliseconde équivaut à un milliardième de seconde.
Les appareils Etched contiennent également d'autres composants développés en interne. Il existe des plaques froides personnalisées, qui conduisent la chaleur générée par les puces de l'entreprise vers le liquide de refroidissement circulant dans les systèmes hôtes. Un VRM propriétaire, ou module régulateur de tension, optimise le flux d’électricité dans les appareils.
« Il nous a fallu trois ans pour livrer notre premier rack à partir de zéro », a déclaré Gavin Uberti, co-fondateur et PDG d'Etched. « Notre prochain sera beaucoup plus rapide. »