Gimlet Labs obtient 300 millions de dollars pour sa plateforme d'inférence désagrégée

Gimlet Labs Inc., une startup qui aide les développeurs à accélérer leurs charges de travail d'inférence, a levé 300 millions de dollars de financement pour une valorisation de 3 milliards de dollars.

Un grand modèle de langage comprend plusieurs modules logiciels qui ont des exigences matérielles très différentes. Par exemple, certains modules utilisent plus que d’autres la mémoire des cartes graphiques sous-jacentes. Gimlet a développé une plateforme qui exploite ce phénomène pour accélérer l'inférence.

Le logiciel de l'entreprise peut automatiquement diviser un LLM en modules cohérents. À partir de là, il déploie chaque module sur l'architecture de puce qui correspond le mieux à ses exigences matérielles. Par exemple, Gimlet peut envoyer un composant gourmand en mémoire à un accélérateur doté d'une grande quantité de RAM intégrée.

Il existe plusieurs façons de diviser un LLM. L'approche la plus courante, la désagrégation PD, exécute les phases de pré-remplissage et de décodage du flux de travail d'inférence sur des puces distinctes. Les phases de pré-remplissage et de décodage sont des étapes de traitement au cours desquelles un LLM interprète respectivement les invites et génère une réponse.

Gimlet prend également en charge des approches de désagrégation plus granulaires.

Certains développeurs ne se contentent pas de diviser le flux de travail d'inférence en phases de pré-remplissage et de décodage. Ils vont encore plus loin en plongeant la phase de décodage dans des flux de travail plus petits qui peuvent chacun être attribués à une puce différente. Dans d'autres projets, les développeurs utilisent un modèle léger de « rédaction » pour générer des réponses rapides initiales et un LLM frontalier pour affiner ces ébauches. Chaque modèle fonctionne sur une architecture de puce distincte.

La plateforme de Gimlet réduit la quantité de travail requise pour mettre en œuvre de tels flux de travail de désagrégation. De plus, il optimise chaque module LLM pour l'architecture de puce sur laquelle il est déployé. Le logiciel optimise le code du modèle à l'aide d'une combinaison d'agents IA et d'un compilateur personnalisé.

Selon Gimlet, ses agents trouvent le meilleur moyen d'adapter le code LLM à une puce en explorant plusieurs approches de conception. Après avoir identifié une approche prometteuse, l’IA effectue des tests pour s’assurer qu’elle est correcte. Le compilateur de la société, à son tour, applique un mélange d'optimisations génériques et spécifiques aux puces aux modèles clients.

Gimlet vend son logiciel dans une édition sans serveur et sous forme de service géré que les entreprises peuvent déployer sur leur propre infrastructure. L'entreprise affirme avoir reçu des commandes de clients d'une valeur de plusieurs milliards de dollars. En mars, Gimlet a déclaré que sa clientèle comprend l'un des plus grands fournisseurs de cloud au monde et l'un des trois meilleurs laboratoires d'IA.

Le financement aidera l'entreprise à accroître la capacité de l'infrastructure de l'édition sans serveur de sa plateforme. Gimlet prévoit d'ajouter plusieurs centaines de mégawatts de puissance de calcul. De plus, la société a l’intention de se développer sur le marché du matériel personnalisé. Gimlet développe un serveur optimisé pour l'inférence qui ne comporte pas de carte mère et peut être utilisé en dehors des centres de données.

Photo de : Unsplash

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine