Lightbits s'apprête à publier le moteur de cache KV pour améliorer les performances du GPU

Lightbits Labs Ltd. a annoncé aujourd'hui la disponibilité générale d'Inferra, un moteur logiciel conçu pour améliorer l'économie et les performances de l'inférence de l'intelligence artificielle en déplaçant les données du cache clé-valeur au-delà de la mémoire limitée à bande passante élevée attachée aux unités de traitement graphique.

La société, mieux connue comme l'inventeur du protocole de stockage NVMe sur TCP, positionne Inferra pour les fournisseurs de néocloud et les entreprises exécutant de grands modèles de langage avec de longues fenêtres de contexte ou de nombreuses sessions simultanées. Annoncé en mars, le produit gère le cache KV sur la mémoire GPU à large bande passante, la mémoire vive dynamique et le stockage Non-Volatile Memory Express, en utilisant la prélecture prédictive pour placer les données à proximité du GPU avant qu'elles ne soient nécessaires.

Les caches KV contiennent les données d'attention intermédiaires générées par un modèle lors du traitement d'une invite. Leur taille augmente avec la longueur d’une conversation ou d’un document, consommant ainsi la rare mémoire du GPU. Lorsque les données de cache requises ne sont pas disponibles, un système doit les récupérer dans une mémoire plus lente ou les recalculer, laissant les ressources GPU inactives et augmentant les temps de réponse.

« Les données sont toujours disponibles sur lesquelles le calcul peut fonctionner », a déclaré Ramesh Chettuvetty, vice-président senior des produits et des activités pour les solutions d'IA chez Lightbits. « Nous effectuons une prélecture prédictive, ce qui empêche essentiellement ce blocage. »

Lightbits affirme qu'Inferra peut réduire le temps d'obtention du premier jeton de plus de 100 fois dans certaines charges de travail à contexte long, prendre en charge des fenêtres contextuelles de plus de 10 millions de jetons sur du matériel standard et augmenter la densité des sessions simultanées de plus de 16 fois. Ces chiffres proviennent de références et d’extrapolations d’entreprises et n’ont pas été vérifiés de manière indépendante.

Chettuvetty a déclaré que Lightbits recherche des signaux dans toute la pile d'inférence pour prédire les données dont le GPU aura besoin. Il a déclaré que la société avait atteint des taux de réussite du cache de près de 99,9 % dans la plupart des scénarios testés. Inferra inclut également des contrôles de qualité de service, le chiffrement et l'isolation entre les locataires, ainsi que la possibilité de déplacer les données mises en cache lorsqu'une session migre vers un autre cluster GPU.

Inspiré du processeur

Arthur Rasmusson, directeur de l'architecture IA chez Lightbits, a comparé l'approche des techniques de processeur développées alors que la vitesse du processeur commençait à dépasser les performances de la mémoire. « Nous faisons quelque chose qui s'inspire de cela », a-t-il déclaré. « Les algorithmes sont évidemment différents lorsqu'il s'agit d'inférence LLM. »

L'approche vise à résoudre deux problèmes liés : la capacité et la vitesse de récupération. Au lieu de charger un contexte entier dans la mémoire du GPU, Inferra le divise en blocs plus petits et fournit au GPU ce dont il a besoin juste à temps. Cela permet aux opérateurs de conserver des caches plus importants et d'accueillir davantage d'utilisateurs sur la même infrastructure.

« Ce que nous fournissons est en quelque sorte une bibliothèque plus grande dans le sens où nous avons plus de capacité de stockage à long terme, mais aussi de récupération rapide », a déclaré Rasmusson.

Les avantages les plus importants devraient venir de la génération augmentée par récupération, des agents IA, des invites longues et des services GPU fortement partagés. Rasmusson a reconnu que la valeur serait plus limitée pour les organisations disposant de clusters GPU privés surdimensionnés, d'un petit nombre d'utilisateurs et de contextes qui tiennent déjà dans la mémoire disponible.

La désagrégation du cache du GPU introduit sa propre latence. Chettuvetty a déclaré qu'Inferra résout ce retard en prévoyant la demande suffisamment à l'avance pour pouvoir stocker les données avant que le GPU ne les demande. Des réseaux et un stockage plus rapides peuvent réduire la fenêtre de prévision requise et réduire le risque d'une prévision incorrecte.

Lightbits a déclaré avoir des pilotes de production en cours et cibler initialement les fournisseurs de néocloud, dont le besoin d'augmenter l'utilisation et les marges les rend plus rapides à adopter que les hyperscalers. La société présentera Inferra au AI Infra Summit à Santa Clara la semaine prochaine.

Photo de : Unsplash

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine