La société de logiciels d'intelligence artificielle d'entreprise Iterate Studio Inc. a lancé aujourd'hui Lifeboat, un moteur d'inférence pour les grands modèles de langage intégrant une informatique confidentielle.
Iterate.ai indique que le logiciel intègre deux à six fois plus de sessions d'agent IA simultanées sur chaque unité de traitement graphique.
Lifeboat cherche à résoudre un problème de mémoire créé par les agents à grande échelle. Une question de chatbot déclenche généralement un appel de modèle. Un agent travaillant sur une seule tâche peut en créer des dizaines, et sa fenêtre contextuelle s'agrandit avec chacune d'elles, de sorte que des centaines d'agents sur du matériel partagé remplissent rapidement le cache clé-valeur. Iterate.ai indique que les moteurs d'inférence standard peuvent bloquer quatre ou cinq requêtes à contexte long exécutées simultanément.
Les équipes qui atteignent cette limite ont tendance à acheter plus de GPU ou à déplacer le travail vers des services cloud par jeton et à transmettre leurs données à un tiers. Brian Sathianathan, co-fondateur et directeur de la technologie d'Iterate.ai, a déclaré que les banques, les assureurs et les systèmes de santé souhaitent gérer leurs agents sur leurs propres données « à l'intérieur de leurs propres murs » sans doubler les dépenses en GPU.
L'approche de Lifeboat commence par une planification et un contrôle d'admission équitables, qui donnent à chaque session sa part du GPU afin qu'un agent de traitement de documents lourd ne puisse pas évincer les agents interactifs. Les optimisations du cache clé-valeur doublent sa capacité effective tandis que les pondérations des modèles restent avec une précision totale, selon l'entreprise.
Sur les modèles mixtes, seuls les experts dont un agent donné a besoin sont chargés. Chaque session s'exécute également dans sa propre capsule de sécurité avec filtrage, budgets de jetons et exécution en bac à sable.
Les propres tests d'Iterate.ai ont utilisé un seul GPU Nvidia Corp. RTX PRO 6000 Blackwell exécutant un modèle Qwen 30B-A3B, et Lifeboat a organisé 2 048 sessions simultanées avec chaque demande terminée. Le même moteur, avec les optimisations de Lifeboat désactivées, dépassait la moitié de ce nombre et gérait 4 965 jetons par seconde contre 8 714 avec eux activés. L'écart le plus important est apparu lors d'une exécution de 128 sessions de pression mémoire envoyant des requêtes de 18 000 jetons, au cours desquelles Lifeboat a maintenu le temps du 99e centile jusqu'au premier jeton à 1,5 seconde. La ligne de base en avait besoin de 189.
« Avant qu'une entreprise n'achète davantage de GPU pour ses agents, elle devrait découvrir ce que ceux qu'elle possède déjà peuvent faire », a déclaré Jon Nordmark, co-fondateur et directeur général d'Iterate.ai. « Un centre de données ou un néo-cloud qui double les sessions simultanées par carte récupère cette capacité sans ajouter de racks ni d'alimentation. »
L'édition Confidential Computing de premier plan de Lifeboat ne répondra pas à une demande tant que l'attestation matérielle n'aura pas été transmise. Cette vérification couvre les fonctionnalités d'exécution fiables des processeurs Advanced Micro Devices Inc. et Intel Corp., ainsi que le mode informatique confidentiel de Nvidia sur les H100, B200, GB300 et autres GPU pris en charge. Les pondérations des modèles sont scellées dans l'environnement d'exécution fiable et restent chiffrées lors de leur utilisation, que le moteur se trouve dans une machine virtuelle confidentielle dans le cloud ou sur du matériel appartenant au client.
L'accès anticipé à Lifeboat a généré des milliers de téléchargements en quelques jours, a indiqué la société, et le moteur est désormais généralement disponible. Une licence de développeur gratuite couvre une utilisation non commerciale et d'évaluation sur jusqu'à deux serveurs d'inférence sur un seul nœud. Les clients qui souhaitent une assistance professionnelle peuvent passer à la licence standard à 49,99 $ par mois. Les fonctionnalités d'attestation se trouvent dans l'édition Confidential Computing, qui coûte 499,99 $ par mois et, comme le niveau Standard, peut être essayée gratuitement pendant sept jours sans carte de crédit.
Nordmark et Sathianathan ont discuté de la plateforme Generate de la société et de son partenariat avec NetApp Inc. sur theCUBE, le studio de diffusion en direct de SiliconANGLE Media, lors de la conférence Insight de NetApp la semaine dernière :