La société de recherche en intelligence artificielle Allen Institute for AI, basée à Seattle, a annoncé jeudi un cadre de développement pour les grands modèles de langage qui améliore considérablement la façon dont les grands modèles de langage composés d'experts sont formés.
Le nouveau cadre, Olmo-core 3, permet à la formation MoE d'atteindre l'échelle d'un billion de paramètres tout en maintenant les coûts à un faible niveau en préservant l'efficacité informatique.
Les modèles mixtes d'experts fonctionnent différemment des modèles d'IA denses : ils répartissent le calcul entre des parties spécialisées du modèle à chaque fois qu'un jeton est généré, tandis que les modèles denses activent l'intégralité du modèle. Un modèle MoE peut contenir beaucoup plus de paramètres totaux, les cadrans individuels qui ajustent le comportement du modèle, mais il ne calcule qu'avec un petit nombre d'entre eux lorsqu'il génère chaque partie d'une réponse.
De manière équivalente, entraîner un modèle MoE permet d’en activer uniquement des parties tout en apprenant chaque jeton, un petit morceau de texte – souvent un mot ou une partie de mot – qu’une IA lit et génère. Cela réduit le calcul global ; cependant, le modèle complet doit toujours être stocké dans la mémoire de l'unité de traitement graphique et la coordination de la mise en réseau entre experts pendant la formation génère toujours des coûts supplémentaires.
Ai2 a déclaré qu'Olmo-core 3 a été conçu pour combler le fossé entre les modèles denses et les modèles MoE, permettant au pool d'experts de passer de huit à 128 tout en ne sélectionnant que quatre experts par jeton. En utilisant la même infrastructure, les LLM peuvent s’adapter à plus de mille milliards de paramètres.
Analyse comparative de la prochaine génération de formations efficaces du MoE
Dans les benchmarks, la société a déclaré qu'Olmo-core 3 traitait 52 000 jetons par seconde sur les GPU Nvidia B3000 pour un modèle de 47 milliards de paramètres. Par rapport à l'architecture de formation Megatron-core de Nvidia Corp., une option établie pour la formation des grands MoE, qui dépassait environ 19 400 jetons par seconde, cela représentait un bond d'environ 2,7 fois le débit.
Dans un livre blanc publié sur le projet, Ai2 a noté que la nouvelle architecture utilise le parallélisme expert pour répartir les experts sur plusieurs GPU, permettant à chaque carte de stocker seulement une partie du pool d'experts complet. Il divise également les couches du modèle, qui sont les étapes successives qui génèrent des entrées, entre des groupes de GPU afin de réduire la quantité de modèle que chaque GPU doit conserver en mémoire. Enfin, un optimiseur distribué répartit l'état de l'optimiseur, c'est-à-dire les données supplémentaires utilisées pour calculer et appliquer les mises à jour pendant l'entraînement, sur plusieurs GPU au lieu de stocker des copies complètes sur chaque GPU.
Dans l'ensemble, cela réduit la surcharge de mémoire à mesure que les modèles évoluent, car l'intégralité du modèle et son état d'entraînement n'ont pas besoin d'être stockés en mémoire en même temps.
De plus, Ai2 prend en charge MXFP8, un format numérique pour les LLM qui représente certaines valeurs avec moins de bits. Cela peut réduire le calcul et la quantité de données déplacées entre les GPU.
La nouvelle architecture de formation, et sa plus grande efficacité, fait partie de la vision de l'entreprise visant à donner aux chercheurs les outils nécessaires pour construire et former des modèles plus grands. Les modèles d’IA comportant des milliards de paramètres sont souvent hors de portée de ceux qui n’ont pas accès aux infrastructures de l’État et des entreprises. Ai2 a ajouté qu'Olmo-core 3 permettrait également aux chercheurs d'adapter la formation MoE à différents matériels, d'expérimenter le routage, le parallélisme et d'autres parties du système pour créer un nouvel écosystème.
Le projet et les systèmes associés sont actuellement disponibles pour les développeurs et la communauté open source sur GitHub.