Reflection AI lance le modèle Beam open source avec les paramètres 501B

Reflection AI Inc. aujourd'hui introduit Beam, un grand modèle de langage open source avec 501 milliards de paramètres.

Le lancement intervient quelques mois après que la startup a levé des fonds pour une valorisation de 25 milliards de dollars. À peu près au même moment, Reflection AI aurait a signé un accord de 6,3 milliards de dollars avec SpaceX Corp. pour louer des appareils Nvidia GB300 NVL72. Il a utilisé ces systèmes, qui contiennent chacun 72 cartes graphiques, pour entraîner Beam.

Reflection AI a comparé son modèle à GLM-5.2, un LLM open source qui comprend environ 250 milliards de paramètres supplémentaires. La société a déterminé que Beam peut mieux effectuer certaines tâches en utilisant entre un tiers et un quart du matériel. En outre, il indique que le LLM se rapproche des performances du Qwen 3.8-Max, un modèle avec plus de 2 000 milliards de paramètres.

Ce lancement est particulièrement remarquable car bon nombre des LLM les plus avancés de l'écosystème open source ont été créés par des entreprises chinoises. Cela inclut Qwen 3.8-Max et GLM-5.2. Beam est le premier modèle open source d'une startup américaine à avoir démontré des performances comparables, voire supérieures. Cependant, les LLM gratuits continuent d'être à la traîne des modèles pionniers tels que Claude Fable 5.1 d'Anthropic PBC.

Reflection AI a lancé le développement de Beam en entraînant un modèle prototype relativement petit. Il a ensuite créé une série d’algorithmes de plus en plus grands et plus performants. Le flux de travail a finalement produit Beam Base, la fondation sur laquelle Beam est basé.

La société a développé Beam Base en utilisant un cluster de 6 144 cartes graphiques. Il a formé le modèle sur 23 800 milliards de jetons provenant du Web public et de sources commerciales. Cet ensemble de données comprenait une quantité importante de code logiciel. Il a créé des filtres personnalisés pour chaque langage de programmation afin de supprimer les fichiers de mauvaise qualité.

Beam Base a été développé en moins de quatre semaines. Il a ensuite effectué un entraînement intermédiaire, un processus d'optimisation qui a étendu la fenêtre contextuelle du modèle et amélioré ses capacités de raisonnement. Cette phase du projet a ouvert la voie à la troisième phase, la plus gourmande en matériel, du flux de travail de formation.

Reflection AI a fait tourner 10 000 cartes graphiques GB300 et les a utilisées pour lancer 1,3 milliard de bacs à sable d'apprentissage par renforcement. Ce sont des environnements virtuels dans lesquels un modèle d’IA acquiert de nouvelles compétences. Les bacs à sable de Beam ont été optimisés pour des tâches telles que la génération de code, la recherche sur le Web et l'exécution d'agents IA.

L'entreprise affirme que la phase d'apprentissage par renforcement du projet n'a duré que quatre semaines. Elle a évité les retards inutiles en développant un logiciel qui a empêché les dysfonctionnements d'interrompre le flux de travail. Il affirme que son cluster a atteint un temps de récupération médian de huit minutes sur les 71 erreurs survenues pendant la formation.

Beam est initialement disponible via un programme d’accès anticipé. Reflection AI prévoit de publier ses outils de pondération, de documentation et de réglage plus tard ce mois-ci.

Photo des fondateurs de Reflection AI, Misha Laskin et Ioannis Antonoglou : Vitesse de la lumière

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine