Le développeur chinois d'intelligence artificielle Z.ai Co. aujourd'hui a fait ses débuts GLM-5.3, un grand modèle de langage open source qui a établi des records sur plusieurs benchmarks populaires.
Le LLM est basé sur un algorithme appelé GLM-5.2 que la société a publié à la mi-juillet. Ce dernier modèle présente un mélange d'architecture experte avec 753 milliards de paramètres et une fenêtre contextuelle de 1 million de jetons. GLM-5.3 a une conception identique, mais a subi un processus post-formation plus approfondi.
Z.ai affirme que ses optimisations de formation ont apporté des améliorations significatives des performances. GLM-5.3 a obtenu le score le plus élevé de tous les modèles d'IA open source sur Terminal Bench 3.0, qui mesure les capacités de script en ligne de commande des LLM. Il a fonctionné 50 % mieux que GLM-5.2 sur un benchmark interne Z.ai pour évaluer les agents de codage.
Notamment, le modèle est également très adepte de la recherche sur la cybersécurité. Il a surperformé Claude Mythos 5 sur CyberGym, un benchmark qui évalue la capacité des LLM à trouver des vulnérabilités de code. GLM-5.3 est à la traîne du LLM phare d'Anthropic sur deux autres critères de cybersécurité.
Z.ai indique que le modèle a jusqu'à présent trouvé plus de 2 400 vulnérabilités dans 269 projets logiciels. Environ la moitié des failles ont un indice de gravité moyen ou supérieur. Selon la société, l’une des vulnérabilités découvertes par GLM-5.3 se trouve dans un morceau de code écrit il y a 40 ans.
Le processus post-formation par lequel Z.ai a affiné les capacités de codage du modèle impliquait des bacs à sable conçus pour imiter les postes de travail des développeurs. L'entreprise a installé GLM-5.3 dans les bacs à sable et lui a demandé d'effectuer des tâches de codage complexes. Certains exercices ont duré plusieurs jours, ce qui a amélioré la capacité du modèle à s'attaquer à des tâches à long terme.
Z.ai a généré les bacs à sable à l'aide d'agents d'IA spécialisés. Selon l'entreprise, les agents ont modélisé les environnements qu'ils ont générés sur des projets logiciels réels. Ils ont ensuite créé des exercices de programmation personnalisés pour chaque bac à sable. Un « agent juge » distinct a vérifié que les défis pouvaient être résolus avant qu’ils ne soient confiés au GLM-5.3.
Selon Z.ai, ses ingénieurs ont également automatisé certains autres aspects du flux de travail de formation. L'entreprise a construit des pipelines capables de générer un signal de récompense, un élément de données qui guide le processus d'apprentissage LLM. Il fournit des commentaires qui aident le modèle en cours de formation à identifier les moyens d'affiner sa sortie.
Z.ai a construit sa pile de formation sur deux technologies open source appelées slime et SAO. Le premier outil facilite le déplacement d'un LLM de son environnement de formation vers l'infrastructure d'inférence de production. SAO, à son tour, est une implémentation d’une méthode d’IA appelée apprentissage par renforcement asynchrone qui accélère les entraînements.
GLM-5.3 est actuellement disponible via le service d'abonnement au plan de codage GLM de Z.ai. La société prévoit de publier les poids du modèle sur Hugging Face sous une licence open source d'ici deux semaines.