Modèle open source 'Ox Alpha' de Z.ai sous le nom de GLM-5.3-Flash

Z.ai Co. a publié aujourd'hui le code de GLM-5.3-Flash, un grand modèle de langage 10 fois plus rentable que son prédécesseur.

L’algorithme a fait ses débuts la semaine dernière sous le nom de code Ox Alpha. L'opérateur du marché LLM, OpenRouter Inc., a lancé une version hébergée gratuite d'Ox Alpha et n'a pas divulgué son développeur, qui dessiné une attention considérable de l'industrie. Les utilisateurs ont rapidement commencé à spéculer sur le fait que Z.ai était le créateur du modèle.

GLM-5.3-Flash présente un mélange d'architecture experte avec 320 milliards de paramètres. Il active 18 milliards de paramètres pour répondre aux invites. Les requêtes des utilisateurs peuvent inclure jusqu'à 1 million de jetons de texte, d'images et de vidéo, tandis que les réponses de GLM-5.3-Flash contiennent jusqu'à 131 072 jetons.

Le modèle présente une architecture différente de celle des précédents LLM de Z.ai. L'un des changements les plus importants concerne son mécanisme d'attention, un composant qui analyse les invites des utilisateurs et en extrait les détails les plus importants. Il identifie ces détails clés en décomposant chaque invite en jetons et en les comparant les uns aux autres.

L’analyse de chaque jeton dans une longue invite nécessite une quantité importante de puissance de traitement. GLM-5.3-Flash réduit cette surcharge matérielle grâce à une technique appelée attention éparse. Au lieu d'analyser chaque jeton dans une invite pour trouver des détails importants, le modèle examine uniquement les jetons les plus pertinents.

Z.ai a encore réduit l'empreinte matérielle du LLM en utilisant une méthode appelée attention linéaire. Habituellement, doubler la taille d’une invite quadruple la quantité de mémoire consommée par le mécanisme d’attention d’un modèle. Lorsque l’attention linéaire est activée, l’utilisation de la RAM ne fait que doubler.

L’une des principales raisons pour lesquelles les mécanismes d’attention sont si gourmands en mémoire est qu’ils utilisent un algorithme appelé fonction softmax pour interpréter les invites. Il transforme les valeurs numériques générées par le LLM hôte en probabilités. Attention linéaire, la technologie Z.ai implémentée dans GLM-5.3-Flash, remplace la fonction softmax par un algorithme plus efficace.

La société affirme que le modèle coûte 10 fois moins cher à utiliser que son LLM de génération précédente. En outre, il a démontré de solides performances sur un ensemble de références populaires en matière d’intelligence artificielle.

Z.ai a comparé GLM-5.3-Flash à Claude Opus 4.8, GPT-5.6 Terra et Gemini 3.7 Flash. Le premier modèle a obtenu le score le plus élevé sur GDPval-AA v2, une évaluation qui mesure la capacité des LLM à effectuer un travail de connaissances. GLM-5.3-Flash s'est également classé deuxième sur un benchmark appelé AutomationBench. Il s'agit d'un test qui évalue la capacité des LLM à effectuer des tâches dans des applications cloud.

Z.ai a entraîné GLM-5.3-Flash sur un ensemble de données contenant 30 000 milliards de jetons. Il a utilisé une technologie appelée mHC pour optimiser le flux de travail.

Lorsqu'un LLM termine une tâche de formation, il reçoit une donnée appelée gradient. Les données voyagent à travers les couches de neurones artificiels du modèle et les reconfigurent pour améliorer leurs performances. Le dégradé se déforme parfois en cours de route, ce qui diminue son efficacité. La technologie mHC mise en œuvre par Z.ai dans GLM-5.3-Flash réduit le risque de tels problèmes techniques.

Les poids du GLM-5.3-Flash sont disponibles sur Visage câlin.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine