SpaceXAI lance le modèle phare Grok 4.6 avec des capacités de raisonnement avancées

SpaceXAI a publié aujourd'hui Grok 4.6, un grand modèle de langage qui, selon lui, peut surpasser Claude Fable 5 d'Anthropic PBC dans certains domaines.

SpaceXAI était connu sous le nom de xAI jusqu'au mois dernier. Le fournisseur d'intelligence artificielle fondé par Elon Musk a changé de nom dans le cadre de son acquisition par SpaceX Corp. En juin, la société issue du regroupement a coté ses actions au Nasdaq via la plus grande offre publique initiale jamais enregistrée.

Grok 4.6 est déployé seulement un mois après que SpaceXAI a publié son précédent LLM phare. Selon l'entreprise, l'une des principales améliorations réside dans le fait que ses ingénieurs ont passé plus de temps à former l'ancien modèle. La formation étendue a utilisé un ensemble de données généré par l'IA conçu pour améliorer les capacités de raisonnement de Grok 4.6. SpaceXAI a également fourni au modèle un accès à des « données d'ingénierie de haute qualité ».

La formation initiale a été suivie de deux étapes de développement supplémentaires. Le premier utilisait une méthode de formation appelée réglage fin supervisé, ou SFT, tandis que le second utilisait l'apprentissage par renforcement.

Une formation SFT affine le résultat d'un LLM à l'aide d'un ensemble d'exemples d'invites et de réponses pré-emballées. Les ingénieurs utilisent principalement cette technique pour garantir que les réponses aux invites LLM sont affichées dans un format convivial. SpaceXAI a utilisé Grok 4.5, le prédécesseur de Grok 4.6, pour optimiser la phase de formation SFT de ce dernier modèle. Le flux de travail d'optimisation s'est concentré sur l'amélioration de sa capacité à aborder les tâches scientifiques et de programmation.

SpaceXAI a évalué Grok 4.6 à l’aide de l’index d’intelligence d’analyse artificielle. Il s'agit d'un ensemble de données qui combine neuf références populaires en matière d'IA couvrant des domaines tels que la science, le codage et les services financiers. Grok 4.6 a obtenu un score de 61, ce qui le place à égalité avec le modèle phare GPT-5.6 Sol d'OpenAI Group PBC et à un point derrière Claude Fable 5.

La société a également comparé les modèles à neuf autres critères de référence. Grok 4.5 a réussi à surpasser Claude Fable 5 en trois. L'un des critères de référence, AA-Briefcase, évalue la capacité des LLM à réaliser des projets de travail axé sur les connaissances qui prendraient des semaines à un être humain. Les deux autres évaluations portaient sur des tâches couvrant plus d'une demi-douzaine d'industries.

Grok 4.5 est particulièrement apte à générer des prototypes logiciels basés sur des descriptions de haut niveau, selon SpaceXAI. De plus, il est meilleur que son prédécesseur pour créer des éléments visuels tels que des interfaces. Le modèle est également plus susceptible de vérifier son travail pour détecter les erreurs lorsqu'il travaille sur des projets à long terme.

La version standard de Grok 4.6 coûte 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie. SpaceXAI propose également une édition plus rapide qui coûte deux fois plus cher. Le LLM est disponible via Cursor, la plateforme de codage d'ambiance que la société a achetée pour 60 milliards de dollars en juin, et un outil de programmation développé en interne appelé Grok Build.

Photo de : Unsplash

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine