SpaceX lance Grok 4.7 avec un traitement à long terme et des améliorations de sécurité

SpaceX Corp. a présenté aujourd'hui Grok 4.7, son grand modèle de langage le plus performant à ce jour.

La série d'algorithmes Grok a été créée à l'origine par une startup fondée par Elon Musk appelée xAI Corp. Musk a fusionné la société avec xAI Inc. l'année dernière. L'organisation combinée a ensuite été intégrée à SpaceX, qui gagné non seulement la série de modèles Grok, mais également plusieurs centres de données d'intelligence artificielle.

La société a évalué Grok 4.7 à l'aide d'un benchmark appelé CursorBench 4.0. Il a été développé par Cursor, une autre acquisition récente de SpaceX. Grok 4.7 a relevé les défis du benchmark pour un coût moyen de 4,69 $ par tâche, ce qui le place devant GPT-5.6 Sol et Fable 5.1. SpaceX a évalué les versions à forte intensité matérielle de ces derniers modèles qui privilégient la qualité de sortie plutôt que la rentabilité.

La société a également testé Grok 4.7 à l’aide de références plus largement utilisées. Le modèle a largement surpassé Fable 5.1 sur Harvey Legal Agent Benchmark et EEBench, qui contiennent respectivement des tâches juridiques et de conception de puces. Cependant, le score de Grok 4,7 sur ce dernier benchmark est inférieur à GPT-6 Astra, le dernier LLM d'OpenAI Group PBC.

SpaceX attribue les performances de Grok 4.7 à un nouveau modèle de base. Les cycles de formation LLM comprennent plusieurs phases qui améliorent chacune un aspect différent de l'algorithme en cours de développement. Un modèle de base est la version initiale d'un LLM qui émerge après la première phase d'une formation. Les fournisseurs d'IA réutilisent souvent les modèles de base dans les versions LLM.

Selon SpaceX, ses ingénieurs ont également amélioré le flux de travail d'apprentissage par renforcement de Grok 4.7. L'apprentissage par renforcement est une méthode de formation de l'IA utilisée pour améliorer les capacités de raisonnement des modèles de base. Par rapport à son prédécesseur, Grok 4.7 a reçu des tâches de formation plus difficiles et y a travaillé plus longtemps.

L'entreprise a construit le LLM pour qu'il soit compatible avec son harnais Grok Bot. Il s'agit d'un ensemble de ressources techniques qui permettent à Grok 4.7 de répartir un travail complexe entre plusieurs agents d'IA. Ces agents peuvent effectuer plusieurs tâches différentes en parallèle, ce qui accélère le traitement et vérifie l'exactitude des résultats de chacun.

SpaceX a également équipé Grok 4.7 de nouvelles garanties. La société affirme que le modèle a établi des records sur LatchBio et HackerBench, des références qui testent respectivement la capacité des LLM à bloquer les recherches malveillantes en biologie et les demandes de cybersécurité.

Grok 4.7 est disponible à partir de 2 $ par million de jetons d'entrée et de 6 $ par million de jetons de sortie. Pour les charges de travail sensibles à la latence, SpaceX propose une version du modèle qui traite les invites deux fois plus rapidement et coûte deux fois plus cher.

Le modèle est lancé moins d'une semaine après la version précédente du modèle SpaceX. Vendredi, l'entreprise introduit un modèle de synthèse vocale qui offre le double de la précision de son prédécesseur et coûte deux fois moins cher. SpaceX affirme que Grok Voice Transcribe 2.0 surpasse également plusieurs de ses concurrents dans la catégorie synthèse vocale.

Photo de : Unsplash

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine