DeepSeek lance un modèle de langage multimodal compétitif avec Opus 4.8

DeepSeek a lancé aujourd'hui un nouvel ajout à sa série phare V4 de grands modèles de langage.

Au lancement, V4 Flash Vision Exp n'est disponible que via la plateforme de développement payante de la startup chinoise. La société pourrait publier une version gratuite plus tard, étant donné qu'elle a ouvert plusieurs de ses modèles précédents. Ces modèles incluent V4 Flash, un algorithme publié en avril qui constitue la base de V4 Flash Vision Exp.

DeepSeek a comparé les deux LLM sur sept tests contenant des défis basés sur du texte. V4 Flash Vision Exp a surpassé son prédécesseur dans tous les tests, à l'exception d'un seul. Le benchmark en question, Cybergym, évalue la capacité des LLM à découvrir les vulnérabilités logicielles.

Le domaine dans lequel V4 Flash Vision Exp apporte la plus grande amélioration des performances est l’analyse d’images. DeepSeek a testé la capacité du modèle à traiter le contenu visuel à l'aide de quatre critères différents. Il a obtenu des résultats supérieurs de plus de 10 % à deux des tests.

Notamment, V4 Flash Vision Exp a également battu l'Opus 4.8 d'Anthropic PBCC sur deux benchmarks visuels appelés ALE et ZeroBench. La première évaluation contient plus de 1 000 tâches en plusieurs étapes qui nécessitent que les LLM interagissent avec les applications, écrivent du code et interprètent des fichiers multimédias. ZeroBench, à son tour, contient 100 tâches d'analyse d'images conçues pour être très difficiles pour les LLM frontières.

DeepSeek n'a partagé aucune information sur l'architecture de V4 Flash Vision Exp. Cependant, la page Hugging Face de la société contient un aperçu détaillé du modèle Flash V4 dont est dérivé le LLM.

V4 Flash est un mélange de modèles experts avec 284 milliards de paramètres. Il comprend plusieurs réseaux de neurones contenant chacun 13 milliards de paramètres. Lorsqu'un utilisateur saisit une invite, le LLM active uniquement le réseau neuronal le mieux adapté pour générer une réponse. Cette approche utilise beaucoup moins de matériel que l’activation de l’intégralité du LLM.

Les modèles de langage conservent les informations qu'ils utilisent pour répondre aux invites dans une structure de données appelée cache KV. V4 Flash utilise deux techniques appelées HCA et CSA pour compresser le cache KV. Selon DeepMind, les technologies réduisent de 73 % la quantité de puissance de calcul nécessaire pour traiter les invites avec 1 million de jetons.

DeepSeek a entraîné V4 Flash sur 32 000 milliards de jetons de données d'entraînement. L'entreprise a utilisé un algorithme appelé Muon pour accélérer le flux de travail de formation. Muon réduit le temps nécessaire pour calibrer les couches cachées d'un LLM, les composants qui effectuent l'essentiel du traitement impliqué dans la réponse aux invites.

V4 Flash est l'un des deux LLM publiés par DeepSeek en avril. L'autre modèle s'appelle V4 Pro et comporte plus de cinq fois plus de paramètres. Étant donné que V4 Flash Vision Exp est dérivé de V4 Flash, il est possible que V4 Pro constitue à terme également la base de modèles spécialisés optimisés pour des tâches telles que l'analyse d'images.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine