DeepSeek lance la V4.1-Flash et affirme qu'elle surpasse le produit phare V4-Pro

La startup chinoise d'intelligence artificielle Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co. Ltd. a publié aujourd'hui DeepSeek-V4.1-Flash, le plus petit modèle d'une nouvelle famille d'architecture.

La société a déclaré que les tests effectués par plusieurs parties ont placé le modèle ouvert devant son DeepSeek-V4-Pro beaucoup plus grand en termes de performances, de coût, de vitesse et de durée d'exécution totale.

À partir du 14 septembre, les demandes envoyées au V4-Pro via l'interface de programmation d'applications de DeepSeek seront répondues par le V4.1-Flash et facturées aux tarifs du modèle plus petit jusqu'au lancement d'une version V4.1-Pro. V4-Flash et le modèle de vision expérimental DeepSeek expédié en août sont tous deux retirés. Les appels vers l’un ou l’autre atterrissent désormais sur la V4.1-Flash.

V4.1-Flash est un modèle mixte d'experts avec 552 milliards de paramètres, soit près du double des 284 milliards du V4-Flash. Une nouvelle conception de codeur-décodeur causal ne maintient actifs que 8 milliards de paramètres pendant que le modèle traite une invite et 16 milliards pendant qu'il génère une sortie. La compréhension des images, proposée uniquement dans cette version expérimentale du mois dernier, est désormais intégrée au modèle lui-même.

Une grande partie de l’ingénierie a consisté à réduire le cache clé-valeur. Selon le rapport technique de DeepSeek, le modèle stocke ces entrées dans un format à virgule flottante de quatre bits, et son empreinte globale s'élève à 890 octets par jeton, soit environ un quart de ce dont V4-Flash a besoin. Le stockage de cache persistant sur les SSD tombe à environ un huitième de celui de la génération précédente.

Le propre tableau de référence de DeepSeek compare le modèle avec un effort de raisonnement maximal à Claude Opus 5 d'Anthropic PBC et GPT-5.6 Sol d'OpenAI Group PBC. V4.1-Flash a obtenu un score de 90,6 sur Terminal-Bench 2.1, de peu devant Opus 5 à 89,1 et GPT-5.6 Sol à 88,8. Lors du test d'ingénierie logicielle DeepSWE v1.1, il a résolu 74,2 % des tâches, contre 74 % pour Opus 5 et 62,7 % pour V4-Pro. Les deux modèles américains sont toujours en tête du benchmark de raisonnement scientifique GPQA Diamond.

Le prix de l'API hors pointe est de 15 cents par million de jetons d'entrée non mis en cache et de 60 cents par million de jetons de sortie, les tarifs doublant pendant les fenêtres de pointe en semaine. Les développeurs qui appellent encore V4-Pro paient 3,96 $ par million de jetons de sortie au maximum, contre 1,20 $ pour la V4.1-Flash, de sorte que le réacheminement représente une réduction d'environ 70 % sur la sortie.

Les poids sont disponibles sur Hugging Face sous la licence MIT, et le modèle est en direct dans les applications Web et mobiles de DeepSeek. DeepSeek a déclaré qu'il travaillerait avec la communauté open source sur la prise en charge de l'inférence et explorerait d'autres options de déploiement.

Le lancement intervient le jour même où Anthropic a désigné DeepSeek dans son dernier rapport de renseignement sur les menaces comme l'un des sept laboratoires basés en Chine qui, selon lui, auraient mené des campagnes de distillation contre Claude. Anthropic a attribué plus de 12,1 millions d'échanges sur 14 jours en juillet à DeepSeek.

DeepSeek est issu du fonds spéculatif chinois High-Flyer. Le fondateur Liang Wenfeng aurait contribué 3 milliards de dollars à un cycle de financement de plus de 7,4 milliards de dollars en juin qui a valorisé l'entreprise à plus de 50 milliards de dollars.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine