Xiaomi présente la famille de modèles d'IA open source de la série Mimo-V2.6

La société technologique mondiale Xiaomi Corp. a annoncé aujourd'hui la sortie et l'open source de ses modèles d'intelligence artificielle générative de la série MiMo-V2.6, qui comprennent deux modèles nativement omnimodaux apportant un équilibre entre intelligence, efficacité et coût.

La série MiMo-V2.6 comprend deux modèles nativement omnimodaux avec un nouveau modèle phare, MiMo-V2.6-Pro, et une variante Flash plus petite et efficace. La société a également annoncé le déploiement d'une variante Pro-UltraSpeed ​​allégée qui offre une sortie jusqu'à 20 fois plus rapide que Pro avec la même qualité pour des vitesses de génération extrêmes.

La société a décrit les modèles Pro et Flash comme natifs « omnimodaux » : acceptant le texte, l’image, la vidéo et l’audio dans la même famille, avec des fenêtres contextuelles d’un million de jetons. L'architecture publiée par Pro répertorie un encodeur de vision de 681 millions de paramètres, dont un AudioTokenizer de 308 millions de paramètres et un encodeur de patch audio de 127 millions de paramètres capables de distinguer la parole.

Cette conception permet aux modèles plus grands de répondre aux besoins croissants d'aujourd'hui en matière de cas d'utilisation de l'IA agentique et d'instructions de tâches, en particulier pour une utilisation sur ordinateur. Par exemple, un agent utilisant un ordinateur pourrait lire une instruction de tâche, lire une capture d’écran d’une interface utilisateur ou d’une vidéo, raisonner, puis décider quoi faire ensuite dans une boucle de modèle.

Un agent de codage ou de conception peut combiner le code source et un long contexte de référentiel avec des captures d'écran, des maquettes d'interface utilisateur et des images de référence, le tout dans la même session. Pour une utilisation professionnelle, le modèle pourrait ingérer de nombreux documents, y compris des composants multimodaux tels que l'audio d'appel, des captures d'écran, des journaux et des notes, sans nécessiter d'outils pour décomposer les transcriptions ou orchestrer chaque modalité.

Dans le billet de blog d'annonce, la société a démontré à quel point le modèle gérait bien la création d'univers de jeu, la modélisation 3D basée sur Blender, la simulation incarnée et les flux de travail vidéo-musique.

La société a déclaré que le V2.6-Pro avait obtenu un score de 46,32 sur l'indice d'intelligence d'analyse artificielle, devant Kimi K3 et Qwen3.8 Max, le modèle open source/open-weight le mieux classé dans cette comparaison au lancement. Cependant, le modèle reste à la traîne des modèles propriétaires phares à source fermée les plus avancés du marché, Claude Fable 5.1 et GPT-6 Astra, sur les mesures globales.

Sur les tâches agentiques, la V2.6-Pro a montré d'excellents résultats lors des tests, proches ou parfois supérieurs aux principaux systèmes fermés : 53,1 sur AutomationBench contre 50,3 sur Claude Opus 5 ; 31,6 au dernier examen des agents, égalant l'Opus 5 ; et 89,9 sur Terminal Bench 2.1, légèrement devant les 89,1 de l'Opus 5.

Avantages en termes de coût et d'efficacité

Xiaomi a déclaré que la série V2.6 conserverait le prix de l'interface de programmation d'application standard utilisé pour MiMo-V2.5, et que les cartes modèles indiquaient également la disponibilité via AI Studio, MiMo Desktop et MiMo Code de la société.

Les modèles Pro et Flash sont également disponibles sur OpenRouter avec un contexte de 1,05 million de jetons via l'API unifiée.

Cela signifie que V2.6-Flash est disponible à 0,14 $ pour 1 million d'entrées et 0,28 $ par sortie et Pro pour 0,435 $ et 0,87 $. Alors que Pro-UltraSpeed ​​coûte jusqu'à 4,35 $ et 8,70 $ pour la génération 20 fois plus rapide.

Xiaomi affirme que le Pro coûte environ un 20e à un 60e du prix des modèles étrangers à intelligence comparable, en tenant compte des coûts des jetons mis en cache, qui sont considérablement réduits. Cela représente une entrée et une sortie de 10 à 50 dollars par million de jetons pour OpenAI Group PBC GPT-6 Astra et Claude Fable 5.1 d'Anthropic PBC. Pour les agents gourmands en cache, cet écart se creuse encore, même si la comparaison commerciale pertinente porte moins sur le prix par jeton que sur le prix par tâche, déterminé par la fiabilité et le nombre de boucles nécessaires pour réussir.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine