Xiaomi MiMo-V2.6 : l'entraînement RL diffusé en live qui hisse un modèle open-source n°1 sur Artificial Analysis
🔎 Le post-training devient un spectacle public
Le 21 septembre 2026, Xiaomi a open-sourcé la série MiMo-V2.6 sous licence MIT : un modèle géant de 1,02 trillion de paramètres (MiMo-V2.6-Pro), un variant Flash de 309 milliards, et un checkpoint distillé de 9B — le tout avec les poids sur Hugging Face, le rapport technique et, détail qui change tout, les journaux d'entraînement RL consultables en ligne.
Parce que MiMo-V2.6-Pro affiche 46.32 sur l'Intelligence Index v4.3 d'Artificial Analysis — le meilleur score jamais mesuré sur un modèle open weights selon la méthodologie v4.3, devant Kimi K3 et Qwen3.8 Max. Et surtout : Xiaomi n'a pas seulement publié le résultat. Elle a publié la recette, les environnements et le coût.
Car le vrai sujet n'est pas le leaderboard. C'est le run de renforcement learning que Xiaomi a rendu public : 30 steps de RL sur environ 750 000 trajectoires, bouclés en moins de six jours, pour 2,62 millions de dollars de tokens côté Pro et 854 000 dollars côté Flash. Des chiffres précis, datés, vérifiables — pas un benchmark vendor. La Chine ne se contente plus de rattraper les labos fermés : elle industrialise le RL post-training reproductible, et elle le fait en open.
L'essentiel
- MiMo-V2.6-Pro : 1,02 T de paramètres (42 B actifs, sparse MoE 384 experts), omnimodal (texte, image, audio, vidéo en entrée), contexte de 1M de tokens, licence MIT, score 46.32 sur l'Artificial Analysis Intelligence Index v4.3.
- MiMo-V2.6-Flash : 309 B de paramètres (15 B actifs), mêmes capacités omnimodales, pensé pour être servi sur du matériel raisonnable — le modèle qu'une petite équipe peut à la fois payer sur l'API et héberger elle-même.
- Run RL public : 30 steps, 1 568 prompts × 16 rollouts par step, ~753 000 trajectoires, 3,43-3,7 Md de tokens par step, arrêté après 5 jours et 7 heures (Pro) et 3 jours et 11 heures (Flash), coûts détaillés au dollar près.
- 7 000+ environnements RL open-sourcés : ingénierie logicielle, reproduction de vulnérabilités, travail knowledge-intensive, développement web — avec le framework complet pour reproduire l'entraînement.
- Prix API inchangés vs V2.5 : 0,435 $/M en entrée et 0,87 $/M en sortie pour Pro ; 0,14 $/M et 0,28 $/M pour Flash (septembre 2026, vérifiez sur openrouter.com).
- Un Pro-UltraSpeed (jusqu'à 20x plus rapide selon Xiaomi) complète la gamme côté API.
Outils recommandés
| Outil | Usage principal | Prix (septembre 2026) | Idéal pour |
|---|---|---|---|
| MiMo AI Studio / API officielle | Accès à Pro, Flash et Pro-UltraSpeed | 0,435 $/M in / 0,87 $/M out (Pro) ; 0,14 $/M / 0,28 $/M (Flash) | Production, agents longs (1M de contexte) |
| Poids MiMo-V2.6 sur Hugging Face | Téléchargement des poids MIT, model card, benchmarks | Gratuit | Recherche, fine-tuning, audit |
| Page RL en direct | Consultation des logs d'entraînement (steps, pass rates, coûts) | Gratuit | Comprendre une recette de RL à l'échelle |
| OpenRouter | Accès unifié Pro/Flash avec cache | Mêmes tarifs, cache hits à une fraction de cent | Tests comparatifs multi-modèles |
| Ollama / LM Studio | Servir MiMo-V2.6-Distill-Qwen-9B en local | Gratuit | Expérimentation fine-tuning sur GPU consumer |
Trois modèles, une licence MIT, zéro restriction — ce que Xiaomi a réellement publié
Réponse directe : Xiaomi a publié l'intégralité des poids de trois modèles sous licence MIT, sans gating ni clause d'usage, ce qui en fait la release open weights la plus permissive de ce niveau de performance à ce jour.
Le cœur de la release, c'est MiMo-V2.6-Pro. Sparse mixture-of-experts de 1,02 trillion de paramètres avec seulement 42 milliards activés par token, routés parmi 384 experts (8 actifs). L'omnimodalité est native : un encodeur vision MiMo ViT de 681 M de paramètres, un AudioTokenizer de 308 M plus un patch encoder de 127 M, le tout fusionné dans un seul modèle qui sort du texte. Xiaomi ajoute une multi-token prediction avec décodeur spéculatif de 5 couches pour accélérer l'inférence.
Le contexte de 1M de tokens n'est pas un gimmick marketing : le model card le positionne explicitement pour les dépôts de code entiers, les traces d'outils et les runs d'agents multi-sessions. C'est un modèle pensé pour les agents, pas pour les chatbots.
MiMo-V2.6-Flash (309 B totaux, 15 B actifs) est le variant pragmatique. Selon l'analyse de Datanorth, c'est « le modèle qu'une équipe de quatre personnes peut à la fois payer sur l'API et servir sur son propre matériel ». Pro, lui, relève pour la plupart des organisations de l'actif de recherche ou de la facture d'inférence — 1,02 T de poids MIT, ça ne tient pas sur votre workstation.
Enfin, MiMo-V2.6-Distill-Qwen-9B : un checkpoint distillé depuis Qwen, publié avec les ressources de recherche RL de Xiaomi. C'est le modèle dont personne ne parle dans les headlines et qui sera pourtant le plus téléchargé — on y revient plus bas.
Le run de RL en live : 30 steps, 750 000 trajectoires, 2,6 M$ — ce que les logs montrent vraiment
Réponse directe : pour la première fois, un labo publie les journaux complets d'un run de RL à l'échelle — dates, coûts, pass rates step par step — et ça ressemble à une opération de transparence assumée autant qu'à une démonstration de force infrastructure.
Les chiffres, sourcés depuis la page RL officielle :
| Métrique | MiMo-V2.6-Pro | MiMo-V2.6-Flash |
|---|---|---|
| Début du run | 15 sept 2026, 10:32 UTC | 15 sept 2026, 15:16 UTC |
| Arrêt | 20 sept 2026 (step 30) | 19 sept 2026 (step 30) |
| Durée | 5 j 07 h 29 min | 3 j 11 h 05 min |
| Score dynsam/avg@n final | 0.633 (+0.068 vs step 1) | 0.644 (+0.130 vs step 1) |
| Gain relatif | ~+12 % | ~+25 % |
| Coût cumulé tokens | 2 620 670 $ | 854 044 $ |
| Tokens au step 30 | 3,43 Md | 3,7 Md |
| Trajectoires d'entraînement | ~753 000 | ~753 000 |
| Batch | 1 568 × 16 séquences | 1 568 × 16 séquences |
Deux choses méritent votre attention. D'abord, l'architecture fully asynchronous : chaque update consomme 1 568 samples et entraîne sur 3,5 à 3,7 milliards de tokens avec un contexte de 1M. Ce n'est pas du fine-tuning de LoRA sur un seul GPU — c'est une chaîne industrielle de génération de rollouts, de scoring et de mise à jour, tenue à charge pendant plusieurs jours.
Ensuite, la méthode. Le paper soumis le 21 septembre décrit une approche de comparaison entre tentatives « siblings » au sein de chaque batch : plutôt que de scorer chaque rollout de façon absolue, le modèle apprend en comparant les tentatives entre elles pour recentrer le signal vers la solution la plus propre. Ce feedback gradué est appliqué simultanément sur quatre domaines — code, workflows professionnels, design visuel et cybersécurité — et les courbes score-vs-step montrent une progression régulière sur les quatre.
Le résultat le plus parlant reste DeepSWE v1.1 : le run fait passer Flash de 19,0 (V2.5) à 65,68 sur l'évaluation mini-swe-agent avg@3 de la page RL — un bond de près de 47 points, dont une grande partie acquise pendant ces 30 steps. C'est là que le RL post-training cesse d'être un art alchimique pour devenir un process mesurable.
Mon avis : le plus intéressant n'est pas le score final, c'est le coût par point de gain. ~2,6 M$ pour +12 % relatif sur Pro, ~0,85 M$ pour +25 % relatif sur Flash. Pour la première fois, une équipe qui envisage un run de RL post-training a des ordres de grandeur publics pour budgétiser. Ça n'a l'air de rien ; ça va raccourcir les cycles de décision de pas mal de labos moyens.
46.32 sur l'Index v4.3 : que vaut ce score face à Kimi K3 et Qwen3.8 ?
Réponse directe : sur l'Index v4.3 d'Artificial Analysis, MiMo-V2.6-Pro est le modèle open weights le mieux classé — mais il faut lire les chiffres avec la rigueur que la comparaison entre versions d'index impose.
Selon Artificial Analysis, MiMo-V2.6-Pro score 46 sur l'Intelligence Index, « bien au-dessus de la moyenne des autres modèles open weights de taille similaire (médiane : 18) ». Datanorth le place à 46.32 sur la v4.3, à égalité avec Grok 4.7 — sorti le même jour par SpaceXAI, environ cinq fois plus cher au token. Grok 4.6 est à 44, Gemini 3.8 Flash à 41.
Un point de vigilance honnête : les comparaisons avec Kimi K3 et Qwen3.8 circulent avec des chiffres d'une version antérieure de l'Index, où K3 était crédité de 60 et Qwen3.8 de 58. Ces chiffres, issus d'un article vendor de Featherless, ne sont pas directement comparables à la v4.3. Ce qui reste solide, ce sont les benchmarks croisés sur tâches agentiques, où MiMo-V2.6-Pro joue dans la même cour que les fermés :
| Benchmark | MiMo-V2.6-Pro | MiMo-V2.6-Flash | Référence fermée |
|---|---|---|---|
| DeepSWE v1.1 | 71.9 | 67.9 | Claude Opus 5 : 74.0 |
| Terminal Bench 2.1 | 89.9 | 87.6 | — |
| OSWorld-Verified | 82.0 | 80.8 | — |
| Toolathlon-Verified | 76.9 | 73.6 | — |
| AutomationBench v1.0.6 | 53.1 | 52.3 | — |
| Agents' Last Exam | 31.6 | 27.6 | — |
| ExploitBench | 47.9 | 25.3 | — |
Goldie Bench estime que Pro coûte environ un quart du prix de Grok 4.7 et un vingtième des modèles fermés de frontière pour un niveau équivalent sur les benchmarks agentiques. Sur DeepSWE, l'écart avec Claude Opus 5 (74.0) n'est plus que de 2,1 points. En un an, l'open weights est passé de « intéressant mais à 15 points derrière » à « au contact ».
Le doc officiel Xiaomi revendique aussi l'intégration d'un raisonnement spatial 3D, de la perception multimodale et d'un Computer Use Agent — compréhension d'interfaces graphiques complexes, manipulation d'outils bureautiques, vérification des résultats sur feedback visuel, et un « Vibe World » de construction de monde interactif piloté en langage naturel. Le score OSWorld-Verified de 82.0 suggère que ce n'est pas du vent.
7 000 environnements RL ouverts : la vraie bombe de la release
Réponse directe : le modèle passera les headlines ; ce sont les 7 000+ environnements de tâches RL et le framework de reproduction qui vont changer la pratique du post-training dans la communauté open source.
Le doc officiel décrit « 7k+ environnements de tâches RL de haute qualité couvrant quatre types de tâches agentiques : ingénierie logicielle, reproduction de vulnérabilités, travail knowledge-intensive, et design et développement web ». Xiaomi publie en même temps les pratiques d'entraînement vérifiées et le framework complet pour relancer le run.
Pourquoi c'est important ? Parce que le goulot d'étranglement du RL post-training n'a jamais été l'algorithme — PPO, GRPO et variantes sont connus depuis des années. C'est la qualité des environnements : des tâches avec des vérificateurs fiables, une difficulté calibrée, assez de diversité pour éviter le reward hacking. Construire 7 000 environnements de ce type (dont de la reproduction de vulnérabilités, ce qui est rare et sensible) représente probablement plus d'ingénierie que le run lui-même.
En open-sourçant ce corpus sous MIT, Xiaomi fait quelque chose d'assez subversif : elle transforme une compétence détenue par cinq labos au monde en infrastructure reproductible. N'importe quelle équipe avec le budget GPU peut désormais partir d'une recette documentée plutôt que de réinventer son pipeline. C'est exactement le genre de mouvement qui, historiquement, accélère toute une catégorie de modèles — et qui donne du sens aux comparatifs de LLM pour agents au-delà des simples scores de chat.
Vous voulez fine-tuner un agent ? Commencez par le Distill-Qwen-9B
Réponse directe : personne ne fine-tune 1,02 T de paramètres. Le terrain d'expérimentation réaliste, c'est MiMo-V2.6-Distill-Qwen-9B — et c'est précisément pour ça que Xiaomi le publie avec ses ressources RL.
La logique du pipeline est explicite dans le doc officiel : l'entraînement RL démarre depuis le checkpoint distillé. Xiaomi a donc conçu ce 9B comme un point de départ viable pour du renforcement learning, pas comme un simple modèle démo. Concrètement :
- Téléchargez les poids sur Hugging Face (licence MIT, usage commercial inclus).
- Servez-le en local avec Ollama ou LM Studio — un 9B passe sans peine sur un GPU consumer 24 Go, et un petit serveur dédié suffit pour un service interne ; pour ça, un VPS GPU chez Hostinger fait le travail sans investissement matériel.
- Reprenez les environnements RL de Xiaomi sur votre domaine métier : remplacez leurs tâches de dev web par vos propres tâches vérifiables, gardez leur framework de scoring.
- Itérez en comparant les siblings — la méthode du paper est reproductible à petite échelle, et c'est elle qui stabilise le signal d'apprentissage.
Pour les cas où le 9B ne suffit pas, Flash reste l'option intermédiaire : 15 B de paramètres actifs, DeepSWE à 67.9, et un profil de coût qui reste gérable. Notre guide des meilleurs LLM locaux sera mis à jour avec ces nouveaux points de repère, et pour le choix du modèle de base d'un pipeline agentique, le comparatif mensuel des meilleurs LLM reste la référence.
La vague open weights de septembre 2026 : le post-training devient une industrie chinoise
Réponse directe : MiMo-V2.6 ne sort pas dans un vide. Il s'inscrit dans un mois de septembre 2026 où la Chine a inondé l'écosystème open weights de releases coordonnées — et la stratégie est désormais lisible.
Le tableau du mois :
- DeepSeek V4-Pro sous licence MIT, avec l'épisode récent de l'échange V4-Pro contre V4.1-Flash derrière le même endpoint — analyse détaillée dans DeepSeek échange V4-Pro contre V4.1-Flash.
- Qwen3.8-2.4T-A95B, le checkpoint ouvert d'Alibaba : 2,4 T de paramètres totaux, 95 B actifs, 262K de contexte natif extensible à ~1M, reasoning non désactivable — et un checkpoint full-precision de 4,89 To, ce qui donne une idée du coût de serving de cette génération.
- Kimi K3 de Moonshot AI : MoE de 2,8 T, 104 B actifs, poids MXFP4 (~1,4 à 1,56 To), vision native via MoonViT-V2.
- GLM-5.2 de Z.AI, présenté comme le modèle open weights le plus puissant du monde à sa sortie (753B MoE, 1M de contexte) — voir GLM-5.2 : le modèle open weights le plus puissant du monde.
- StepFun Step-5 Preview, un MoE de 600 milliards avec 1M de contexte (analyse ici).
- Ternary-Bonsai-2 et son approche 2-bit, qui pousse la compression des poids là où personne ne l'attendait — le suivi de ces releases est assuré par The Open Weights.
Face à ça, l'Amérique donne des signes de repli stratégique. Meta a franchi le pas du modèle fermé avec Muse Spark — une trahison de l'open-source analysée dans Meta Muse Spark : pourquoi Meta a trahi l'open-source — pendant que NVIDIA contre-attaque avec Nemotron 3 Ultra 550B et que Google explore une autre voie avec DiffusionGemma, premier modèle de texte par diffusion open source.
Ma lecture : la Chine a compris que la guerre des modèles de base est en train de se déplacer vers le post-training reproductible. Les poids de 1T se copient ; les pipelines de RL à 7 000 environnements, les pratiques d'entraînement vérifiées et les coûts publics, c'est de la capacité industrielle exportée sous forme de code. Xiaomi, constructeur de smartphones et de voitures agentiques, applique au RL la même logique de manufacturing qu'à son hardware — comme le souligne mPost sur les voitures agentiques, la cyber et les mondes 3D.
❌ Erreurs courantes
Erreur 1 : comparer les scores d'Index sans vérifier la version
Les chiffres « K3 à 60, Qwen3.8 à 58 » circulent depuis une version antérieure de l'Artificial Analysis Index. Le 46.32 de MiMo-V2.6-Pro est mesuré sur la v4.3. Mélanger les deux, c'est comparer des thermomètres différents. La solution : toujours vérifier la version de l'Index et la date de capture sur artificialanalysis.ai avant de conclure.
Erreur 2 : croire qu'on va « faire tourner Pro chez soi »
1,02 T de paramètres, même avec 42 B actifs, ça suppose une infrastructure multi-GPU dont Xiaomi ne publie d'ailleurs aucune recommandation hardware. Le modèle auto-hébergeable pour un particulier ou une petite équipe, c'est le Distill-Qwen-9B — ou éventuellement Flash si vous avez du sérieux matériel. Les autres passeront par l'API.
Erreur 3 : sous-estimer le coût d'un run de RL
Les logs publics donnent les vrais ordres de grandeur : 854 000 $ de tokens pour 30 steps sur Flash, 2,62 M$ sur Pro, hors infrastructure et ingénierie. Beaucoup d'équipes budgètent le fine-tuning SFT et découvrent ensuite que le RL coûte un à deux ordres de grandeur plus cher. Partez des chiffres de Xiaomi, pas d'intuitions.
Erreur 4 : confondre score de benchmark et modèle utile en production
MiMo-V2.6-Pro est décrit comme rapide mais « somewhat verbose » par Artificial Analysis. Sur Terminal Bench 4.0, il reste à 34.9 — la tâche est dure pour tout le monde. Un bon score agentique global ne dit rien de votre cas d'usage précis : testez sur vos propres tâches avant de migrer.
❓ Questions fréquentes
MiMo-V2.6-Pro est-il vraiment utilisable commercialement ?
Oui. La licence MIT couvre les trois modèles, poids téléchargeables sur Hugging Face, usage commercial inclus sans restriction ni clause de concurrence. C'est la licence la plus permissive du marché pour ce niveau de performance. Seule contrainte pratique : la taille des poids de Pro, qui impose l'API pour la plupart des usages.
Quel modèle choisir entre Pro, Flash et le 9B ?
Pro pour la performance maximale via API (agents longs, contexte 1M, OSWorld 82.0). Flash si vous voulez un compromis servable : 15 B actifs, DeepSWE 67.9, prix divisé par trois. Le 9B distillé pour l'expérimentation locale et le fine-tuning RL. Notre comparatif des LLM pour le code détaille les arbitrages par cas d'usage.
Le run RL est-il vraiment reproductible avec les éléments publiés ?
Xiaomi publie le framework, les 7 000+ environnements, les pratiques d'entraînement vérifiées et les hyperparamètres visibles sur la page RL (batch 1 568 × 16, ~3,5 Md de tokens par step). Reproduire à l'identique coûtera des millions de dollars, mais reproduire la méthode à petite échelle sur le 9B est réaliste pour une équipe équipée.
Comment ces prix se comparent-ils aux modèles fermés ?
Pro : 0,435 $/M en entrée, 0,87 $/M en sortie. Flash : 0,14 $/M et 0,28 $/M (septembre 2026, vérifiez sur openrouter.com). Selon Goldie Bench, c'est environ un quart du prix de Grok 4.7 et un vingtième des modèles fermés de frontière, à niveau de benchmark agentique équivalent. Les cache hits tombent à une fraction de cent.
Pourquoi la publication des coûts d'entraînement est-elle si importante ?
Parce que c'est une donnée que quasi aucun labo ne communique. Connaître le coût réel d'un run de RL (2,6 M$ pour +12 % relatif sur Pro) permet à n'importe quelle équipe de décider si elle lance le sien, et de négocier son infrastructure avec des chiffres plutôt que des rumeurs. C'est un acte de transparence rare — et stratégique.
✅ Conclusion
MiMo-V2.6 est la release qui fait passer l'open weights du statut de « suiveur crédible » à celui de leader mesuré sur l'Index v4.3 — mais son vrai legs est le run RL public, les 7 000 environnements et les coûts affichés au dollar près, qui transforment le post-training en discipline reproductible. Si vous voulez tester ce que ça change pour vos agents, commencez par le guide d'installation d'un LLM local et le Distill-Qwen-9B : c'est là que la prochaine génération de modèles open source s'écrira.