DeepSeek V4.1-Flash : MIT, 552B, un quart du KV-cache, et la fin du modèle Pro derrière l'endpoint dès le 14 septembre
🔎 Trois jours qui reshufflent le marché des modèles ouverts
Le 10 septembre 2026, DeepSeek a publié les poids de V4.1-Flash sur Hugging Face, sous licence MIT, le jour même du lancement. Pas de fenêtre d'exclusivité API, pas d'attente de quelques semaines : les 510 Go du checkpoint FP8, découpés en 48 shards, étaient téléchargeables immédiatement. Selon Baseten, c'est la troisième release open-weight "flash" de l'année pour DeepSeek, dans une semaine où Z.ai et Alibaba ont aussi sorti leurs modèles flash.
Mais la vraie histoire n'est pas le calendrier. C'est la cible. V4.1-Flash n'est pas un modèle conçu pour gagner des tableaux de benchmarks académiques : c'est un modèle conçu pour les workloads agents, là où 98 % des tokens facturés sont de la relecture de contexte, pas de la génération.
Et il y a l'urgence opérationnelle. Le 14 septembre à 12h00 heure de Pékin, deepseek-v4-pro est retiré : toutes les requêtes routent silencieusement vers V4.1-Flash. Si vous avez des IDs de modèles codés en dur dans vos pipelines, vous avez un retest à faire avant cette date. Un développeur a déjà mesuré 30 % de contexte utile perdu à cause de tables de contexte figées sur les anciens IDs. On vous explique tout ça.
L'essentiel
- V4.1-Flash est sorti le 10 septembre 2026 : MoE de 552B de paramètres de backbone + 196B pour le module mémoire Engram, contexte d'1M de tokens, poids MIT sur Hugging Face (~510 Go FP8 en 48 shards).
- Architecture asymétrique Causal Encoder-Decoder : 8B de paramètres actifs en prefill, 16B en decode. Première grande architecture pensée pour les agents d'abord.
- KV-cache réduit à 890 octets par token : un contexte d'1M tient dans ~0,93 Go, contre ~2,15 Go naïvement en FP16 — quatre fois moins que V4-Flash.
- Tarification cassée : 0,003 $/1M en cache-hit off-peak. Sur un agent réel suivi 30 jours, 12,78 $ chez DeepSeek contre 64,00 $ chez GLM-5.3-Flash à trafic identique — 5x d'écran dû à une seule ligne du tarif.
- Le 14 septembre :
deepseek-v4-proroute vers V4.1-Flash, les anciens IDsdeepseek-v4-flashet-vision-exprésolvent aussi vers le nouveau modèle. Retestez vos pipelines.
Outils recommandés
| Outil | Usage principal | Prix (septembre 2026) | Idéal pour |
|---|---|---|---|
| DeepSeek API | Agents, contexte long, tool calling | Cache-hit 0,003 $/1M off-peak, 0,006 $ peak | Workloads input-heavy capables de décaler en heures creuses |
| Poids MIT sur Hugging Face | Self-host, fine-tuning | Gratuit (checkpoint ~510 Go FP8) | Équipes avec du GPU sérieux |
| Baseten Model API | Inférence gérée | Voir le site | Production sans équipe ops |
| GLM-5.3-Flash (Z.ai) | Alternative à tarification flat | Output 0,50 $/1M flat | Trafic prévisible, majoritairement en journée |
| Hostinger | Héberger un proxy entre votre code et l'API | VPS (prix sur hostinger.com) | Survivre aux changements d'endpoint sans toucher au code |
Une architecture asymétrique : pourquoi 8B en lecture et 16B en écriture
Parce que lire et générer n'ont pas le même coût computationnel — et DeepSeek est le premier grand lab à structurer toute son architecture autour de cette asymétrie.
Le modèle repose sur un Causal Encoder-Decoder (CED) qui scinde les 40 layers en deux blocs : 20 layers d'encodeur causal, et 20 layers de décodeur dont le KV cache est projeté directement depuis l'output de l'encodeur. Concrètement, le prefill ne fait tourner que l'encodeur (8B de paramètres actifs), tandis que le decode tourne à 16B. La logique, explicitée par Baseten : générer demande plus que lire, et les workloads agents produisent beaucoup plus de tokens de prefill que de tokens de decode.
Sous le capot, d'autres pièces méritent le détour, détaillées par l'analyse Medium de Data Science in Your Pocket : un Single-Pass mHC pour le mixing du residual stream, le module de mémoire conditionnelle Engram (196B de paramètres faiblement accédés), et un décodage spéculatif DSpark avec vérification à confidence schedulée. Le tout est multimodal nativement, avec compréhension visuelle intégrée.
Mon avis : c'est la première architecture flagship des grands labos ouvertement optimisée pour la boucle agent — relecture massive, génération marginale — plutôt que pour le chatbot. Le reste du marché suivra, probablement avant la fin 2027.
Pour le contexte de cette sortie dans la lignée de V4, notre article DeepSeek V4 : deux nouveaux modèles — Pro et Flash — changent la donne retrace la bascule. La sortie elle-même est détaillée dans DeepSeek V4.1-Flash, un nouveau modèle open-weight disponible dès aujourd'hui.
890 octets par token : l'attaque frontale sur le KV-cache
Le KV-cache était le dernier goulot physique des contextes longs. V4.1-Flash le réduit d'un facteur 4 par rapport à V4-Flash, et de 437x par rapport à DeepSeek V1.
Le mécanisme principal s'appelle Compressed Sparse Attention 2 (CSA2), et son élégance tient dans une décision simple : chaque layer reçoit statiquement l'un des trois modes. Mode Full : la layer calcule son propre KV. Mode Reindex : elle réutilise le KV et l'indexer K de la dernière layer Full, en rescorant avec son propre indexer Q. Mode Reuse : elle réutilise aussi les indices Top-K. Selon MarkTechPost, on compte 18 layers CSA2 encodées en ratio de compression 2, et 20 layers de décodeur en ratio 1, avec un Hierarchical Sparse Indexer maintenant un pool de candidats pouvant aller jusqu'à 16 384 positions.
S'y ajoutent un KV cache en FP4 et le SWA Bounded Replay, qui réduit l'empreinte persistante sur SSD ou mémoire hôte à environ 1/8 de la génération précédente. Les docs officielles DeepSeek confirment : 1/4 du HBM, 1/8 du stockage.
Le chiffre qui compte vraiment, calculé par Agenteum : 890 octets de KV par token en HBM. Un contexte d'1M de tokens tient donc dans ~0,93 Go de KV cache, contre ~2,15 Go naïvement en FP16. La valeur max_position_embeddings est confirmée à 1 048 576 dans le config.json — ce n'est pas du marketing, c'est du mesurable.
L'étude technique est disponible sur alphaXiv pour qui veut les détails d'implémentation.
La vraie révolution est dans le tarif : 98,6 % de votre facture, c'est du cache
Les agents ne génèrent presque rien. Ils relisent tout.
La mesure la plus éclairante vient d'Agenteum : sur 30 jours de trafic d'un agent réel, 26,7M de tokens d'input frais, 5,0M d'output — et 1,92 milliard de tokens d'input cachés, soit 98,6 % de tout ce qui est envoyé. Un agent qui retravaille le même dépôt, les mêmes définitions d'outils ou la même historique de conversation relit son préfixe entier à chaque tour.
Voici la grille tarifaire de V4.1-Flash au lancement :
| Type de token | Off-peak ($/1M) | Peak ($/1M) | Évolution vs V4 Flash |
|---|---|---|---|
| Cache-hit (input) | 0,003 | 0,006 | -60 % |
| Cache-miss (input) | 0,15 | 0,30 | -33,3 % |
| Output | 0,60 | 1,20 | -11,1 % |
Off-peak, c'est 50 % du peak, avec deux fenêtres peak en semaine : 01h00-04h00 et 06h00-10h00 UTC, soit les heures de bureau en Chine. Les limites de concurrence passent de 500 à 2 500 requêtes.
Maintenant, la comparaison qui fait mal. Sur 50M de tokens relus en cache-read, VentureBeat chiffre : ~0,15 $ sur V4.1-Flash off-peak, contre 15 $ sur Kimi K3, 20 $ sur GPT-5.6 Sol et 25 $ sur Claude Opus 5 aux tarifs cache-read publiés. Un facteur 100 à 170 sur la ligne qui domine réellement vos factures d'agents.
Et le face-à-face direct : à trafic identique, le même trafic agent coûte 12,78 $ chez DeepSeek off-peak contre 64,00 $ chez GLM-5.3-Flash — un écart de 5x qui tient à une seule ligne du tableau, le tarif cache-input 10x plus bas.
La leçon méthodologique, martelée par VentureBeat : mesurez votre cache-hit ratio et votre coût par tâche complétée, pas le prix d'input tête d'affiche. L'étude de cas OpenDesign résume tout : V4.1-Flash atteint 98 % du quality score de GPT-6 Astra pour 1,4 % de son coût. Si vous cherchez le meilleur modèle pour vos agents aujourd'hui, notre comparatif des LLM pour agents IA détaille ces arbitrages.
DeepSeek vs GLM-5.3-Flash : deux réponses opposées au même problème
Deux labs ont attaqué le même mal — contexte long et input caché inabordable — par des directions opposées. DeepSeek a compressé le KV-cache (CED + CSA2 + MXFP4 + SWA Bounded Replay). Z.ai a simplifié la matrice d'attention : une architecture hybride linéaire + sparse MLA sans encodage positionnel, qui réduit le compute d'attention d'un facteur 3 et le KV cache d'un facteur 4,4 par rapport à GLM-5.3.
Le tableau comparatif, d'après Yotta Labs :
| Critère | DeepSeek V4.1-Flash | GLM-5.3-Flash |
|---|---|---|
| Architecture | 552B encodeur-décodeur | 320B MoE |
| Paramètres actifs | 8B prefill / 16B decode | 18B |
| Modalités | Texte + image | Texte + image + vidéo |
| Contexte | 1M (confirmé config.json) | 1M annoncé, évalué ~300K |
| Output max | 384K | — |
| Licence | MIT | — |
| Checkpoint | ~510 Go FP8 | ~306 Go FP8 |
| Input (off-peak) | 0,15 $/1M | — |
| Output | 0,60 $/1M off-peak | 0,50 $/1M flat |
| Cache hit | 0,003 $/1M off-peak | 0,03 $/1M flat |
| DeepSWE v1.1 | 74,2 | 63,4 |
Les scénarios de batch de Intelligent Living tranchent : 10M input + 2M output non cachés off-peak, c'est 2,70 $ contre 2,50 $ — quasiment égalité. À 80 % d'input caché off-peak : 1,52 $ contre 1,54 $. Mais en peak : 5,40 $ contre 2,50 $ — GLM gagne.
Le verdict par profil de trafic : cache-heavy et off-peak penche nettement DeepSeek ; flat, prévisible et diurne penche GLM. Côté vitesse, V4.1-Flash sort ~194-198 tokens/s contre ~90 pour GLM. Côté hardware, sur un nœud 8x H100, GLM laisse ~300 Go pour le KV et le batch, V4.1-Flash ~130 Go — mais le cache persistant à 890 octets/token fait qu'un contexte complet d'1M tient sous le gigaoctet.
Le 14 septembre : votre endpoint change de cerveau sans prévenir
À partir de 12h00 heure de Pékin le 14 septembre 2026, toutes les requêtes vers deepseek-v4-pro — modèle retiré — routent vers V4.1-Flash, au prix unitaire le plus bas, jusqu'à la sortie de V4.1 Pro. Et ce n'est pas tout : les anciens IDs deepseek-v4-flash et deepseek-v4-flash-vision-exp restent appelables mais résolvent désormais vers le nouveau modèle, fusionnant texte et image sous une seule entrée API. Le détail de la bascule est dans notre article DeepSeek échange V4-Pro contre V4.1-Flash derrière le même endpoint : pourquoi re-tester vos pipelines avant le 14 septembre.
Pourquoi c'est sérieux : Agenteum documente le cas d'un agent qui perdait 30 % de contexte utile à cause de tables de contexte codées en dur sur les anciens IDs. Le modèle derrière l'endpoint a changé, mais votre code, lui, suppose encore le comportement d'hier.
Trois vérifications avant le 14 : supprimez les IDs de modèles codés en dur de vos tables de contexte, revérifiez les hypothèses de fenêtre de contexte (1M confirmé, output max 384K, avec JSON output, tool calling et Responses API au menu), et rejouez vos suites de tests agentiques sur le nouveau modèle. Le "thinking" est activé par défaut avec trois niveaux d'effort (low/high/max) — un changement de comportement silencieux qui peut surprendre vos parses de sortie.
Mon conseil d'architecte : glissez un proxy mince entre votre code et l'API DeepSeek, avec le mapping modèle dans un fichier de config. Un simple VPS chez Hostinger suffit pour ce relais, et la prochaine bascule d'endpoint deviendra une modification d'une ligne au lieu d'une opération d'urgence.
La migration silencieuse reste un choix discutable en termes de communication. Mais personne ne va s'en plaindre, parce que les tests de plusieurs parties placent déjà V4.1-Flash devant V4-Pro sur performance, coût, vitesse et runtime total. Le Flash tue le Pro, littéralement.
Benchmarks : le Flash bat le flagship qu'il remplace
Oui, un modèle estampillé "Flash" dépasse le modèle Pro qu'il remplace. C'est le renversement le plus notable de cette sortie.
Les chiffres sourcés : un rating Codeforces de 3471 (MarkTechPost), des résultats devant Claude Opus 5 sur Terminal Bench 2.1 et DeepSWE (Medium), et un DeepSWE v1.1 de 74,2 contre 63,4 pour GLM-5.3-Flash (Yotta Labs).
Sur les benchmarks agentiques de vals.ai, l'écart se creuse : +54 points sur Vibe Code Bench, +33 sur ProofBench, +25 sur Code Migration face à GLM. L'exécution agentique est le terrain de jeu naturel de ce modèle.
Restons honnêtes sur les limites : GLM reste meilleur généraliste (Finance Agent, Legal, MedScribe). Et le "1M de contexte annoncé" de GLM n'a été évalué qu'à 300K — méfiance générale donc sur les fenêtres annoncées tant que vous n'avez pas testé vos propres charges.
Pour situer V4.1-Flash dans le paysage actuel, notre comparatif des meilleurs LLM pour coder est mis à jour chaque mois.
Et en local ? 510 Go, ça ne rentre pas dans votre Mac
Les poids sont MIT et ouverts, mais servez-les avec un cluster, pas avec un laptop. Le checkpoint FP8 pèse ~510 Go en 48 shards ; même sur un nœud 8x H100, il ne reste que ~130 Go pour le KV cache et le batch après chargement des poids. L'architecture asymétrique CED exige en outre un support moteur dédié — votre runtime habituel ne la gérera pas d'emblée.
Le précédent est encourageant cependant : après la sortie de V4 Flash, antirez avait lancé ds4, un moteur d'inférence local rendant DeepSeek V4 Flash utilisable sur un Mac.attendez-vous à des builds communautaires quantifiés pour V4.1-Flash dans les semaines qui suivent, mais vérifiez que le support CED est réellement implémenté avant d'y porter vos agents.
D'ici là, si vous voulez du local dès maintenant, notre guide d'installation d'un LLM local couvre Ollama et LM Studio, et le comparatif des meilleurs LLM locaux référence les modèles qui tiennent sur du matériel grand public.
Pour 95 % des usages agents, la franchise honnête est : prenez l'API. À 0,003 $ le million de tokens cachés, le calcul du self-hosting ne se pose même pas.
❌ Erreurs courantes
Erreur 1 : comparer les prix d'input affichés
Le prix headline (0,15 $/1M) n'est pas votre prix réel. Sur un agent, 98,6 % des tokens sont du cache. Mesurez votre cache-hit ratio sur 30 jours et calculez un coût par tâche complétée — c'est la seule métrique qui prédit votre facture.
Erreur 2 : laisser des IDs de modèles codés en dur
Cas réel documenté : 30 % de contexte utile perdu après bascule d'endpoint, à cause de tables de contexte figées sur les anciens IDs. Centralisez le mapping modèle dans une config, et retestez vos pipelines avant le 14 septembre.
Erreur 3 : lancer les batchs lourds en plein peak
Les fenêtres peak sont 01h00-04h00 et 06h00-10h00 UTC en semaine. Un batch de 10M input + 2M output coûte 2,70 $ off-peak contre 5,40 $ peak. Ordonnancez vos jobs lourds en heures creuses, le tarif y est deux fois plus bas.
Erreur 4 : croire la fenêtre de contexte annoncée sans test
GLM-5.3-Flash annonce 1M mais est évalué à 300K. V4.1-Flash confirme 1 048 576 dans son config.json — mais "supporté" ne signifie pas "performant à fond". Testez vos propres charges longues avant d'engager la production.
❓ Questions fréquentes
Mon code va-t-il casser le 14 septembre ?
Non, pas frontalement : les requêtes vers deepseek-v4-pro routent automatiquement vers V4.1-Flash au prix unitaire le plus bas, jusqu'à la sortie de V4.1 Pro. Mais si vous avez des IDs codés en dur, des tables de contexte ou des parses liés à l'ancien modèle, retestez — un agent a perdu 30 % de contexte utile exactement pour cette raison.
Puis-je utiliser V4.1-Flash commercialement ?
Oui. Les poids sont sous licence MIT, publiés sur Hugging Face dès le jour du lancement. Distillation, fine-tuning, produit commercial : tout est permis. Comptez ~510 Go FP8 et du multi-GPU sérieux pour servir le modèle vous-même, sinon l'API ou Baseten font le travail.
Pourquoi ma facture d'agent est-elle dominée par le cache ?
Parce qu'un agent renvoie son préfixe entier à chaque tour : dépôt de code, définitions d'outils, historique de conversation. Sur 30 jours mesurés, 1,92 milliard de tokens cachés contre 26,7 millions frais. D'où l'importance décisive du tarif cache-hit à 0,003 $/1M off-peak.
V4.1-Flash ou GLM-5.3-Flash ?
Trafic input-heavy, décalable en off-peak : DeepSeek, jusqu'à 5x moins cher sur des workloads réels. Trafic plat, prévisible, majoritairement diurne : GLM, avec son output flat à 0,50 $/1M. GLM reste aussi meilleur généraliste chez vals.ai (Finance Agent, Legal, MedScribe).
Quand sort V4.1 Pro ?
Aucune date annoncée. D'ici là, l'endpoint deepseek-v4-pro sert V4.1-Flash au prix le plus bas. Les tests de plusieurs parties cités par DeepSeek placent déjà le Flash devant le Pro sur performance, coût et vitesse — l'urgence de V4.1 Pro n'est donc pas évidente.
✅ Conclusion
DeepSeek V4.1-Flash démontre que la prochaine guerre des LLM se joue sur l'octet de KV-cache et la ligne "cache-hit" du tarif, pas sur les tableaux de benchmarks. Avant le 14 septembre, retestez vos pipelines — puis comparez le résultat sur notre comparatif mensuel des meilleurs LLM.