DeepSeek échange V4-Pro contre V4.1-Flash derrière le même endpoint : pourquoi re-tester vos pipelines avant le 14 septembre
🔎 Un changement de modèle invisible, quatre jours après la sortie
Le 10 septembre 2026, DeepSeek a lancé V4.1-Flash, un MoE multimodal de 552B paramètres sous licence MIT, disponible le jour même (nous en faisions l'annonce ici). Quatre jours plus tard, le 14 septembre à 4h UTC (midi à Pékin), l'endpoint deepseek-v4-pro cessera de pointer vers V4-Pro 1.6T pour router vers V4.1-Flash, facturé aux tarifs Flash.
Si vous n'avez rien à changer dans votre code, vous avez beaucoup à vérifier. Un endpoint stable qui change de modèle sous-jacent, c'est le scénario classique du drift silencieux : même URL, même clé API, mais un comportement, une latence, un format de sortie et une verbosité potentiellement différents. Et comme V4-Pro 0813 est retiré dans la foulée, vous perdrez toute possibilité de comparaison en A/B.
Ce guide détaille ce qui change exactement, ce que V4.1-Flash vaut vraiment — chiffres sourcés à l'appui — et la checklist à exécuter avant lundi.
L'essentiel
- Le 14 septembre 2026 à 4h UTC (midi, heure de Pékin),
deepseek-v4-proroute vers V4.1-Flash aux tarifs Flash : aucun changement de code, mais un changement de modèle (ByteIota). - V4.1-Flash : MoE de 552B paramètres (8B actifs en input, 16B en output), architecture CED (encodeur causal de 20 couches + décodeur de 20 couches), contexte 1M tokens, entrée d'images native, licence MIT.
- Sur les benchmarks communs, il bat V4-Pro 0813 sur six des huit tests comparés (Terminal-Bench 2.1 : 90,6 vs 87,9 ; DeepSWE : 74,2 vs 62,7), mais cède sur GPQA Diamond et HLE text-only.
- Prix peak : 0,30 $/1M input et 1,20 $/1M output, contre 1,32 $ et 3,96 $ pour V4-Pro — environ 4x moins cher en entrée, 3,3x en sortie.
- Le vrai risque n'est pas la panne, c'est le drift non tracé : evals, formats JSON, latence, tokens de sortie.
- À faire avant le 14 : identifier les appels legacy, geler une baseline d'evals, re-tester après bascule, migrer explicitement vers
deepseek-flash.
Outils recommandés
| Outil | Usage principal | Prix (septembre 2026) | Idéal pour |
|---|---|---|---|
| DeepSeek Platform | API officielle, endpoint deepseek-flash |
0,30 $/1M input peak, 1,20 $/1M output (vérifiez sur platform.deepseek.com) | Production, agents, code |
| Hugging Face | Poids MIT, auto-hébergement, fine-tuning | Gratuit (poids ouverts) | Équipes avec infra GPU |
| ModelScope | Miroir des poids | Gratuit | Accès depuis l'Asie |
| DeepInfra | Hébergement FP8 managé | 0,20 $/1M input, 0,60 $/1M output (vérifiez sur deepinfra.com) | Alternative managée, contexte 1M |
Ce qui change exactement le 14 septembre
Réponse directe : rien dans votre code, tout dans votre modèle. À partir du 14 septembre à 4h UTC, toute requête envoyée à deepseek-v4-pro est servie par V4.1-Flash et facturée aux tarifs Flash, jusqu'à la sortie de V4.1 Pro (TechJackSolutions).
Concrètement, trois mouvements simultanés :
deepseek-v4-flashetdeepseek-v4-flash-vision-expont été retirés avec environ un jour de préavis (ByteIota).- À partir du 14 septembre 04:00 UTC,
deepseek-v4-proroute vers V4.1-Flash. Pas de fenêtre de migration en parallèle : impossible de conserver l'ancien modèle en face du nouveau. - Le nouvel endpoint officiel est
deepseek-flash, avec les poids sous licence MIT sur Hugging Face.
La facture baisse automatiquement : environ 4x moins cher en input peak et 3,3x en output, sans toucher au code. DataCamp confirme que les endpoints legacy sont redirigés vers la famille V4.1 à partir du 14 septembre 2026 (DataCamp).
Pour contexte : la famille V4 avait été lancée avec une segmentation claire entre Pro et Flash. Ce swap va plus loin : DeepSeek remplace le flagship fermé par un modèle ouvert derrière un alias existant.
Mon avis : c'est une stratégie agressive, presque arrogante. La plupart des labos accordent 30 à 90 jours de fenêtre de dépréciation ; ici, un jour pour les endpoints Flash, quatre pour le basculement Pro. DeepSeek parie que la baisse de prix et les scores rendront le changement indolore. Le pari est raisonnable sur le papier — mais il transfère le coût de la migration vers vos suites de tests.
V4.1-Flash en 60 secondes : l'architecture CED sans jargon inutile
Réponse directe : V4.1-Flash est un MoE de 552B paramètres dont seuls 8B (côté input) et 16B (côté output) sont actifs par token, réorganisés en Causal Encoder-Decoder (CED).
L'architecture CED empile un encodeur causal de 20 couches sur un décodeur de 20 couches, le KV cache global du décodeur étant projeté depuis les états finaux de l'encodeur (TechJackSolutions). Ce qui compte pour vous, c'est le résultat pratique : une activation creuse qui explique la vitesse et le prix bas. Les mesures communautaires font état de 280 à 500 tokens/s en sortie, contre environ 57-60 pour Claude Opus 5 (CodingFleet).
Seconde nouveauté : un cadran unique d'effort de raisonnement continu, de 1 à 100, contre trois modes discrets pour le V4-Flash 284B de la génération précédente. Vous ajustez la profondeur de raisonnement par appel — utile pour ne pas payer du raisonnement maximal sur des tâches triviales.
Le reste de la fiche technique : contexte de 1M tokens, 384K de sortie maximum chez DeepInfra, entrée d'images native, tool calling, JSON structuré et prompt caching (Requesty, DataCamp). Licence MIT, poids sur Hugging Face et ModelScope (CCLeaks).
C'est ça, la vraie rupture : un modèle open-weight qui joue dans la cour des flagships fermés, que vous pouvez auto-héberger, fine-tuner et redistribuer librement.
Benchmarks : l'open-weight bat le flagship fermé de DeepSeek… presque partout
Réponse directe : sur la table officielle, V4.1-Flash (effort max) devance V4-Pro 0813 sur six des huit benchmarks comparés par CodingFleet.
| Benchmark | V4.1-Flash | V4-Pro 0813 |
|---|---|---|
| Terminal-Bench 2.1 | 90,6 | 87,9 |
| DeepSWE v1.1 | 74,2 | 62,7 |
| CyberGym | 88,1 | 83,3 |
| ExploitGym | 15,3 | 5,4 |
| AutomationBench | 54,8 | 43,2 |
| HLE avec outils | 63,9 | 60,0 |
| GPQA Diamond | 90,9 | 92,4 |
| HLE text-only | 36,8 | 42,7 |
Face aux concurrents fermés, le tableau reste solide : Terminal-Bench 2.1 à 90,6 contre 88,8 pour GPT-5.6 Sol et 89,1 pour Opus 5.0 ; AutomationBench à 54,8 contre 45,8 pour Sol — le meilleur score de la table officielle ; Codeforces à 3471, contre 3348 pour V4 Pro (Flowtivity). Artificial Analysis affiche un Intelligence Index de 40 (v4.3, effort max) sur sa page modèle.
Où V4.1-Flash décroche vraiment
Lisez aussi la colonne des défaites. Sur Terminal-Bench 4.0 long-horizon, V4.1-Flash plafonne à 31,2, loin derrière Opus 5 (51,8) et GPT-5.6 Sol (39,9). Opus 5 conserve l'avantage sur HLE (56,3 vs 36,8), sur Terminal-Bench 3.0/4.0 et sur tous les benchmarks vision (CodingFleet). Sur GPQA Diamond, V4-Pro reste devant (92,4 vs 90,9).
Et le biais benchmark/réel existe : MindStudio a mesuré un coût de 27 cents par tâche contre 8,75 $ et 3,26 $ chez deux concurrents, mais ses tests pratiques montrent des échecs là où les scores promettaient mieux — leur exemple du Rubik's Cube : une simulation visuellement correcte mais fonctionnellement cassée (MindStudio).
Un point de méthode : Terminal-Bench, AutomationBench ou DeepSWE mesurent des capacités agentiques, pas la qualité d'une conversation. Si vos pipelines alimentent des agents et pas un simple chatbot — deux choses que nous distinguons précisément ici — ces scores sont les bons indicateurs. Sinon, prudence. Pour le code, notre comparatif des meilleurs LLM pour coder sera mis à jour après le basculement.
Prix : divisés par 4 en input, par 3,3 en output — et encore moins hors heures pleines
Réponse directe : au tarif peak, V4.1-Flash coûte 0,30 $/1M tokens en input (cache miss) et 1,20 $/1M en output, contre 1,32 $ et 3,96 $ pour V4-Pro.
| Offre | Input /1M (cache miss) | Output /1M | Notes |
|---|---|---|---|
| V4.1-Flash — peak (API officielle) | 0,30 $ | 1,20 $ | cache hit : 0,006 $ |
| V4.1-Flash — off-peak | 0,15 $ | 0,60 $ | cache hit : 0,003 $ |
| V4.1-Flash — DeepInfra FP8 | 0,20 $ | 0,60 $ | cache read 0,006 $, tier flex à 0,8x |
| V4-Pro — peak (avant retrait) | 1,32 $ | 3,96 $ | selon TechJackSolutions |
| GPT-6 Astra | 10 $ | 50 $ | (DataCamp) |
| Claude Fable 5.1 | 10 $ | 50 $ | (DataCamp) |
Les heures pleines courent de 01h à 04h et de 06h à 10h UTC, du lundi au vendredi (TechJackSolutions) — soit, traduit en heure de Pékin, 9h-12h et 14h-18h : les heures de bureau chinoises, selon notre lecture. Hors ces créneaux, tout est moitié prix. ByteIota souligne que le cache-hit à 0,006 $ peut justifier de restructurer entièrement vos files de jobs.
Un exemple concret : un pipeline qui consomme 1 milliard de tokens input par mois en heures pleines passera d'environ 1 320 $ à 300 $, et de 3 960 $ à 1 200 $ en output. À l'échelle d'une tâche unitaire, MindStudio a mesuré 27 cents contre 8,75 $ et 3,26 $ pour deux concurrents du comparatif.
Mon avis : le prix n'est plus un argument, c'est devenu une arme. À qualité comparable sur l'agentique, un rapport de 30 à 40x avec GPT-6 Astra et Claude Fable 5.1 redéfinit ce qu'on peut se permettre de faire tourner : batch massifs, analyse de crawl, éval continues en CI.
Le vrai risque n'est pas le renommage, c'est le drift
Réponse directe : le danger n'est pas que vos appels échouent le 14, mais qu'ils réussissent — servis par un modèle différent qui dérive en silence.
C'est le point central de l'analyse de ByteIota : le vrai risque est le model drift non tracé pour les suites d'evals et les tests de régression automatisés. Comportement, latence et format de sortie peuvent changer sans aucun signal d'alerte. Trois conséquences concrètes :
- Vos evals historiques ont été passés sur V4-Pro 0813. Après le 14, l'endpoint ne sert plus ce modèle : impossible de rejouer un A/B propre. D'où l'urgence de geler une baseline avant la bascule.
- Les formats bougent. JSON structuré, tool calling : un modèle différent peut échapper différemment, omettre des champs optionnels, réordonner des clés. Vos parsers ne le sauront pas toujours.
- La verbosité change. Un swap de modèle modifie le nombre de tokens de sortie par tâche, donc votre facture et vos timeouts. Certains briefs évoquent une consommation supérieure à Claude Fable 5.1 sur ce point ; ce n'est pas confirmé par les données publiées à ce jour — mesurez-le sur vos propres charges.
N'oubliez pas l'aval non plus : si votre pipeline ingère des données crawlées ou du RAG avant d'appeler le modèle (Crawl4AI est le choix populaire pour cette étape), c'est la chaîne complète qu'il faut re-tester, pas seulement l'appel LLM.
Dernière ironie : la vitesse de 280-500 tokens/s est un progrès, mais un changement de profil de latence peut casser des timeouts calibrés au token près. Même les bonnes surprises se testent.
Checklist : 6 actions avant le 14 septembre
Réponse directe : si vous ne devez faire qu'une chose, gelez une baseline d'evals avant le 14 — ce sera votre dernière fenêtre pour comparer.
- Inventoriez vos appels aux endpoints legacy :
deepseek-v4-pro,deepseek-v4-flash,deepseek-v4-flash-vision-exp. - Gelez une baseline : faites tourner vos suites d'evals et tests de régression sur V4-Pro 0813 avant le 14. Après, il sera trop tard.
- Re-testez après la bascule, mêmes suites, mêmes seeds, et comparez : scores, latence, tokens de sortie par tâche, conformité des sorties structurées.
- Migrez explicitement vers
deepseek-flashplutôt que de garder un alias legacy qui changera encore de modèle quand V4.1 Pro sortira. - Réorganisez vos files de jobs pour tirer parti de l'off-peak (moitié prix) et du cache-hit à 0,006 $.
- Préparez un plan B pour les cas où Flash décroche : vision, raisonnement profond (HLE), tâches long-horizon. Notre guide des meilleurs LLM pour les agents passe en revue les alternatives crédibles.
Faut-il self-héberger ? Oui si vous avez les GPU, sinon restez sur l'API ou DeepInfra
Réponse directe : la licence MIT vous autorise tout, mais 552B paramètres ne rentrent pas dans un cluster de bureau — pour la plupart des équipes, l'API officielle ou un hébergeur tiers est le bon calcul.
Les poids sont disponibles sur Hugging Face et ModelScope (TechJackSolutions, CCLeaks). L'auto-hébergement achète la souveraineté des données, le fine-tuning et l'absence de rate limits — contre un parc GPU qui ne se justifie qu'à très gros volume.
L'alternative intermédiaire : DeepInfra sert deepseek-v4.1-flash en FP8 à 0,20 $/0,60 $ par 1M, avec contexte 1M, 384K de sortie max, modes thinking/non-thinking, tool calling et prompt caching, plus un tier flex à 0,8x (Requesty). Les scores mesurés (AA Index 39,5, HLE 39,2, SciCode 51,9 %) restent proches de l'API officielle.
Si votre projet tourne autour de modèles plus légers — un Qwen3.6-27B en local, par exemple — suivez notre guide pour installer un LLM local ou notre sélection des meilleurs LLM locaux. Et pour héberger l'application qui appelle l'API (backend, dashboard, webhooks), un hébergement classique type Hostinger suffit largement : ce n'est pas le modèle qu'il faut héberger, c'est votre code.
❌ Erreurs courantes
Erreur 1 : croire que « aucun changement de code » signifie « aucune action »
Le swap est silencieux par conception : vos appels aboutissent, vos tests passent — mais ils mesurent désormais autre chose. La solution : une baseline gelée avant le 14, un re-run complet après, et une comparaison explicite des écarts.
Erreur 2 : prendre les benchmarks au pied de la lettre
Un 90,6 à Terminal-Bench 2.1 ne garantit pas que votre cas d'usage passe. L'écart benchmark/réel est documenté (l'exemple du Rubik's Cube chez MindStudio). La solution : évaluer sur vos propres tâches, avec vos propres critères de réussite fonctionnelle.
Erreur 3 : ignorer les créneaux tarifaires
Lancer un batch massif entre 01h et 04h ou 06h et 10h UTC en semaine peut doubler la facture par rapport à l'off-peak. La solution : planification des jobs hors heures pleines et prompt caching systématique — le cache-hit à 0,006 $ est quasi gratuit.
Erreur 4 : attendre le 15 septembre pour réagir
Il n'y a pas de fenêtre de migration parallèle : après le 14, plus aucun A/B possible contre V4-Pro 0813, retiré. La solution : agir cette semaine, en commençant par l'inventaire des endpoints legacy et le gel de baseline.
❓ Questions fréquentes
Mes appels à deepseek-v4-pro vont-ils planter le 14 septembre ?
Non. Les requêtes continuent d'aboutir, mais elles sont servies par V4.1-Flash et facturées aux tarifs Flash. C'est précisément le problème : aucune erreur visible, mais un modèle différent derrière. D'où l'importance de re-tester vos pipelines plutôt que de vous fier aux seuls codes de retour HTTP.
Vais-je payer moins cher sans rien faire ?
Oui. Le basculement s'accompagne des tarifs Flash : environ 4x moins cher en input et 3,3x en output au tarif peak, et moitié prix hors heures pleines. La baisse est automatique, sans modification de compte, de code ou de contrat. Vérifiez simplement vos seuils d'alerte budgétaire.
V4.1-Flash remplace-t-il V4-Pro définitivement ?
Non, temporairement. DeepSeek route deepseek-v4-pro vers V4.1-Flash jusqu'à la sortie de V4.1 Pro. Autrement dit, votre endpoint changera encore de modèle sous-jacent dans les mois qui viennent — une raison de plus pour migrer explicitement vers deepseek-flash dès maintenant.
V4.1-Flash est-il bon en vision ?
Moyen. L'entrée d'images est native, mais Claude Opus 5 conserve l'avantage sur l'ensemble des benchmarks vision selon CodingFleet. Pour de l'analyse d'images exigeante, gardez un modèle spécialisé ; pour du texte, du code et de l'agentique, V4.1-Flash est très compétitif.
Que devient l'ancien deepseek-v4-flash ?
Il a été retiré avec environ un jour de préavis, tout comme deepseek-v4-flash-vision-exp. Le nouveau modèle est servi sous l'ID deepseek-flash. Si vous appeliez encore l'ancien ID, vos appels échouent déjà — un rappel que DeepSeek n'offre pas de longues fenêtres de dépréciation.
✅ Conclusion
DeepSeek vient de poser un jalon rare : un modèle open-weight sous MIT qui remplace un flagship fermé derrière le même endpoint, 4x moins cher et meilleur sur l'essentiel des benchmarks agentiques — à condition de re-tester vos pipelines avant que le swap ne devienne votre problème de production. Faites tourner vos evals cette semaine, puis replacez V4.1-Flash dans la hiérarchie avec notre comparatif mensuel des meilleurs LLM.