📑 Table des matières

Les modèles ouverts tournent déjà 56 % des tokens de Vercel : la migration silencieuse des entreprises hors d'OpenAI et Anthropic

Actu IA 🟢 Débutant ⏱️ 14 min de lecture 📅 2026-09-28

Les modèles ouverts tournent déjà 56 % des tokens de Vercel : la migration silencieuse des entreprises hors d'OpenAI et Anthropic

🔎 Le crossover a eu lieu, sans annonce

Il n'y a pas eu de keynote, pas de tweet viral, pas de baisse de prix spectaculaire. Pourtant, quelque chose s'est renversé cet été dans l'infrastructure IA américaine : en août 2026, les modèles open-weight ont exécuté 56 % du volume de tokens sur l'AI Gateway de Vercel, contre moins de 10 % en décembre 2025. Le pic a atteint 62 % le 22 août, selon le Production Index de l'AI Gateway de Vercel publié le 17 septembre.

Le Financial Times a confirmé le mouvement côté entreprises. Les mentions de modèles « open » ou « open weight » dans les earnings calls et conférences investisseurs américains ont été multipliées par six en un an (données AlphaSense, août-septembre 2026). Et ce ne sont pas des startups en mode bootstrap : AT&T fait tourner environ 40 % de ses workloads IA sur des modèles ouverts, avec un objectif de 70 % d'ici un an.

Ce qui se joue ici n'est pas un débat idéologique sur l'open source. C'est un arbitrage économique brut. Un token fermé coûte en moyenne 7,8 fois plus cher qu'un token ouvert. Les DSI l'ont compris, et ils réécrivent leurs architectures en conséquence.


L'essentiel

  • 56 % des tokens de production sur l'AI Gateway de Vercel sont désormais exécutés par des modèles ouverts (août 2026), contre 7 % du volume un an plus tôt et moins de 10 % en décembre 2025.
  • AT&T fait tourner ~40 % de ses workloads IA sur des modèles ouverts (Llama, Gemma, Nemotron), avec des économies de 80 à 90 % sur certaines applications selon le WSJ.
  • Le routage intelligent paye : chez AT&T, le routage vers des modèles ouverts a réduit les coûts de code jusqu'à 56 % pour seulement ~2 % de baisse de qualité.
  • La Chine profite du mouvement : Llama, Qwen (Alibaba), GLM (Z.ai) et DeepSeek captent une part croissante du volume. L'écart de capacité avec les modèles fermés est tombé à ~3,3 % (Mozilla, 2026).
  • Mais l'argent reste fermé : les modèles ouverts ne représentent que 14 % de la dépense estimée. Anthropic capte encore 64 % des dollars d'août.
  • Signal prix : OpenAI a baissé les tarifs de GPT-5.6 Luna jusqu'à 80 %, Anthropic pousse Opus 5 à moitié prix. La pression tarifaire ne fait que commencer.

Outils recommandés

Outil Usage principal Prix (septembre 2026, vérifiez sur le site officiel) Idéal pour
Vercel AI Gateway Routage multi-modèles, index de production Pay-as-you-go, sans marge sur les tokens Équipes qui veulent tester les modèles ouverts sans changer d'infra
Hugging Face Hébergement et déploiement de poids ouverts Gratuit + plans Inference payants Self-hosting de Llama, Qwen, GLM
LiteLLM Proxy/routeur open source entre modèles Open source, gratuit Le routeur utilisé par AT&T pour scorer les requêtes
OpenRouter Accès API unifié à des centaines de modèles Pay-per-token, commission ~5 % Comparer en production modèles ouverts et fermés
Hostinger Hébergement VPS pour auto-héberger vos modèles ouverts À partir de quelques dollars/mois (septembre 2026) Développeurs qui veulent garder le contrôle total de leurs données

Pourquoi maintenant ? Le chiffre qui change la conversation

Le basculement n'est pas arrivé parce que les modèles ouverts sont devenus « assez bons » un matin. Il est arrivé parce que trois courbes se sont croisées.

Première courbe : le volume. D'après les données historiques de Vercel, les modèles ouverts exécutaient 11 % des tokens en avril 2026, 29 % en juin, 36 % en juillet, 56 % en août. Ce n'est plus une tendance, c'est une trajectoire exponentielle. Saanya Ojha note que le leaderboard live du 18 septembre affichait même ~78 % de tokens ouverts, et que Moonshot et DeepSeek se hissaient à la 3e et 4e place en dépense — devant OpenAI si l'on ajoute Z.ai au groupe.

Deuxième courbe : la qualité. Le rapport Mozilla « State of Open-Source AI 2026 » mesure l'écart de capacité entre les meilleurs modèles ouverts et fermés à environ 3,3 %. Parité quasi atteinte sur le code, le suivi d'instructions et les connaissances générales. Quand l'écart était de 20 points, la prime au fermier se justifiait. À 3 points, elle devient indéfendable pour 90 % des cas d'usage.

Troisième courbe : le prix. Le token fermé coûte ~7,8× le token ouvert en moyenne sur la gateway. Le prix moyen du token a baissé de 23,2 % en août seul. Les modèles chinois tournent 60 à 90 % moins cher qu'OpenAI ou Anthropic selon l'analyse StartupFortune.

Ces données croisent d'ailleurs avec notre enquête sur les 46% des tokens IA des entreprises américaines partis vers des modèles chinois, publiée fin septembre : la part des tokens US sur des modèles chinois via OpenRouter est restée au-dessus de 30 % chaque semaine depuis le 8 février, avec un pic à 46 %.


AT&T, l'étude de cas que tout le monde regarde — Réponse directe

AT&T démontre qu'on peut déplacer 40 % de ses workloads IA vers l'open sans dégrader l'expérience utilisateur — et que le secret n'est pas le modèle, c'est le routage.

Le géant des télécoms ne remplace pas Claude ou GPT par un modèle unique. Il utilise LiteLLM, un routeur open source, qui score la difficulté de chaque requête. Les questions simples (et ce sont la grande majorité) partent vers des modèles ouverts : Llama de Meta, Gemma de Google, Nemotron de Nvidia. Le code complexe reste sur un modèle frontier.

Les résultats, rapportés par le Wall Street Journal :

Métrique Résultat chez AT&T
Part des workloads IA sur modèles ouverts ~40 % (cible 70 %)
Employés couverts par Ask AT&T ~100 000
Économies sur certaines applications 80 à 90 % (source WSJ)
Réduction des coûts sur le code Jusqu'à 56 %
Baisse de qualité mesurée ~2 %

Andy Markus, chief data & AI officer d'AT&T, résume l'état d'esprit : les modèles ouverts tunés avec les données propriétaires de l'entreprise performent « aussi bien voire mieux » que les alternatives fermées sur des tâches spécifiques. Et il ajoute, dans le FT : « The open models are getting better and better. »


Le paradoxe du volume : 56 % des tokens, 14 % des dollars

Voici le point le plus mal compris de toute l'histoire, et celui qui évitera les mauvaises décisions stratégiques.

Les modèles ouverts gagnent en volume, mais pas (encore) en valeur. En août 2026, ils représentent 56 % des tokens de production mais seulement 14 % de la dépense estimée. Les quatre grands labs américains frontier captaient encore l'essentiel des dollars, avec Anthropic à 64 % de la dépense du mois.

Pourquoi ? Trois raisons structurelles.

Le frontier garde une prime. Pour les tâches à très haute valeur — raisonnement agentique complexe, code critique — les entreprises paient encore volontiers pour le meilleur modèle disponible. Le leaderboard agentic 2026 le montre : GPT-5.5 d'OpenAI (98,2) et Gemini 3 Pro Deep Think de Google (95,4) restent devant les meilleurs modèles self-hostés comme Kimi K2.6 de Moonshot (88,1) ou GLM-5 Reasoning de Z.AI (82).

L'usage n'est pas homogène. 80 % des requêtes sont simples et routables vers l'open. Les 20 % restants concentrent la valeur — et une grosse partie du budget.

L'infrastructure traîne. Guillermo Rauch, CEO de Vercel, le résume bien : « This is very likely just the start, because enterprise adoption is still early, and harnesses, CLIs, IDEs, SDKs, etc. need to be adapted to be model-agnostic. » Les outils doivent encore devenir model-agnostic.

Mais la dynamique interne aux labs fermés est déjà brutale. Chez Anthropic, la part de dépense de Fable 5 (le modèle le plus capable) est tombée de 13,2 % à 4,9 % en un mois, pendant qu'Opus 5 — environ moitié prix — montait à 22,5 %. Neuf équipes sur dix utilisant Fable ont réduit son usage. Même chez les clients fidèles, on descend en gamme dès que la qualité le permet.


La vague chinoise : Llama n'est plus le seul cheval

Le mouvement open-weight n'est plus un phénomène Meta. La dépense d'inférence glisse structurellement vers trois familles chinoises : Qwen (Alibaba), GLM (Z.ai) et DeepSeek.

Les chiffres du rapport Vercel de juillet le montraient déjà : DeepSeek atteignait 22,6 % du volume de tokens sur la gateway (3e position, à moins de deux points de Google), et GLM 5.2 — sous licence MIT, à environ un cinquième du prix d'Opus 4.8 — voyait son volume quotidien multiplié par ~50 en deux semaines après l'ouverture de son API.

L'écosystème suit. Les modèles ouverts chinois cumulent 3,2 milliards de téléchargements sur Hugging Face, environ le double du total américain. Le trafic des modèles ouverts sur OpenRouter est passé de ~1 trillion de tokens par semaine il y a un an à ~80 trillions.

Ce n'est pas un accident si GLM et Qwen ont sorti deux modèles flash le même jour : les labos chinois ont compris que la bataille se joue sur le ratio prix/performance en production, pas sur les benchmarks de démonstration. Dans la même veine, DeepSeek V4.1 Flash et son architecture optimisée pour réduire le KV cache d'un quart illustre la course à l'efficience qui rend ces modèles si compétitifs en coût d'inférence. Et MiniMax M3, avec son contexte d'1M de tokens, attaque frontalement les cas d'usage longs où les modèles propriétaires facturent le plus cher.

Pour être factuel : ce déplacement vers des modèles chinois soulève des vraies questions de souveraineté et de conformité pour les entreprises régulées. C'est précisément ce que documente notre enquête CNBC sur les tokens américains partant vers la Chine — et c'est aussi pourquoi OpenAI, Google, Microsoft, Anthropic et plus de 100 entreprises ont signé un appel collectif inédit alertant sur une vague de cyberattaques IA imminente : la sécurisation des modèles et de la chaîne d'approvisionnement IA devient un sujet de board, pas seulement d'IT.


Ce que ça change pour vos prix d'API — Réponse directe

La pression sur les tarifs des modèles fermés est déjà visible, et elle va s'accentuer. Si vous négociez un contrat d'API frontier sans exploiter la concurrence ouverte, vous payez trop cher.

Les réactions tarifaires sont documentées :

  • OpenAI a baissé les prix de GPT-5.6 Luna jusqu'à 80 % selon le type de tokens — une réponse directe à l'hémorragie de volume.
  • Anthropic commercialise désormais Opus 5 à la moitié du prix de la génération précédente, après avoir vu Fable 5 s'effondrer dans ses propres chiffres de dépense.
  • Le prix moyen du token sur la gateway Vercel a baissé de 23,2 % en août seul. Chez les équipes dépassant 10 millions de tokens, la médiane a baissé de 7,6 % en un mois (contre 2,9 % en juillet).

Pour les équipes qui veulent garder le meilleur des deux mondes, l'architecture gagnante en 2026 ressemble à celle d'AT&T : un routeur qui envoie les requêtes triviales vers des modèles ouverts à bas coût, et réserve le frontier pour ce qui le mérite. C'est exactement ce que fait le classement agentic 2026 avec des modèles comme GPT-5.3 Codex d'OpenAI ou Claude Sonnet 4.6 pour le code, tout en laissant Llama et Qwen absorber le volume.

Guillermo Rauch résume le moment : « This is very likely just the start, because enterprise adoption is still early. » Traduit : les tarifs actuels des API fermées ne sont pas un plancher, c'est un plafond provisoire.


Comment tester la migration sans tout casser

Pas besoin de tout miser sur les modèles ouverts du jour au lendemain. La méthode des entreprises qui réussissent tient en quatre étapes.

1. Classifiez vos requêtes. Loggez un mois de trafic et catégorisez : questions simples, RAG, code, raisonnement complexe. Chez la plupart des applications, les requêtes triviales dominent largement.

2. Benchmarkez sur VOS données. Les benchmarks publics ne suffisent pas. AT&T tune ses modèles ouverts avec ses données propriétaires et constate qu'ils performent « aussi bien voire mieux » que les fermés sur ses tâches spécifiques. Votre kilométrage dépendra de votre domaine.

3. Routez, ne remplacez pas. Utilisez un routeur (LiteLLM, ou une gateway type Vercel) qui score la difficulté de chaque requête. Gardez une porte de secours vers un modèle frontier.

4. Mesurez le ratio qualité/prix, pas la qualité seule. Une baisse de 2 % de qualité pour 56 % d'économie, c'est un trade que la plupart des produits peuvent accepter. Une baisse de 2 % sur un workflow juridique critique, peut-être pas. C'est une décision produit, pas une décision d'architecte.

Pour les équipes qui veulent auto-héberger (conformité, données sensibles, absence de dépendance à un fournisseur), des modèles comme Kimi K2.6 en self-host ou GLM-5 Reasoning de Z.AI sont dans le top 15 du leaderboard agentic 2026 — une offre d'hébergement type VPS suffit pour démarrer sur des volumes de test.


❌ Erreurs courantes

Erreur 1 : Confondre tokens et dépense

Le titre « 56 % des tokens » laisse croire que les modèles ouverts dominent le marché. Faux : ils ne représentent que 14 % de la dépense estimée. Si vous pilotez un budget IA, regardez toujours les deux courbes. Un token fermé coûte ~7,8× un token ouvert — la conversion volume → valeur n'est pas automatique.

Erreur 2 : Basculer 100 % du trafic sur l'open « parce que c'est moins cher »

Les économies d'AT&T viennent du routage, pas du remplacement. Le code complexe reste sur un modèle frontier. Les équipes qui basculent tout perdent en qualité là où ça compte, puis font marche arrière en perte de crédibilité interne.

Erreur 3 : Benchmarquer sur des datasets publics

Votre application n'est pas MMLU. Un modèle ouvert peut être excellent sur le RAG produit et médiocre sur votre format de sortie JSON. Testez sur vos données réelles, avec vos critères d'évaluation, avant de décider.

Erreur 4 : Négliger la gouvernance des modèles chinois

Qwen, GLM et DeepSeek sont excellents et bon marché, mais ils posent des questions de conformité (données, juridiction, licences) selon votre secteur. L'approche saine : modéliser le risque comme pour tout fournisseur tiers, et garder la possibilité de swap.


❓ Questions fréquentes

Les modèles ouverts sont-ils vraiment au niveau des modèles fermés ?

Sur les tâches courantes, quasi oui : l'écart mesuré par Mozilla en 2026 est de ~3,3 %, avec parité sur le code et le suivi d'instructions. Le frontier conserve un avantage sur le raisonnement agentique très complexe, mais cet avantage se resserre chaque trimestre.

Faut-il quitter OpenAI et Anthropic maintenant ?

Non, il faut router. Gardez un modèle frontier pour les tâches à haute valeur et envoyez le volume trivial vers l'open. C'est exactement ce que font AT&T et la plupart des équipes matures — et c'est là que se trouvent les économies de 50 à 90 %.

Les modèles ouverts chinois sont-ils sûrs pour un usage entreprise ?

C'est une question de gouvernance, pas de dogme. Vérifiez la licence (MIT pour GLM, par exemple), la juridiction d'hébergement, et la possibilité de self-hosting. Les poids ouverts permettent d'héberger chez vous, ce que les modèles fermés ne permettent pas.

Que signifie ce mouvement pour les prix des API ?

Une pression baissière structurelle. OpenAI a déjà baissé GPT-5.6 Luna jusqu'à 80 %, Anthropic a réduit Opus 5 de moitié. Le prix moyen du token sur Vercel a chuté de 23,2 % en août. Le frontier deviendra un produit premium à forte marge, le reste une commodity.

Vercel AI Gateway est-il représentatif du marché ?

C'est un proxy, pas un recensement. Mais les dizaines de trillions de tokens mensuels, la corroboration par les earnings calls (FT/AlphaSense) et les cas AT&T/Coinbase rendent la tendance difficile à contester.


✅ Conclusion

Le basculement vers les modèles ouverts n'est plus une thèse, c'est un fait mesuré : 56 % des tokens de production sur Vercel, x6 dans les earnings calls, 40 % des workloads d'AT&T — et des économies qui se comptent en dizaines de pourcents. La vraie question de 2026 n'est pas « open ou fermé ? » mais « quel pourcentage de mon trafic mérite-t-il vraiment de payer 7,8× plus cher ? ». Si vous n'avez pas encore mis en place de routage multi-modèles, c'est le chantier à ouvrir ce trimestre — et si le sujet vous intéresse, notre décryptage du rapport Vercel de juillet détaille la trajectoire complète.