Clef et Clef-flash : Cloudflare sort ses premiers modèles maison — des modèles de décision pour les agents, pas des chatbots
🔎 Un CDN qui entraîne ses propres modèles : l'annonce à ne pas survoler
Le 1er octobre 2026, en pleine Birthday Week, Cloudflare a franchi une ligne qu'aucun acteur de l'infra n'avait franchie jusque-là : publier ses premiers modèles entraînés par sa propre équipe Workers AI. Ils s'appellent Clef et Clef-flash. Et non, ce ne sont pas des chatbots de plus.
Ce sont des « decision models » : des modèles qui ne génèrent aucun texte. On leur donne un état (texte, JSON, images ou vidéo) et un schéma de questions typées — oui/non, choix parmi une liste, score — et ils retournent une probabilité pour chaque option autorisée. Leur unique job : décider comment un agent logiciel agit, à la milliseconde.
Le timing n'a rien d'anodin. La vague des modèles de décision System 1 — Laya, Kev, DeepOpen — prend de l'ampleur depuis quelques mois, portée par de petites équipes open source. Avec Clef, c'est un géant de l'infra, présent dans des millions de projets, qui y met sa puissance de feu. Selon le briefing d'AI News Online, c'est l'un des mouvements les plus stratégiques de cette rentrée. Pour quiconque construit des agents, c'est une pièce d'architecture qui vient de changer de statut : elle passe du projet GitHub confidentiel au catalogue d'un fournisseur mondial.
L'essentiel
- Clef (27 milliards de paramètres, backbone Qwen3.8-27B) et Clef-flash (9 milliards, Qwen3.5-9B) : les premiers modèles entraînés maison par Cloudflare, sortis le 1er octobre 2026 pendant la Birthday Week.
- Des decision models, pas des LLM : zéro génération de texte. Un état en entrée, des questions typées, une probabilité par option en sortie.
- Poids ouverts sous Apache 2.0 sur Hugging Face, inférence sur les GPU edge de Cloudflare.
- Prix : 0,24 $ par million de tokens d'entrée pour Clef, 0,09 $ pour Clef-flash — tokens de sortie non facturés (octobre 2026, vérifiez sur cloudflare.com).
- Chiffres annoncés par Cloudflare : macro-F1 de 94,20 sur BANKING77 contre 79,74 pour Jev (Typesafe AI) ; latence médiane de 38,8 ms pour Clef-flash contre 524,1 ms pour Jev.
- Compatibilité API Jev : un chemin de migration prévu pour l'écosystème existant.
- Un service de fine-tuning RL self-serve accompagne la sortie, bâti sur AI Gateway, Containers et un nouveau composant Trainer.
Outils recommandés
| Outil | Usage principal | Prix (octobre 2026) | Idéal pour |
|---|---|---|---|
| Clef sur Workers AI | Décisions multimodales (texte, JSON, images, vidéo), contexte 64k | 0,24 $/M tokens d'entrée, sortie non facturée (vérifiez sur cloudflare.com) | Agents complexes avec état riche |
| Clef-flash sur Workers AI | Décisions ultra-rapides, modèle 9B | 0,09 $/M tokens d'entrée (vérifiez sur cloudflare.com) | Arbitrage haute fréquence, chemins critiques en latence |
| Poids Clef sur Hugging Face | Self-host, audit, fine-tuning maison | Gratuit (Apache 2.0) | Équipes qui veulent garder le contrôle |
| Jev (Typesafe AI) | Decision model de référence du marché | n.d. (voir site de l'éditeur) | Comparaison et migration |
| Hostinger | Hébergement de l'orchestrateur et de la stack agentique | VPS dès ~5 $/mois (oct. 2026, vérifiez sur hostinger.com) | Déployer vos agents hors des hyperscalers |
C'est quoi un « decision model », exactement ?
Un decision model ne rédige rien : il tranche. Là où un LLM comme GPT-5.5 ou Claude Opus 4.7 produit du texte token par token, Clef score des options. Vous lui donnez un état du monde et une liste de questions typées ; il vous rend, pour chaque question, une probabilité par option autorisée. Rien d'autre — et c'est précisément ça qui fait sa valeur.
Concrètement, l'entrée peut être un texte, du JSON, des images ou de la vidéo. Le schéma de questions est typé : booléen (escalader ce ticket ?), choix unique (rembourser, demander une information, clôturer), score (niveau de confiance entre 0 et 1). En sortie : des probabilités exploitables par du code classique — seuils, règles, logs, audit. Plus de prose à parser, plus de risque qu'un « oui » se transforme en paragraphe ambigu.
L'astuce technique : du prefill-only, pas de la génération
Sous le capot, Clef n'est pas autoregressif. L'approche dite « prefill-only » score les options au lieu de les générer : pas de décodage séquentiel, donc pas de latence qui s'accumule token après token. C'est ce qui explique à la fois la vitesse et la facture — les tokens de sortie ne sont pas facturés, tout simplement parce qu'il n'y en a pas.
Le nom lui-même résume la philosophie. Cloudflare l'explique sans détour : « A decision model is analogous to a music clef because it helps define the domain of the context and the subsequent notes (actions) that follow it ». La clef définit le contexte ; les notes — les actions de l'agent — suivent.
Un exemple concret
Prenons un agent de support client. À chaque étape, il interroge Clef avec l'historique de conversation et une capture d'écran, puis trois questions typées : « escalader à un humain ? » (oui/non), « priorité ? » (basse/moyenne/haute), « prochaine action ? » (rembourser/demander une pièce/clôturer). L'orchestrateur lit les probabilités, applique un seuil, journalise la décision. Aucune hallucination possible dans la boucle de contrôle — exactement ce qu'on attend d'un agent en production.
Les chiffres annoncés — et comment les lire
Ils sont impressionnants sur le papier — et ils viennent du vendor lui-même. Cloudflare affirme que Clef bat gpt-oss-120b et le modèle Jev de Typesafe AI en précision et en latence sur des dizaines de benchmarks. Les chiffres publics les plus parlants portent sur deux axes.
| Métrique | Clef (27B) | Clef-flash (9B) | Jev (Typesafe) |
|---|---|---|---|
| Backbone | Qwen3.8-27B | Qwen3.5-9B | n.d. |
| Fenêtre de contexte | 64k tokens | n.d. | n.d. |
| Macro-F1 (BANKING77) | 94,20 | n.d. | 79,74 |
| Latence médiane | n.d. | 38,8 ms | 524,1 ms |
| Latence p95 | n.d. | 122,4 ms | 536,0 ms |
| Prix entrée (/M tokens) | 0,24 $ | 0,09 $ | n.d. |
Deux lectures s'imposent. Sur la précision, l'écart sur BANKING77 — un jeu de classification d'intentions bancaires, proche de l'usage visé — est massif : 94,20 contre 79,74 de macro-F1 pour Clef. Sur la latence, Clef-flash est annoncé environ 13 fois plus rapide que Jev en médiane (38,8 ms contre 524,1 ms), et l'écart tient même au p95 (122,4 ms contre 536,0 ms), d'après AI Weekly. Clef-flash est d'ailleurs explicitement positionné pour les chemins critiques en latence.
Le recul qui s'impose
Gardez un œil froid : ces chiffres sont publiés par Cloudflare, sur son propre matériel. BANKING77 est un excellent proxy pour des questions typées, mais ce n'est pas un benchmark agentique de bout en bout. Et « des dizaines de benchmarks » sans publication détaillée, ça se vérifie. La bonne pratique : attendre une réplication indépendante, et surtout tester sur vos propres traces d'agents. Cryptobriefing rappelle que l'inférence tourne sur les GPU edge de Cloudflare — un contexte matériel difficile à comparer directement avec celui des autres acteurs du marché.
Pourquoi un CDN se met-il à entraîner des modèles ?
Parce que la latence, c'est son métier — et que les decision models sont le workload parfait pour l'edge. Un modèle de 27 ou 9 milliards de paramètres tient sur les GPU que Cloudflare a déjà déployés dans ses datacenters pour Workers AI. Pas besoin de clusters massifs : besoin de proximité avec l'utilisateur.
L'argument économique est tangible. Un agent qui prend des centaines de décisions par minute ne peut pas se payer 500 ms d'aller-retour vers un hyperscaler à chaque appel. À 38,8 ms de latence médiane au bord du réseau, Clef-flash rend viable un pattern qu'aucun LLM généraliste ne permet : interroger le modèle de décision à chaque étape, systématiquement, sans y réfléchir.
Il y a aussi une logique de plateforme évidente. La sortie s'accompagne d'un service self-serve de fine-tuning par renforcement, bâti sur AI Gateway, Containers et un nouveau composant Trainer : vous partez de vos traces, vous entraînez, et le modèle ajusté est redéployé sur Workers AI. La boucle données → fine-tune → inférence reste entièrement chez Cloudflare. C'est du lock-in, mais du lock-in utile — et c'est exactement le type de boucle qui fidélise les équipes.
Cloudflare vendait la bande passante du web, puis celle des applications ; avec Clef, elle vend les décisions des agents. Qui héberge les décisions héberge les agents. Ce n'est pas une expérience de laboratoire : c'est un positionnement business assumé, et la Birthday Week n'a servi que de vitrine.
La vague System 1 gagne un poids lourd de l'infra
Clef n'arrive pas dans un désert. Depuis quelques mois, une famille de modèles de décision System 1 se structure : Laya, un decision model open source de 421M de paramètres, Kev, la famille de modèles de décision System 1 open source publiée par Jared Palmer, ou encore DeepOpen. Des modèles petits, rapides, spécialisés dans le tranchage — pas dans la rédaction.
La réaction de hwchase17, relayée par daily.dev, résume l'ambiance : « decision model season ». Quand le créateur de LangChain parle de saison, c'est qu'il voit un pattern se généraliser à grande vitesse.
Ce que Cloudflare apporte à ce mouvement, c'est le canal. Laya et Kev ont les idées et les poids ; Cloudflare a des millions de développeurs déjà sur Workers, une infra edge mondiale, des tarifs affichés et du fine-tuning managé. Historiquement, ce sont ces distributions-là qui transforment une niche en standard d'industrie.
Mon avis : le découplage génération/décision va devenir un pattern d'architecture par défaut pour les agents en 2026. Le gros LLM (GPT-5.5, Gemini 3.1 Pro, Claude Opus 4.7) rédige et raisonne ; le decision model (Clef, Laya, Kev) arbitre. Deux modèles, deux budgets, deux profils de latence. Ceux qui conçoivent encore leurs agents comme un unique appel LLM géant vont devoir repenser leur stack — et probablement y gagner en fiabilité comme en coût.
Open weights, multimodal, et la guerre des prix en arrière-plan
Clef se télécharge. Les poids sont ouverts sous Apache 2.0 sur Hugging Face, ce qui autorise self-host, audit et fine-tuning maison. Un choix qui tranche avec le climat réglementaire américain actuel — la Maison Blanche pousse désormais pour vérifier les modèles IA avant leur sortie — et qui dit beaucoup sur la direction du marché : l'ouverture gagne d'abord les petits modèles spécialisés, pas les frontiers models.
Côté capacités, Clef lit l'état en texte, JSON, images ou vidéo, avec un encodeur vision limité à 4 images par requête et une fenêtre de contexte de 64k tokens. De quoi nourrir le modèle avec l'état réel d'un agent — captures d'écran, logs structurés, historique compressé — sans construire un pipeline de prétraitement lourd.
Et le prix s'inscrit dans la bataille en cours. 0,24 $ et 0,09 $ par million de tokens d'entrée, c'est le territoire des modèles flash, là où DeepSeek V4 se décline désormais en Pro et Flash et où GLM-5.3-Flash et Qwen3.8-Flash-Next sont sortis le même jour. Ironie savoureuse : Clef tourne sur un backbone Qwen3.8 — la famille de modèles qui mène justement cette guerre des prix.
Détail qui compte pour les budgets : comme Clef ne génère rien, les tokens de sortie ne sont pas facturés. La facture d'un agent qui décide 500 fois par minute devient prévisible, bornée par le volume d'entrée. C'est un luxe qu'aucun LLM génératif n'offre, et un argument de plus pour sortir les décisions de la boucle générative.
Comment tester Clef dès aujourd'hui
Deux chemins principaux, selon votre degré de contrôle — et une troisième voie pour les équipes exigeantes.
Le plus rapide : Workers AI. La documentation officielle liste Clef et Clef-flash parmi les modèles disponibles. Vous activez Workers AI, vous appelez le modèle avec votre état et votre schéma de questions typées, vous récupérez des probabilités. Si vous venez de l'écosystème Typesafe, la compatibilité API Jev est prévue : changement de endpoint, pas réécriture du code.
Le plus souverain : les poids. Sur Hugging Face, sous Apache 2.0. Comptez un GPU sérieux pour Clef (27B) ; Clef-flash (9B) passe sur des configurations plus modestes. Votre orchestrateur, lui, n'a besoin que d'un VPS — Hostinger fait très bien l'affaire pour la stack qui entoure le modèle (prix à vérifier sur hostinger.com). Et si vous faites tourner vos agents en local, notre guide sur les agents IA avec Ollama vous montrera comment brancher une instance self-hostée de Clef-flash dans votre chaîne de décision.
Le plus poussé : le fine-tuning RL. Le service self-serve de Cloudflare (AI Gateway + Containers + Trainer) prend vos traces, entraîne par renforcement, puis redéploie le modèle ajusté sur Workers AI. C'est la voie royale si vos décisions ont des spécificités métier que le modèle de base ne capte pas — et c'est le vrai produit derrière l'annonce.
Un rappel d'architecture avant de foncer : Clef décide, il ne génère pas. Le choix du modèle qui rédige et raisonne reste un problème séparé — notre comparatif des meilleurs LLM pour les agents IA vous aide à le trancher.
❌ Erreurs courantes
Erreur 1 : utiliser Clef comme un petit LLM
Clef ne résume pas, ne rédige pas, ne répond pas à des questions ouvertes. L'utiliser pour générer du texte, c'est casser son seul avantage : la vitesse et le prix. La solution : séparez les rôles. Génération et raisonnement chez les gros modèles (GPT-5.5, Claude Opus 4.7, Gemini 3.1 Pro) ; décisions typées chez Clef.
Erreur 2 : avaler les benchmarks du vendor
Les chiffres (94,20 de macro-F1, 38,8 ms de latence) sont annoncés par Cloudflare elle-même, sur ses propres GPU. BANKING77 est un proxy de classification, pas un test agentique de bout en bout. La solution : évaluez sur vos propres traces d'agents avant de migrer quoi que ce soit, et surveillez les réplications indépendantes qui ne manqueront pas d'arriver.
Erreur 3 : confondre latence modèle et latence pipeline
38,8 ms, c'est l'inférence du modèle au bord du réseau Cloudflare. Votre agent, lui, additionne le réseau, l'orchestration, les appels au LLM principal et à vos outils. La solution : mesurez le p95 de votre pipeline complet, pas celui du modèle isolé — c'est le seul chiffre que vos utilisateurs ressentent.
Erreur 4 : dépasser les limites d'entrée
Encodeur vision limité à 4 images par requête, contexte de 64k tokens : on ne balance pas trois heures d'historique brut et vingt captures d'écran. La solution : compressez et structurez l'état avant l'appel. C'est précisément ce que Clef est conçu pour lire efficacement — à vous de lui donner du propre, pas du brut.
❓ Questions fréquentes
Clef est-il gratuit ?
Les poids sont gratuits et open source (Apache 2.0) sur Hugging Face, donc le self-host ne coûte que l'infra. Sur l'infrastructure Cloudflare, l'usage est facturé : 0,24 $ par million de tokens d'entrée pour Clef, 0,09 $ pour Clef-flash, tokens de sortie non facturés (octobre 2026, vérifiez sur cloudflare.com).
Peut-il remplacer GPT-5.5 ou Claude ?
Non, et ce n'est pas son but. Clef répond à des questions typées avec des probabilités ; il ne génère pas de texte et ne raisonne pas en langage naturel. L'architecture gagnante combine les deux : un gros modèle pour rédiger et raisonner, Clef pour arbitrer vite et pas cher à chaque étape de l'agent.
Quelle différence avec Jev de Typesafe AI ?
Même principe — des decision models qui scorent des options — et compatibilité API entre les deux. Cloudflare affirme une précision supérieure (macro-F1 de 94,20 contre 79,74 sur BANKING77) et une latence très inférieure (38,8 ms contre 524,1 ms en médiane pour Clef-flash). Ces chiffres restent vendor-side : confrontez-les à vos propres tests.
Peut-on le fine-tuner sur ses propres données ?
Oui, par deux voies. Le service self-serve de Cloudflare entraîne le modèle par renforcement à partir de vos traces (via AI Gateway, Containers et le composant Trainer), puis le redéploie sur Workers AI. Ou bien vous téléchargez les poids Apache 2.0 et montez votre propre pipeline de fine-tuning, en toute indépendance.
Pourquoi ce nom « Clef » ?
Cloudflare assume la métaphore musicale : « a decision model is analogous to a music clef because it helps define the domain of the context and the subsequent notes (actions) that follow it ». La clef fixe le contexte ; les notes — les actions de l'agent — en découlent. Clef-flash, la version rapide 9B, suit exactement la même logique.
✅ Conclusion
Avec Clef et Clef-flash, Cloudflare ne cherche pas à concurrencer GPT-5.5 : elle veut devenir l'endroit où les agents prennent leurs décisions — vite, pas cher, au bord du réseau, et en poids ouverts. Si vous construisez des agents, testez le pattern décision/génération dès cette semaine, et parcourez notre sélection des meilleurs agents IA autonomes pour voir ce qui se fait déjà côté outils.