Annonce et contexte

Le 1er octobre 2026, Cloudflare a dévoilé Clef et Clef-flash, ses deux premiers modèles entraînés en interne par l’équipe Workers AI, via un billet du blog officiel intitulé « Introducing Clef: our open-source decision models, and new RL fine-tuning platform », publié pendant la Birthday Week 2026. Il ne s’agit pas de grands modèles de langage : Clef est un « decision model », une catégorie popularisée le 15/09/2026 par Jev de TypeSafe AI — au lieu de générer du texte, le modèle reçoit un état (un ticket support, une page web, une trace d’agent) et un jeu de questions typées, puis renvoie des probabilités calibrées sur des réponses prédéfinies.

La promesse officielle, selon Cloudflare : produire « des sorties structurées bornées, à moindre coût, rapidement et de façon cohérente, que l’on peut brancher dans un workflow dès qu’une décision est requise ». Le lancement tombe en pleine effervescence : le même 1er octobre, AWS (Strands Decider 2B), Perplexity (Decisions API) et Fastino Labs (GLiDE) ont tous annoncé leur propre modèle de décision, deux jours après l’ouverture en préversion limitée de l’API Decisions d’OpenAI. Clef se distingue d’emblée sur un point : les poids sont publiés en open source sous licence Apache 2.0, et le modèle est nativement compatible avec l’API de Jev — un simple changement d’endpoint suffit pour migrer.

Découvrir Clef
Lien officiel

Fiche technique

Caractéristique Valeur
Éditeur Cloudflare (équipe Workers AI)
Date d’annonce 01/10/2026 (blog officiel, Birthday Week 2026)
Date de disponibilité 01/10/2026 — API Workers AI et Hugging Face
Famille / gamme Clef — modèles de décision (premiers modèles entraînés par Cloudflare)
Type Decision model : classification et décisions structurées, aucune génération de texte
Tailles Clef : 27 milliards de paramètres (base Qwen3.8-27B gelée) ; Clef-flash : 9 milliards (base Qwen3.5-9B gelée)
Fenêtre de contexte (entrée) 64 000 tokens (contre 32 000 pour Jev)
Tokens max en sortie Sans objet — sorties typées (probabilités), pas de génération token par token
Cutoff des connaissances Non communiqué
Modalités d’entrée / sortie Entrée : texte + images (encodeur vision, jusqu’à 4 images par requête — Jev est texte seul) ; sortie : probabilités sur questions typées (noul oui/non, choice 2 à 255 options, score échelle décrite)
ID API @cf/cloudflare/clef (API REST Workers AI), format compatible API Jev
Disponibilités API hébergée Workers AI ; poids open source Apache 2.0 sur Hugging Face (exécution locale) ; garantie entreprise — Cloudflare ne lit, ne stocke ni n’entraîne sur les requêtes (sauf produit de fine-tuning)

Nouveautés : Clef vs Clef-flash

Critère Clef Clef-flash
Paramètres 27 Md 9 Md
Modèle de base Qwen3.8-27B (gelé) + tête de routage et adaptateurs LoRA rang 256 Qwen3.5-9B (gelé) + même architecture
Positionnement Précision maximale (le « precision model ») Latence critique (chemins chauds des agents)
Latence médiane (mesures Cloudflare) 209,3 ms 38,8 ms
Latence p95 (mesures Cloudflare) 238,6 ms 122,4 ms
BANKING77 macro-F1 (constructeur) 94,20 90,93
BFCL case exact (constructeur) 98,47 98,76
API-Bank accuracy (constructeur) 91,93 93,11
Tarif hébergé (presse) ~0,24 $/M tokens d’entrée (selon The Register) ~0,09 $/M tokens d’entrée (selon la presse tech)

Cloudflare n’ayant jamais publié de modèle auparavant, il n’y a pas de « modèle précédent » au sens classique : la comparaison pertinente est interne à la famille. La surprise, c’est que Clef-flash bat parfois son grand frère — BFCL, API-Bank et le cas « home appliances » (97,73 contre 82,95) — tout en répondant environ 5 fois plus vite. Cloudflare positionne donc clairement les deux tailles comme complémentaires : Clef pour la précision, Clef-flash pour la latence, et non comme une simple version « dégradée ».

Sur le plan technique, l’entraînement suit la recette « System 1 » popularisée par Jev : Qwen gelé pour une passe de pré-remplissage, puis notation des choix valides en parallèle (étape de décision non autorégressive, sans génération de texte intermédiaire). Cloudflare y ajoute un routage d’attention en deux étapes et une fonction de perte maison, RLCD (Reinforcement Learning for Calibrated Decisions), qui affine la calibration des probabilités — le point critique pour un modèle dont toute la valeur réside dans la fiabilité de ses scores de confiance.

Benchmarks

Tous les chiffres ci-dessous sont communiqués par Cloudflare (aucune mesure indépendante publiée à ce jour). Le tableau reprend le Jev Decision Index, avec Jev comme référence et deux répliques open source (DiffusionGemma Jev, Kev 9B) en concurrents.

Benchmark Clef Clef-flash Jev (référence) Meilleur concurrent
BFCL · case exact 98,47 98,76 95,75 Clef-flash 98,76
ToolRet · nDCG@10 69,19 66,43 65,28 Clef 69,19
API-Bank · accuracy 91,93 93,11 88,19 Clef-flash 93,11
Home appliances · case exact 82,95 97,73 52,27 Clef-flash 97,73
When2Call · accuracy 72,37 65,58 80,97 Jev 80,97
BANKING77 · macro-F1 94,20 90,93 79,74 Clef 94,20
CLINC150+OOS · macro-F1 97,43 66,77 89,27 Clef 97,43
BRIGHT · nDCG@10 45,91 39,26 47,52 Jev 47,52
Amazon ESCI · macro-F1 57,48 57,39 55,21 Clef 57,48
PhishNChips · accuracy 79,60 75,05 62,55 DiffusionGemma Jev 85,35
Sources : billet officiel Cloudflare Blog, 01/10/2026 (mesures constructeur, non reproduites indépendamment).

Cloudflare a aussi fait tourner la suite d’évaluation de TypeSafe AI elle-même : Clef bat Jev sur 3 des 4 volets (traitement de factures 64,7 contre 61,8 ; service client 76,3 contre 76,0 ; incidents de sécurité 62,9 contre 61,7), et perd sur l’observabilité des traces d’agents (68,5 contre 71,6). Sur 43 benchmarks de latence, Clef répond en 209,3 ms en médiane et Clef-flash en 38,8 ms, contre 524,1 ms pour Jev — soit un facteur ~13 en faveur de Clef-flash.

Deux réserves s’imposent. D’abord, Jev gagne encore les tests les plus « raisonnement » (When2Call, BRIGHT, observabilité des traces) : Clef n’est pas un modèle de raisonnement, et Cloudflare ne prétend pas le contraire. Ensuite, les benchmarks classiques des LLM (MMLU, GPQA, SWE-bench…) sont absents par construction — un modèle qui ne génère pas de texte ne peut pas y être évalué. Le « leader du Decision Index » revendiqué par Cloudflare doit donc se lire pour ce qu’il est : le meilleur score sur les évaluations que l’éditeur a choisies de publier.

Comparatif : les modèles de décision du 1er octobre

Modèle Éditeur Prix entrée /1M Prix sortie /1M Contexte Point fort Score de référence
Clef Cloudflare ~0,24 $ (selon The Register) 0 $ (pas de génération) 64K Poids ouverts Apache 2.0 + vision 94,20 BANKING77 (constructeur)
Clef-flash Cloudflare ~0,09 $ (selon la presse tech) 0 $ 64K Latence médiane 38,8 ms 98,76 BFCL (constructeur)
Jev TypeSafe AI 0,042 $ Gratuit 32K Référence de la catégorie Non communiqué (référence)
pplx-decider-v1-27b Perplexity 0,04 $ Gratuit 262K Multimodal, le moins cher en hébergé 85,71 % sur 11 tests (constructeur)
Strands Decider 2B AWS Strands Labs Téléchargement gratuit — Non communiqué 1,9 Md de paramètres, tourne en local (CPU) 3e/33 JevBench (constructeur)
GLiDE Fastino Labs Non communiqué Non communiqué Non communiqué Raisonnement adaptatif (« thinking ») 64,81 Decision Index (constructeur)

Le positionnement de Clef est limpide : le seul de la vague du 1er octobre à combiner poids ouverts, encodeur vision et compatibilité Jev, avec l’infrastructure edge de Cloudflare en prime. Son talon d’Achille est tarifaire — en hébergé, il coûte environ 6 fois plus cher que Jev ou que le modèle de Perplexity au million de tokens d’entrée. Mais l’argument de Cloudflare est ailleurs : les poids Apache 2.0 permettent de l’auto-héberger, et c’est bien là que l’éditeur veut emmener le marché — faire tourner la couche « décision » des agents sur son réseau edge plutôt que de la facturer au token.

Cas d’usage

  • Triage du support client : un ticket arrive, Clef renvoie urgence + équipe + sévérité en une passe — le code route ou escalade sans parser de texte.
  • Routage des agents IA : choisir quel outil appeler ou quelle action exécuter à chaque étape d’un workflow agentique, à raison de dizaines d’appels par tâche.
  • Classification de sécurité : l’équipe Threat Intelligence de Cloudflare l’utilise pour classer des domaines (mode, e-commerce, phishing) — 2,2 s contre 4,7 s avec GPT-OSS-120B sur le même flux.
  • Garde-fous et modération : décider si une entrée est sûre, si un contenu respecte une politique, avec un score de confiance exploitable en seuil.
  • Évaluation et observabilité : noter des sorties d’agents, détecter les traces anormales — la confiance calibrée signale les cas à réexaminer par un humain.
  • Workflows documentaires : traitement de factures, routage de formulaires — les catégories peuvent changer sans réentraîner le modèle.

Tarifs et accès

Offre Entrée /1M Sortie /1M Notes
Clef — API Workers AI ~0,24 $ (selon The Register) 0 $ Hébergé sur l’edge Cloudflare ; tarif officiel non publié dans le billet de lancement
Clef-flash — API Workers AI ~0,09 $ (selon la presse tech) 0 $ Idem — variante basse latence
Poids open source Gratuit Licence Apache 2.0 sur Hugging Face — exécution locale ou auto-hébergée
Fine-tuning RL Non communiqué D’abord via l’équipe d’ingénieurs déployés (FDE), plateforme en libre-service prévue ensuite

Voir les tarifs et la documentation
Lien officiel

Accès développeur : API REST Workers AI (@cf/cloudflare/clef) avec le même format de requêtes que Jev, documentation sur developers.cloudflare.com, et poids téléchargeables pour une exécution 100 % locale. Côté entreprise, Cloudflare garantit qu’il ne lit, ne stocke ni n’utilise les requêtes pour l’entraînement — sauf si le client opte pour le produit de fine-tuning RL, qui capture les données via AI Gateway pour générer les exemples d’entraînement.

FAQ

Qu’est-ce qu’un « decision model » ?

Un modèle qui ne génère pas de texte : on lui envoie un état (ticket, page, trace d’agent) et des questions typées (oui/non, choix parmi des options, note sur une échelle), et il renvoie une probabilité pour chaque réponse autorisée. Le code exploite directement ces nombres — routage, blocage, escalade — sans parser du texte généré, ce qui le rend plus rapide, moins cher et plus fiable qu’un LLM pour les décisions répétitives.

Quand Clef et Clef-flash ont-ils été annoncés ?

Le 1er octobre 2026, sur le blog officiel de Cloudflare (Birthday Week 2026), dans le billet « Introducing Clef: our open-source decision models, and new RL fine-tuning platform ». Les deux modèles sont disponibles dès le jour de l’annonce sur Workers AI et Hugging Face.

Combien coûte l’utilisation de Clef ?

Le billet officiel ne publie pas de tarif. Selon la presse tech (The Register), l’API hébergée coûterait environ 0,24 $/M de tokens d’entrée pour Clef et 0,09 $/M pour Clef-flash, avec une sortie gratuite (il n’y a pas de génération de texte). Les poids sont gratuits sous licence Apache 2.0 pour une exécution locale.

Clef est-il vraiment open source ?

Oui : les poids des deux modèles sont publiés sur Hugging Face sous licence Apache 2.0, qui autorise l’usage commercial, la modification et la redistribution. En revanche, Cloudflare précise que ses données d’entraînement ne sont pas publiques.

Quelle est la différence entre Clef et Clef-flash ?

Clef (27 Md de paramètres) vise la précision maximale ; Clef-flash (9 Md) vise la latence, avec 38,8 ms en médiane contre 209,3 ms. Contre-intuitivement, Clef-flash dépasse parfois son grand frère sur certains benchmarks (BFCL, API-Bank). Les deux partagent la même fenêtre de 64K tokens, l’encodeur vision et la compatibilité avec l’API Jev.

Clef est-il meilleur que Jev ?

Selon les mesures de Cloudflare : oui sur la plupart des benchmarks de classification (BANKING77, CLINC150, API-Bank) et très largement sur la latence (38,8 ms contre 524,1 ms en médiane pour Clef-flash). Mais Jev reste devant sur les tests les plus « raisonnement » (When2Call, BRIGHT) et coûte ~6 fois moins cher en hébergé. Les deux constats viennent du constructeur — aucune évaluation indépendante n’a encore été publiée.

Comment utiliser Clef dans un projet qui utilise déjà Jev ?

Clef est entièrement compatible avec l’API de Jev : mêmes formats de requêtes et de réponses. La migration consiste essentiellement à changer l’endpoint (API Workers AI, modèle @cf/cloudflare/clef), sans réécrire le code d’intégration.

Verdict

Pour qui — OUI :

  • les équipes qui font tourner des agents IA à fort volume et veulent remplacer des appels LLM coûteux par une couche de décision rapide ;
  • les développeurs qui exigent des poids ouverts (Apache 2.0) et une exécution locale ou sur leur propre infrastructure ;
  • les usages classification / garde-fous / routage où chaque milliseconde compte (Clef-flash à 38,8 ms).

Pour qui — NON :

  • ceux qui ont besoin de génération de texte ou de raisonnement long — Clef ne « parle » pas ;
  • les budgets très serrés en mode hébergé — Jev et Perplexity facturent ~6 fois moins cher le million de tokens d’entrée ;
  • ceux qui attendent des évaluations indépendantes — tous les chiffres actuels viennent de Cloudflare.

Note de la rédaction : 8/10. La première famille de modèles open-weights crédible d’un géant de l’infrastructure, avec des benchmarks constructeur solides et une compatibilité Jev qui abaisse le coût de migration à zéro. Retranchés : des chiffres 100 % constructeur et un tarif hébergé élevé.

Tester Clef gratuitement
Lien officiel