Cloudflare et AWS ouvrent le créneau des modèles de décision open source pour les agents
Le 1er octobre 2026, Cloudflare a publié Clef et Clef-flash, et AWS Strands Decider 2B : des modèles de décision open source qui répondent par des probabilités typées plutôt que par du texte, pensés pour la prise de décision des agents. Ils concurrencent le modèle fermé Jev et posent la question de ce qu’il faut cesser d’envoyer au modèle frontal.
1er octobre 2026. Cloudflare publie Clef (27B) et Clef-flash (9B), ses premiers modèles entraînés en interne, sous licence Apache 2.0. 1er octobre 2026. AWS Strands Labs ouvre les poids de Strands Decider 2B, un modèle de décision de 2 milliards de paramètres fait pour tourner en local. 2 octobre 2026. Le recensement de Digital Applied confirme qu’aucun modèle frontal n’a ouvert le mois : ce sont les modèles spécialisés — décision, voix, traduction — qui tiennent la une. Pourquoi c’est important : une nouvelle catégorie de modèle, celle des modèles de décision, sort du format fermé pour devenir un composant open source standard dans la boucle des agents.
Ce qu’est un modèle de décision, et ce qu’il n’est pas
Un modèle de décision ne génère pas de prose. Là où un LLM produit du texte ouvert et non déterministe, un modèle de décision reçoit un état (un ticket, un domaine, une étape de workflow) et renvoie des réponses typées avec probabilités : un choix parmi une liste, un score, un booléen. Le code de l’agent lit cette réponse structurée pour router un ticket, déclencher une escalade ou renvoyer vers un humain.
La différence est opérationnelle, pas cosmétique. Cloudflare donne l’exemple de son équipe Threat Intelligence : pour classifier un domaine, Clef a mis 2,2 secondes à charger, rendre et classer la page, là où son LLM généraliste le plus rapide, gpt-oss-120b, en a mis 4,7 et n’a rendu que deux classifications. Deux fois moins de latence, et des sorties exploitables directement par du code — sans prompt de rappel, sans parseur fragile, sans retry sur une réponse hors schéma.
L’appel est trivial et entièrement compatible avec l’API de Jev, le modèle fermé de TypeSafe qui a lancé la catégorie :
{
"model": "clef",
"state": "Checkout has been failing for every customer for the last hour.",
"questions": {
"team": {
"type": "choice",
"instructions": "Which team should handle this request?",
"criteria": {
"billing": "Payments, invoices, and refunds",
"technical": "Outages, errors, and configuration"
}
}
}
} Clef face à Jev : plus rapide, multimodal, plus de contexte
Clef se distingue du Jev sur trois points concrets. D’abord, un encodeur de vision : il accepte images et vidéo, là où Jev ne classifie que du texte. Ensuite, une fenêtre de contexte de 64 000 tokens, contre 32 000 pour Jev — de quoi injecter davantage d’état à classer. Enfin, la latence : Clef affiche une médiane de 209,3 ms et Clef-flash de 38,8 ms, contre 524,1 ms pour Jev. Le changelog de Cloudflare résume l’écart par « jusqu’à 13× plus rapide que Jev ».
Sur la qualité, Clef mène l’index de décision Jev : 98,47 % en exactitude de cas sur BFCL, 94,20 % de macro-F1 sur BANKING77, 97,43 % sur CLINC150+OOS. Clef-flash domine certains tests malgré sa taille réduite — 98,76 % sur BFCL, 93,11 % sur API-Bank. Les deux sont hébergés sur Workers AI à 0,24 $ et 0,09 $ par million de tokens d’entrée, et Cloudflare garantit ne pas lire, stocker ni entraîner sur les requêtes, sauf si vous optez pour son futur fine-tuning par apprentissage par renforcement.
Decider 2B, le pendant local d’AWS
La réponse d’AWS va dans l’autre sens : Strands Decider 2B est pensé pour tourner en local, sur CPU ou GPU, avec les poids, les données d’entraînement et les scripts publiés. Son cahier des charges est minimaliste : il évalue des options prédéfinies et renvoie un choix ou un score de confiance en un seul passage avant — environ 115 ms sur une RTX 3090 selon les mesures relayées. Là où Clef vise la décision dans le chemin critique côté serveur, Decider 2B vise le développement local, l’expérimentation et le coût marginal nul.
Les deux publications racontent la même histoire : le créneau « décider vite, à bas coût, avec une sortie garantie » se remplit, et il se remplit en poids ouverts. Sur les huit modèles sortis entre le 1er et le 3 octobre, quatre étaient sous Apache 2.0 avec poids publics — Clef, Clef-flash, Decider 2B et le traducteur Index-Translate-35B-A3B de Bilibili.
Le peloton du 1er octobre : la spécialisation devient la norme
Clef et Decider 2B ne sont pas seuls. Le 1er octobre, Microsoft AI a publié trois modèles vocaux — MAI-Transcribe-2-Streaming, une transcription en continu couvrant 60 langues, et les deux MAI-Voice-2.1, une synthèse vocale en 23 langues avec une variante Flash annoncée à 150 ms de bout en bout —, tandis que Tavus ouvrait un accès anticipé à Griffin-Lite, un modèle de conversation vidéo full-duplex. Le 2 octobre, l’équipe Index de Bilibili a publié Index-Translate-35B-A3B, un traducteur MoE de 35 milliards de paramètres totaux pour 3 milliards actifs, couvrant 150 langues.
La régularité est le message. Après un mois de septembre ouvert par trois modèles frontaux en deux jours, octobre commence par des modèles qui font une seule chose : décider, transcrire, synthétiser, traduire, converser. Et deux des cinq éditeurs, Cloudflare et Amazon, publient des poids plutôt que de vendre des tokens. Sur les huit modèles sortis entre le 1er et le 3 octobre, quatre étaient en Apache 2.0 avec poids publics — la moitié du mois qui s’ouvre est open source, un basculement qui n’allait pas de soi il y a un an.
Cette spécialisation redessine le calcul économique. Le réflexe « tout passe par le modèle frontal » coûte cher et ajoute de la latence pour des tâches qui n’ont pas besoin de raisonnement. Un modèle de décision à 0,09 $ par million de tokens, ou un Decider 2B local à coût marginal nul, déplace la charge vers la couche la moins chère — à condition que la sortie typée soit fiable, ce qui ramène toujours à la calibration.
Où ça se place dans l’agent
La question d’achat n’est pas « est-ce mieux que le modèle frontal », mais « qu’est-ce que ça me permet d’arrêter d’envoyer au modèle frontal ». Un LLM de raisonnement coûte cher et reste non déterministe ; le faire décider de chaque branche d’un workflow est du gaspillage. Un modèle de décision s’insère juste avant l’appel d’outil : il route, classifie, déclenche ou retient, pour une fraction du coût et avec une latence prévisible.
Le risque à ne pas sous-estimer est la calibration : une probabilité affichée n’est fiable que si le modèle est calibré sur vos distributions réelles, pas sur des benchmarks génériques. Clef affiche des scores forts sur des jeux publics, mais la décision d’un agent sur des données de production doit être validée sur vos propres entrées — c’est d’ailleurs ce que Cloudflare pousse avec son produit de fine-tuning RL, et ce que le format ouvert rend enfin vérifiable localement.
Verdict
Si vous construisez des agents qui décident dans le chemin critique, testez Clef-flash pour le routage et la classification : à 0,09 $ par million de tokens et 38,8 ms de latence médiane, il déplace la décision hors du modèle frontal sans casser votre budget. Si vous développez en local ou voulez auditer les poids, Strands Decider 2B est le meilleur point d’entrée : tout est publié, et il tourne sur un simple CPU. Si vous êtes déjà sur Jev, la compatibilité d’API rend le basculement immédiat, et l’open source retire le risque de dépendance à un modèle fermé. Dans tous les cas, validez la calibration sur vos propres données avant de laisser un modèle de décision prendre des actions autonomes : la probabilité n’est une garantie que si elle a été mesurée sur votre distribution, pas sur un leaderboard.
Références
- Cloudflare Blog — Introducing Clef: our open-source decision models, and new RL fine-tuning (1er octobre 2026)
- Cloudflare Changelog — Introducing Clef: Cloudflare’s first open-source decision models, now on Workers AI
- Hugging Face — Cloudflare/clef
- Strands — Introducing Strands Decider 2B: a small, open source, decision model (1er octobre 2026)
- Digital Applied — AI Model Releases: October 2026 Tracker (3 octobre 2026)
- TypeSafe — Introducing System One models and Jev