OX Alpha, le modèle IA anonyme qui bat GPT-5.6 en code, a été adopté en production en 24 heures
Un modèle « stealth » sans attribution, apparu le 20 août 2026 sur OpenRouter avec un accès gratuit, a atteint 80 % sur DeepSWE et intégré des agents de production en 24 heures. Les équipes qui branchent un modèle anonyme sur des données sensibles prennent un risque de chaîne d’approvisionnement qu’elles n’ont pas mesuré.
20 août 2026. 80 %. 24 heures. Le 20 août 2026, un modèle d’IA désigné « stealth/ox-alpha » est apparu sur OpenRouter sans aucune attribution, avec un accès gratuit pour une semaine. Il affichait 80 % sur DeepSWE, un score de code supérieur à GPT-5.6-sol (52 %), à Claude Fable 5 (65 %) et à GLM-5.3 (62 %). 24 heures plus tard, il était intégré à des outils de production — dont l’agent Hermes de Nous Research et l’éditeur Zed.
La vitesse dit tout. Un modèle anonyme, non revendiqué, sans licence claire ni revue de sécurité, a été branché sur des flux de travail réels avant que quiconque sache ce qu’il était.
Un modèle fantôme au score de pointe
Les spécifications d’OX Alpha en font un candidat sérieux, pas une curiosité : 1 048 576 jetons de contexte, 131 072 jetons de sortie, du multimodal (texte, image, vidéo), un appel d’outils et une sortie JSON structurée. Son architecture est estimée à ~744 milliards de paramètres en mixture-of-experts, avec ~40 milliards actifs. Les opérateurs annoncent une capacité de 100 000 milliards de jetons par jour.
Sur le benchmark DeepSWE, qui mesure des tâches de génie logiciel déterministes, OX Alpha a passé certaines épreuves du premier coup là où GLM-5, GPT-5.6-sol et Grok 4.6 enregistraient 0 sur 4. Il a maintenu un passage propre sur 51 469 tests de régression.
Une réserve méthodologique s’impose : DeepSWE n’est pas SWE-bench Verified, le benchmark de référence des modèles de pointe. Les scores ne sont pas directement comparables, et l’échantillon de tests est réduit — dix tâches menées par un chercheur indépendant. Le chiffre impressionne ; il ne vaut pas encore un classement.
Le traçage : 99 % de certitude vers GLM-5.x
Le chercheur indépendant Ben Davis a mené une empreinte technique du modèle et conclut à « 99 % de certitude » qu’OX Alpha appartient à la série GLM-5.x de Zhipu AI, non encore publiée. Les preuves :
- la consommation de jetons vidéo est identique à celle de GLM-5V-Turbo (~147 jetons par seconde, indépendante du débit d’images) ;
- le tokenizer correspond à GLM-5.3 à ±75 jetons près sur vingt-cinq prompts ;
- le rejet de l’audio reproduit le comportement de GLM-5V ;
- le style de sortie (~1,3 emoji pour 1 000 caractères) colle à la famille GLM/Qwen.
L’analyse écarte méthodiquement les autres candidats — Xiaomi, DeepSeek, Google, Alibaba, xAI, OpenAI, Anthropic — sur des différences de tokenizer, d’encodeur vidéo ou de style.
Un mode de distribution devenu routinier
OX Alpha n’est pas le premier. Selon les données compilées par la plateforme OrcaRouter, les quatre « modèles stealth » apparus anonymement et finalement revendiqués ces six derniers mois provenaient tous de laboratoires chinois :
- Pony Alpha (février 2026) → revendiqué par Zhipu AI comme GLM-5 ;
- Hunter Alpha (mars 2026) → MiMo-V2-Pro de Xiaomi ;
- Elephant Alpha (avril 2026) → Lingxi Ling-2.6 d’Ant Group ;
- Owl Alpha (avril 2026) → LongCat-2.0 de Meituan.
Le schéma est stable : un laboratoire teste son modèle phare sous un nom anonyme, mesure l’adoption réelle, puis le revendique officiellement. Zhipu AI l’a déjà fait avec Pony Alpha, confirmé ensuite comme GLM-5.
Le vrai sujet : la confiance dans la chaîne d’approvisionnement
Le débat n’est pas « qui » se cache derrière OX Alpha. Il est : faut-il brancher un modèle non attribué sur des données de production ? Trois risques concrets, distincts de la performance :
- Absence de responsabilité. Un modèle anonyme n’a pas d’éditeur à poursuivre, pas de politique de sécurité publiée, pas de revue de sûreté documentée. Si vos prompts fuient, vous n’avez aucun interlocuteur.
- Opacité de la licence. Le statut « gratuit » de la période d’essai ne dit rien des conditions d’utilisation des données, de la rétention ou de la réutilisation de vos requêtes à des fins d’entraînement.
- Économie de l’essai gratuit. Une fenêtre sans facturation sur un modèle à capacité annoncée massive est un aimant à prompts : les requêtes envoyées pendant l’essai constituent, pour un laboratoire non nommé, un jeu de données de production et une étude de marché gratuite.
# Tester un modèle stealth : ne jamais y envoyer de données sensibles
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "stealth/ox-alpha", "messages": [{"role": "user", "content": "Résume ce paragraphe."}]}' La commande est légitime pour une évaluation. Elle devient un risque le jour où le contenu du message est du code propriétaire ou une donnée client.
Ce que ça change pour l’ingénieur
L’épisode OX Alpha accélère une vérité du marché : l’évaluation continue remplace l’évaluation ponctuelle. À un rythme de onze modèles majeurs en vingt jours, personne ne peut plus tester un modèle avant l’arrivée du suivant. La conséquence est un raccourci tentant — brancher le dernier score — qui contourne exactement les garde-fous qui comptaient.
Pour un ingénieur qui choisit un modèle, deux questions séparent le branchement responsable du branchement aveugle : qui répond de ce modèle ? et où vont mes données ? Un score de benchmark ne répond à aucune des deux.
La bonne pratique n’est pas le refus. C’est le périmètre : les modèles non attribués servent à benchmarker sur des données synthétiques, jamais à router du trafic sensible ; la production attend l’attribution officielle et des conditions de licence claires.
Évaluer un modèle anonyme sans se brûler
La tentation est réelle, la méthode ne l’est pas moins. Un modèle non attribué peut être évalué sans risque à condition de respecter un périmètre strict. Trois règles suffisent :
- Données synthétiques uniquement. Générez des cas de test — code factice, textes publics, prompts sans secret — et bannissez le code propriétaire, les identifiants et les données personnelles. Une requête envoyée à un modèle anonyme est potentiellement conservée par un laboratoire inconnu.
- Endpoint isolé. Routez les tests via une clé API dédiée et un compte sans privilège, distinct de vos pipelines de production. En cas de fuite de clé, le rayon de casse reste nul.
- Mesurez, ne croyez pas. Reproduisez le benchmark sur vos tâches — pas sur le score annoncé — et comparez sur la même métrique que vos modèles de référence. Un 80 % sur DeepSWE ne dit rien de votre base de code tant que vous ne l’avez pas mesuré.
La décision d’adoption, elle, n’appartient pas à la technique. Elle appartient à la gouvernance : qui assume la responsabilité d’un modèle que personne ne revendique ? Tant que la réponse est « personne », le modèle reste un outil d’évaluation, pas un composant de production.
Verdict
Profitez de la fenêtre gratuite pour évaluer — et rien d’autre. OX Alpha vaut un test sur des données synthétiques ou publiques : ses scores de code et son contexte d’un million de jetons méritent d’être mesurés sur vos cas d’usage avant la fin de l’essai, attendue vers le 27 août 2026.
Ne branchez pas de données sensibles avant l’attribution. Tant que personne n’a revendiqué le modèle ni publié ses conditions, traitez chaque requête comme ce qu’elle est : un envoi vers un laboratoire inconnu, sans garantie de rétention ni de confidentialité. Si l’hypothèse GLM-5.x se confirme, vous pourrez réévaluer — avec un éditeur, une licence et une revue de sûreté en face.
Le fond du sujet dépasse OX Alpha. Un marché où les modèles de pointe circulent sans attribution et s’intègrent en production en 24 heures est un marché qui a mis la performance devant la responsabilité. Le score de code ne vous dit pas qui vous servez — et c’est précisément la question qu’un ingénieur ne peut plus se dispenser de poser.