Olmo-core 3 ouvre l’entraînement des MoE à l’échelle du trillion de paramètres
Ai2 publie Olmo-core 3, une infrastructure ouverte d’entraînement de mixture-of-experts qui tient 1,2 trillion de paramètres sur 512 GPU. Le passage de FSDP à DDP et le format MXFP8 changent l’économie du calcul pour les labos qui n’ont pas Megatron-Core.
1er octobre 2026. Ai2 — l’Allen Institute for AI — publie Olmo-core 3, une refonte de son infrastructure ouverte d’entraînement de modèles de langage, centrée sur les mixture-of-experts (MoE). 1er octobre 2026. La pile a été benchmarkée sur un modèle de 1,2 trillion de paramètres, dont 58,36 milliards actifs par token, réparti sur 512 GPU NVIDIA B300. 1er octobre 2026. Le passage au format basse précision MXFP8 apporte environ 21 % de débit en plus par rapport à BF16, tout en faisant tomber la mémoire active de pointe de 103 Gio à 95 Gio. Pourquoi c’est important : c’est une alternative open source crédible à Megatron-Core pour entraîner de grands modèles creux, et elle s’attaque précisément aux coûts qui érodaient l’avantage des MoE à grande échelle.
Le problème que les MoE n’ont jamais tout à fait résolu
Les MoE promettent la même chose depuis des années : emporter beaucoup plus de paramètres appris sans que chaque entrée n’ait à les utiliser tous. Un modèle dense active presque toute sa capacité à chaque token ; un MoE n’active qu’une poignée d’experts — les composants spécialisés du modèle — par token. L’idée est de payer moins de calcul pour la même capacité.
Sauf que le modèle entier doit malgré tout être stocké en mémoire GPU et mis à jour pendant l’entraînement. Et orienter chaque entrée vers le bon expert, à travers un cluster, crée ses propres coûts de communication et de coordination. À mesure que les MoE grandissent, ces coûts finissent par rogner une bonne partie de l’économie réalisée en n’utilisant qu’une fraction du modèle pour chaque entrée.
Olmo-core 3 est construit pour refermer cet écart. Dans un benchmark, l’équipe a fait passer le réservoir d’experts de 8 à 128, tout en ne sélectionnant que quatre experts par token. Le nombre de paramètres actifs par token est resté à peu près fixe, autour de 3,2 milliards, tandis que la capacité totale du modèle passait de 4,6 à 47 milliards de paramètres — pour une chute de débit d’entraînement inférieure à 5 %. Autrement dit, la capacité a été multipliée par dix sans presque toucher à la vitesse.
FSDP vers DDP, ou comment ne plus recharger les poids
Le changement structurel clé est l’abandon du fully sharded data parallelism (FSDP) au profit du distributed data parallelism (DDP). La première implémentation MoE d’Olmo-core reposait sur FSDP, configuré pour rassembler puis re-fragmenter les poids du modèle à chaque petit lot de données d’entraînement. Ce va-et-vient coûte cher quand le modèle grossit.
Olmo-core 3 garde les experts résidents sur les GPU et route les données pertinentes vers eux, ce qui évite de rassembler les poids en boucle. Sur un test préliminaire avec huit GPU NVIDIA B300, un MoE de 47 milliards de paramètres a traité 52 000 tokens par seconde et par GPU avec la nouvelle pile, contre 19 400 avec l’ancienne — environ 2,7 fois le débit.
La comparaison assumée est avec Megatron-Core, l’option établie de NVIDIA pour entraîner de grands MoE. Olmo-core 3 apporte une pile MoE intégrée au framework derrière Olmo, avec une refonte qui dépasse le débit de l’ancienne implémentation FSDP. C’est un positionnement explicite : un chemin ouvert, sans dépendre de la pile propriétaire du fondeur.
Trois parallélismes, trois optimisations de routage
La façon dont le modèle et son état d’entraînement sont répartis sur le matériel repose sur trois techniques. L’expert parallelism répartit les experts entre les GPU, chacun ne stockant qu’une partie du réservoir d’experts. Le pipeline parallelism découpe les couches du modèle — les étapes successives qui transforment une entrée — entre des groupes de GPU, réduisant la part du modèle que chacun doit garder en mémoire. Un optimiseur distribué répartit l’état de l’optimiseur entre les GPU au lieu d’en conserver une copie complète sur chacun. Ensemble, ces techniques laissent un MoE grandir sans exiger de chaque GPU qu’il garde tout le modèle et son état en mémoire.
Le routage, lui, reçoit trois optimisations ciblées. Le rowwise expert parallelism place les données routées directement dans les tampons d’entrée des experts, minimisant le travail de réorganisation. Le routage résident sur GPU garde les métadonnées de routage sur les GPU, pour que le CPU puisse mettre du travail en file sans attendre une copie retour. Et le GEMM groupé combine de nombreux petits calculs d’experts pour que les GPU les exécutent plus efficacement.
S’y ajoute MXFP8, un format numérique à précision réduite qui représente certaines valeurs sur moins de bits. Sur un benchmark contrôlé à quatre GPU NVIDIA B300, l’activer là où il aidait le plus a produit environ 21 % de débit d’entraînement en plus par rapport à BF16, la mémoire active de pointe tombant de 103 Gio à 95 Gio. L’essentiel du gain vient du calcul feed-forward et du déplacement des données entre experts, pas de l’attention seule.
À qui ça sert, concrètement
L’enjeu de fond n’est pas le record de débit mais l’accès. Entraîner de grands modèles de langage exige énormément de calcul, ce qui gonfle les coûts et la consommation d’énergie, et met le développement avancé hors de portée de nombreux chercheurs académiques et petits labos. Une pile MoE ouverte, qui tient le trillion de paramètres sans effondrement du débit, abaisse le ticket d’entrée.
La nuance est dans la méthode de mesure. Les benchmarks — y compris le 1,2 trillion de paramètres à 512 GPU, avec un débit maximal observé de 858 TFLOP/s par GPU — utilisent un routage aléatoire pour mesurer la performance du système, pas la qualité d’un modèle entraîné. Autrement dit, Olmo-core 3 prouve que l’infrastructure tient la charge ; la qualité des modèles qui en sortiront reste à démontrer sur les prochaines générations d’Olmo.
Le projet s’inscrit dans une trajectoire. Les travaux d’Ai2 sur les modèles creux remontent à OlmoE, un MoE à 64 experts routés ; Olmo 3, à l’inverse, était dense, et sa pile d’entraînement était construite autour de cette densité. Olmo-core 3 réconcilie les deux lignées en reconstruisant l’outil d’entraînement pour de bien plus grands MoE, avec la promesse d’ouvrir l’infrastructure derrière chaque futur modèle.
Verdict
Si vous entraînez — ou prévoyez d’entraîner — de grands modèles creux sans vouloir dépendre de Megatron-Core, Olmo-core 3 est l’alternative ouverte à suivre de près : le passage FSDP→DDP et le MXFP8 sont des leviers concrets et chiffrés, pas des promesses. Si vous ne faites que de l’inférence ou du fine-tuning léger, cette release ne vous concerne pas directement — c’est de l’infrastructure d’entraînement, pas un modèle à télécharger. Si vous voulez mesurer par vous-même, le rapport technique, le code et la démo interactive sont publics, et les chiffres de débit sont reproductibles sur des GPU B300.