Olmo-core 3 ouvre l’entraînement des MoE à l’échelle du trillion de paramètres
Ai2 publie Olmo-core 3, une infrastructure ouverte d’entraînement de mixture-of-experts qui tient 1,2 trillion de paramètres sur 512 GPU. Le passage de FSDP à DDP et le format MXFP8 changent l’économie du calcul pour les labos qui n’ont pas Megatron-Core.