Le Quantization-Aware Healing produit un modèle 4 bits plus précis que sa version 16 bits
Le 25 août 2026, Multiverse Computing publie un billet sur le Quantization-Aware Healing, une recette qui appliquée à un GPT-OSS 120B compressé à 60B et quantifié en MXFP4 bat sa version bfloat16 sur 7 benchmarks sur 9. La méthode distille depuis le modèle d’origine, pas depuis le checkpoint compressé.