跳到正文
原文
Hugging Face Blog·· 2026-08-25精选AI 评分66

Quantization-Aware Healing:压缩后的 4 位模型超越全精度原版

Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original

AI 导读

Multiverse Computing 提出 QAH 方法,对 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 后,在 9 项基准中 7 项超越原 bfloat16 检查点,并在 LiveCodeBench 上超过 120B 原版教师模型。

推荐理由

原文给出了压缩-量化-恢复流程的对比,读者可据此判断 QAH 在训练稳定性与推理成本上的实际收益。

来源:Hugging Face Blog · huggingface.co