跳到正文
原文
Hugging Face Blog·· 2026-08-25AI 评分47

Hugging Face 提出 Quantization-Aware Healing:4-bit 压缩模型在 9 项 benchmark 中 7 项反超全精度原版

Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original

AI 导读

Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 结构压缩至 60B 参数并量化为 MXFP4 后,在 9 项 benchmark 中有 7 项反超其 bfloat16 全精度版本,包括 AA-LCR +7.4、AIME 2025 +5.6。

来源:Hugging Face Blog · huggingface.co