跳到正文
原文
Hugging Face Blog·· 2026-08-25精选AI 评分62

Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 7/9 基准上超过其全精度版本

Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original

AI 导读

Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化到 MXFP4 之后,直接蒸馏原始未压缩的全精度教师模型,而不是蒸馏恢复出的 bfloat16 checkpoint。

推荐理由

论文给出压缩加量化后从原始模型蒸馏的恢复方法,并附与 QAT 的稳定性对比数据。

来源:Hugging Face Blog · huggingface.co