Research · Models · Products and Tools
采用QAH方法将GPT-OSS 120B压缩至60B并量化为MXFP4后,在9个基准中有7个超越其bfloat16版本
Hugging Face博客介绍量化感知修复(QAH)方法,将GPT-OSS 120B压缩至60B并量化为MXFP4后,在9个基准中有7个超越其bfloat16版本,且训练速度比QAT快约7倍。
阅读 Hugging Face 原文为什么重要
QAH展示了高效模型压缩与量化技术,可在保持性能的同时大幅降低计算成本,对部署大规模模型具有实际意义。
关键事实
事实 1
GPT-OSS 120B模型压缩到60B参数并量化为MXFP4后,QAH模型在9个基准中有7个优于其bfloat16版本。
来源与依据
applied to a GPT-OSS 120B model compressed to 60B parameters and quantized to MXFP4, it produces a model that beats its own full-precision (bfloat16) version on 7 of 9 benchmarks.
事实 2
QAH模型在长上下文推理基准AA-LCR上提升了7.4分。
来源与依据
long-context reasoning (+7.4 on AA-LCR)
事实 3
QAH方法达到峰值性能大约需要100步,而QAT需要约700步,QAH比QAT快约7倍。
来源与依据
QAH reaches its peak in about 100 steps, roughly 7 times faster than QAT's 700