一家研究团队提出了一种新的 AI 模型压缩方法,试图打破“模型越小、性能越弱”的常见取舍。Multiverse Computing 于 8 月 25 日在 Hugging Face 博客介绍称,他们把 OpenAI 开源的 GPT-OSS 120B 压缩到 600 亿参数,并进一步压到 4-bit 表示后,模型在多项测试中的表现反而优于对应的 60B 全精度版本。
9 项测试中赢下 7 项
研究团队将这套方法命名为 Quantization-Aware Healing。按其披露,压缩后的 60B 模型在 9 项基准测试中有 7 项超过“未量化”的 60B 版本,也就是通常被视为更高质量的对应模型。
这并不意味着压缩版已经全面超过原始的 120B 大模型。文章提到,120B 原版在多数对比中仍然更强,但压缩后的版本跨过了一个此前不常见的门槛:在更低内存占用和更少参数下,仍能取得更好的局部测试成绩。
- 原始模型:GPT-OSS 120B
- 压缩后规模:60B 参数
- 内存表示:4-bit
关键在于学习对象变了
常见做法是,先把大模型缩小,再让更小的模型去模仿这个“中间版本”。问题在于,这个中间版本本身已经在压缩过程中损失了一部分能力。这样训练出来的小模型,通常只能逼近这份“打折后的答案”。
这次的方法改了训练目标。研究团队没有让小模型继续对齐缩水后的中间版本,而是直接让它向原始、未压缩的大模型学习输出结果。换句话说,压缩步骤不再只是性能损耗,而被当作一次额外的监督训练机会。
对本地部署更有吸引力
如果这一结果能在更多模型上复现,意义主要在部署端。更小的参数规模和更低的位宽,意味着模型运行时需要的显存和电力都会下降。文章称,这个“修复后”的版本大约只需要原模型四分之一的内存,同时参数量减半。
这会直接影响模型能否从数据中心走向桌面设备,甚至进一步进入移动端。对预算有限的实验室、独立开发者和本地部署用户来说,推理成本下降本身就是重要变化。
已发布开源权重
Multiverse Computing 表示,压缩后的 Hypernova-60B 已以开放权重形式发布在 Hugging Face,用户可以下载运行。不过,生成这一模型所用的压缩工具仍属专有工具,完整流程目前并未完全开源。
补充信息:这项测试目前只覆盖 GPT-OSS,并未扩展到 Llama、Qwen 或 Mistral 等其他主流模型家族,方法的通用性仍待后续验证。










