研究团队将 AI 模型缩至 600 亿参数后性能反超同级版本

研究团队将 AI 模型缩至 600 亿参数后性能反超同级版本

N
News Editor
2026-08-25 20:46:03
一组研究人员公布称,他们把 GPT-OSS 120B 压缩为 600 亿参数、4-bit 量化模型后,得到的版本在多数对比基准中优于同为 600 亿参数的全精度版本。论文将这一方法称为「量化感知修复」,核心做法是让小模型直接对齐未压缩的大模型输出,而不是学习已被压缩过的中间版本。团队已将 Hypernova-60B 以开放权重形式发布到 Hugging Face,但生成该模型的压缩工具仍属专有,测试范围也仅覆盖 GPT-OSS。

一组研究人员表示,他们构建出一个更小、成本更低的 AI 模型版本,而这个缩小后的模型,表现反而超过了它所来自的同级压缩版本。

研究团队将 AI 模型缩至 600 亿参数后性能反超同级版本 2

按照常见理解,这种结果本不该出现。研究团队在上周五发布的论文中写道:「对于从业者来说,实际信息是,在基于蒸馏的修复流程中,量化步骤不是一个需要尽量压低成本的环节,而是一个可以额外引入教师监督的机会,由此得到的模型既更便宜、内存占用更低,同时准确性至少不逊于其全精度对应版本。」

从 1200 亿参数压缩到 600 亿参数

报道将 AI 模型参数比作一整面巨大的旋钮墙,这些数值承载了模型学到的内容。参数越多,模型通常越强,但运行成本也越高。OpenAI 的 GPT-OSS 120B 拥有 1200 亿个参数,每个参数都会消耗内存和电力。

为了降低部署成本,行业常见做法是减少参数数量,并压缩保留下来的参数精度。类似把一张图片压缩成更小文件,文件会变小,但压缩过度后画面也会模糊。模型被压得太狠,性能通常会下降,这一直被视为默认代价。

这次研究走得更远。团队将 GPT-OSS 从 1200 亿参数削减到 600 亿参数,并把每个参数压进 4-bit 的表示格式。按通常预期,这种极端压缩会明显削弱模型能力,但研究人员称,他们找到了一种能让模型表现反而提升的方法。

按报道说法,在几乎所有用于比较的基准测试中,这个更小的模型都优于一个以全精度构建的版本。

问题出在「向谁学习」

研究团队认为,传统缩模流程的问题,在于训练目标选错了。通常情况下,缩小后的模型会通过对比一个「半缩小」版本来修正错误,也就是拥有 600 亿参数、但保留更高精度的模型。问题在于,这个中间版本本身已经是原始模型的模糊副本。

如果小模型学习的是这个已经失真的中间版本,它学到的也是带缺陷的答案,因此很难超过这个「双胞胎」版本本身。

团队提出的方法被称为「Quantization-Aware Healing」,也就是量化感知修复。这个方法改变了对齐目标:不是让小模型模仿中间版本,而是直接回到未压缩的大模型,让小模型学习原始大模型的输出。换句话说,小模型不再向一个已经压缩过的副本学习,而是直接向原版学习。

研究团队将 AI 模型缩至 600 亿参数后性能反超同级版本 3

在 9 项测试中的 7 项里,这个 4-bit、600 亿参数的模型,表现超过了原本被视为「更优一半」的 600 亿参数高精度版本。不过,真正的 1200 亿参数原始模型在多数轮比较中仍然占优。模型规模并没有失去作用,但这个压缩后的版本跨过了此前外界并不认为它能达到的门槛。

内存需求约降至原模型四分之一

更小却更强的意义,在于 AI 对硬件资源消耗很大。报道称,这个经过修复的模型大约只需要原始模型四分之一的内存,参数数量则减半。这样的差距,意味着模型部署场景可能从数据中心,转向性能较好的桌面设备,甚至最终进入手机。

对小型实验室和本地开发者来说,一个结果更好、同时能耗仅为原来一半的模型,价值相当直接。

模型权重已开放,但工具和测试范围仍有限制

研究团队已经把修复后的 Hypernova-60B 作为开放权重模型发布在 Hugging Face,任何人都可以下载并运行。

不过,这并不意味着整套方案已经完全开放。报道提到,用来生成这个 60B 学生模型的压缩工具仍然是专有工具,因此完整方法暂时还没有全部开源。

另一个限制在于测试覆盖面。该团队目前只测试了 GPT-OSS,并没有在 Llama、Qwen 或 Mistral 系列模型上展开验证。

报道还提到,开放模型近期接连取得超出预期的结果,包括一个名为 Ox Alpha 的免费神秘模型最近击败了一个 Claude 系统,而外界并不知道其构建者身份;也包括市场对阿里巴巴 Qwen 3.8 Flash Next 的关注,以及一批通过更大语言模型推理轨迹微调小模型的方案,例如使用 Fable 或 Claude Opus 的做法。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
20

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。