导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜 概念版块
快讯 机构 人物 观点 专题

研究人员发现AI模型压缩新方法:缩小一半反而更聪明,大幅降低硬件成本

一支研究团队近日发现,通过一种名为“量化感知修复”(Quantization-Aware Healing)的新技术,可以将大型AI模型缩小至原来的一半大小,同时性能反而提升。这打破了业界长期以来的认知——通常压缩模型会导致精度下降,就像压缩图片会模糊一样。

Myriad: When will OpenAI release GPT-6? Click to make your prediction.

Multiverse Computing的研究人员将GPT-OSS 120B参数模型压缩至60B参数,并对每个参数进行4-bit量化——相当于极端压缩。然而,在几乎所有的基准测试中,这个缩小后的模型反而优于同样60B参数但使用完整精度的版本。研究人员在论文中写道:“对于实践者而言,实际信息是:在基于蒸馏的修复流程中,量化步骤并非需要最小化的成本,而是教师监督的额外机会,从而产生一个更便宜、更轻量且至少与全精度版本一样准确的模型。”

复印错误

传统压缩方法通常让缩小模型去模仿一个“半压缩”的中间版本(例如60B参数但较高精度),但这个中间版本本身已经是原始大模型的模糊副本,因此小模型永远无法超越这个“有缺陷的双胞胎”。新方法则直接让缩小模型指向原始未压缩的大模型,学习其答案,从而突破天花板。

研究人员发现AI模型压缩新方法:缩小一半反而更聪明,大幅降低硬件成本

在9项测试中,4-bit量化后的60B模型在7项上击败了原本应更优的60B高精度版本。虽然原始120B参数模型仍然在多数任务上领先,但“节食版”已经跨越了无人预料到的门槛。

更小更聪明意味着什么

这一突破对硬件需求意义重大:修复后的模型仅需约四分之一的内存和一半的参数。这意味着AI可以从数据中心移植到普通桌面,甚至未来移植到手机上。对于小型实验室和本地开发者,能够以一半能耗获得更好结果,将极大降低门槛。该团队已将修复后的Hypernova-60B模型以开放权重形式发布在Hugging Face上,任何人都可免费下载运行。

研究人员发现AI模型压缩新方法:缩小一半反而更聪明,大幅降低硬件成本

不过,目前用于生成60B学生模型的压缩工具是专有的,尚未完全开源,且团队仅测试了GPT-OSS这一架构,尚未在Llama、Qwen或Mistral等系列上验证。尽管如此,这一成果已为AI模型的压缩与部署开辟了新方向。