新上线10天前0 投票
熵约束自适应随机量化:在压缩与精度间寻找最优平衡
随着机器学习模型规模的不断扩大,模型参数、梯度和KV缓存等数据的存储与传输已成为系统性能的关键瓶颈。量化技术通过降低数据精度来缓解这一问题,但传统方法往往在精度和压缩率之间难以两全。近日,来自哈佛大学、VMware Research等机构的研究者提出了一种名为**熵约束自适应随机量化(ECASQ)**的新方法,在保持无偏性的同时,显著提升了量化压缩的效率。相关论文已提交至arXiv(编号:2608.18147)。
从ASQ到ECASQ:为何需要熵约束?
自适应随机量化(ASQ)是一种先进的量化方法,它针对给定输入优化均方误差(MSE),同时保证无偏性,适用于模型、梯度、KV缓存压缩以及最近邻搜索等场景。然而,ASQ在选取量化值时并未考虑后续的无损熵编码阶段,导致压缩率仍有提升空间。ECASQ正是为了解决这一缺陷而设计:它在熵预算和无偏性约束下,联合选择自适应量化值,以最小化MSE,从而在压缩率和精度之间找到更优的平衡点。
算法创新:动态规划与近似求解
研究团队将ECASQ问题形式化,并提出了两种求解算法:
- 最优动态规划算法:时间复杂度为O(sd²),空间复杂度为O(d²),适用于长度为d的向量,最多支持s个量化值。
- GPU友好的近似动态规划算法:时间复杂度同样为O(sd²),但空间复杂度降至O(d),更适合大规模并行计算。
近似算法有个重要保证:其解对应的MSE不会超过使用每条目少一位熵的最优解。此外,研究者还提供了一种迭代细化过程,在实验中能够获得接近最优的结果,同时保持显著的速度优势。
实验与前景
在实验中,ECASQ在多种数据压缩任务中均表现出色,尤其在高压缩率场景下,其精度损失远小于传统方法。这一进展对于分布式训练、边缘推理以及大模型部署等场景具有重要意义。未来,ECASQ有望成为AI基础设施中的标准工具,帮助开发者在不牺牲模型质量的前提下,大幅降低存储和带宽成本。
值得注意的是,该论文目前仅为预印本,尚未经过同行评审,但其提出的思路和算法已引发学界关注。随着后续研究的深入,ECASQ或将在实际系统中得到广泛应用。
