新上线今天0 投票
超越单一维度压缩:大语言模型的复合稀疏性前沿
大语言模型(LLM)的压缩通常依赖静态参数剪枝或动态令牌级计算,但过度稀疏化会导致性能急剧下降。最新研究提出了一种复合稀疏性框架,通过结合低秩近似、通道剪枝与逐令牌动态层跳过,将压缩负担分散到多个维度,从而延缓性能衰减。
研究背景与动机
现有LLM压缩方法主要分为两类:静态压缩(如参数剪枝、低秩近似)和动态压缩(如条件计算、令牌级层跳过)。然而,单一维度的稀疏化在达到某个临界点后,性能会迅速恶化。研究者猜想,将两种机制结合可能通过分担压缩压力来推迟这一衰减点。
复合稀疏性框架
该框架分两步实施:
- 静态压缩:先通过低秩近似和通道剪枝获得一个静态压缩的骨干网络。
- 动态压缩:引入轻量级路由器,为每个令牌动态决定是否跳过某些层。
这种设计使得参数稀疏性和令牌级计算稀疏性可以独立控制,从而探索更优的压缩组合。
实验结果
在语言理解和建模基准测试中,复合稀疏性在相同总稀疏度下始终优于单一机制压缩:
- 在理解任务上,性能衰减点明显推迟。
- 在建模任务上,保持了更强的性能。
进一步分析揭示:
- 跨维度干扰:参数剪枝与令牌跳过之间存在相互影响。
- 最优分配:在固定稀疏预算下,接近平衡的分配最为有效。
结论与意义
这项工作证明了复合压缩是提升LLM压缩效率的实用路径,同时揭示了更广泛的跨维度稀疏性边界,该边界最终限制了进一步压缩的可能性。代码将在论文链接中开源。