LLM后训练新突破:MASS方法通过分层数据选择提升微调效率
随着监督微调数据规模的不断扩大,如何从庞大的候选池中筛选出高价值子集,已成为降低训练成本、提升模型性能的关键挑战。现有的数据选择方法通常直接在原始嵌入空间中度量数据多样性,但这种方式容易将主导语义方向、细粒度监督差异和局部噪声纠缠在一起,导致选择结果不够精准。
针对这一问题,来自上海交通大学等机构的研究团队提出了一种名为 MASS 的新方法,将数据选择形式化为从粗到细的分层覆盖问题。MASS 首先利用密集自编码器学习低维主流形坐标,实现粗粒度的语义分组;随后在每个组内,借助 TopK 稀疏自编码器进行质量感知的稀疏特征覆盖。这种设计既保留了全局语义结构,又兼顾了局部细节特征,从而更有效地挑选出代表性数据。
在 Vision Flan 和 LLaVA-CoT 两个基准上的实验表明,MASS 在多种数据预算下均稳定优于现有的强基线方法,并且在某些设置下,仅使用少量数据子集就能达到甚至超越全量数据训练的效果。这一结果意味着,MASS 有望显著降低 LLM 后训练的数据需求,为高效微调提供新的思路。
方法核心
MASS 的流程分为两个阶段:
- 粗粒度语义分组:通过密集自编码器将高维嵌入压缩到低维主流形空间,利用几何结构进行语义聚类,避免原始空间中噪声的干扰。
- 细粒度稀疏覆盖:在每个语义组内,使用 TopK 稀疏自编码器提取稀疏特征,并基于质量感知的覆盖策略选择数据点,确保所选子集能充分代表组内的多样性。
这种分层设计使得 MASS 既能把握全局语义,又能捕捉局部关键特征,从而在数据选择上实现更好的平衡。
实验亮点
在 Vision Flan 数据集上,MASS 在 10%、25%、50% 等不同数据预算下,均取得了比随机选择、核心集选择等基线更高的下游任务准确率。在 LLaVA-CoT 上,MASS 同样表现出色,甚至在 25% 数据预算下就超过了全量微调的效果。这些结果凸显了 MASS 在数据效率上的巨大潜力。
意义与展望
这项研究为 LLM 后训练的数据选择提供了新的视角。通过引入分层覆盖和稀疏特征,MASS 有效解决了传统方法在嵌入空间中度量多样性的局限。未来,该方法有望扩展到更多模态和更大规模的数据集,进一步推动高效训练的发展。
