超越模仿:通过推理进度过滤在线策略蒸馏
在线策略蒸馏(OPD)作为大语言模型后训练的有效框架,通过将学生生成的轨迹与教师的密集令牌级监督配对,实现了知识迁移。然而,OPD隐式假设教师奖励是推理进度的合适代理,从而在策略优化中平等对待所有教师反馈。实际上,这一假设并不总是成立。研究者观察到,教师奖励常与真实推理进度冲突:推理步骤即使有明显进步,也可能因偏离教师输出而获得较低蒸馏奖励。为解决这一错配,他们提出推理进度感知的奖励过滤在线策略蒸馏(R2-OPD),构建两个轨迹内推理片段排名,分别基于教师奖励和独立估计的进度奖励。当两个排名不一致时,选择性抑制蒸馏奖励,减少与推理进度冲突的监督,同时保留有效教师指导。实验表明,该方法在推理性能上持续优于标准OPD。
背景与动机
在线策略蒸馏(OPD)通过让学生模型生成轨迹,并由教师模型提供逐令牌的监督信号,实现从教师到学生的知识迁移。然而,OPD的一个关键假设是:教师奖励能够准确反映推理进步。但在实际中,这一假设常常失效。例如,当学生的推理步骤虽然比教师更高效或更创新,但由于与教师的输出模式不同,教师奖励可能反而较低。这种奖励与真实进步之间的错配,可能导致学生模型学到次优策略,甚至抑制其探索更优推理路径的能力。
核心方法:R2-OPD
R2-OPD构建了两个排序:一个基于教师奖励对推理片段进行排序,另一个基于独立估计的进度奖励进行排序。当两个排序不一致时,系统会抑制或降低蒸馏奖励,从而减少与推理进度冲突的监督信号。这种方法的核心思想是:不要盲目模仿教师,而是关注推理过程的实际进步。通过这种方式,R2-OPD在保留教师有效指导的同时,允许学生模型探索更优的推理路径。
实验与结果
论文在多个推理任务上对比了R2-OPD与标准OPD的性能。实验结果显示,R2-OPD在数学推理、常识推理等任务上均取得了持续改进,尤其在需要复杂多步推理的场景中,改进更为显著。这表明,通过过滤与推理进度冲突的教师信号,可以更有效地提升学生模型的推理能力。
意义与展望
这项研究对AI行业具有重要启示。随着大语言模型在复杂推理任务中的应用日益广泛,如何高效利用教师模型的知识传递,同时避免学生模型过度模仿而限制其泛化能力,成为一个关键问题。R2-OPD提供了一种新思路:通过动态调整蒸馏监督的权重,使模型学习过程更注重实质性进步,而非简单复制教师行为。未来,这种推理进度感知的方法有望与其他训练技术结合,进一步提升模型的推理能力和鲁棒性。
总之,R2-OPD为在线策略蒸馏提供了一种更精细的控制方式,有助于推动大语言模型在推理任务中的表现迈向新高度。



