SheepNav
精选今天0 投票

深入探究推理性能之源:RL与SFT微调模型在数学问题求解中的表征质量对比

在人工智能领域,大型推理模型通过强化学习(RL)训练后,在数学推理任务上的表现往往优于传统的监督微调(SFT)模型,但背后的机制一直是个谜。最近,一篇提交至arXiv的论文(编号2607.26119)试图从内部表征的角度揭开这一优势的来源。

研究人员训练了线性探针,用于分析模型各层隐藏状态中关于答案正确性的信息。结果显示,RL模型在预测答案正确性方面比SFT模型更准确,这意味着RL模型内部的表征更加线性可分、结构更清晰。换句话说,RL训练让模型学会了更规整地组织信息,使得判断答案对错变得更容易。

进一步的均值消融实验揭示了另一项关键差异:RL模型发展出了一种层级化的架构,深层网络在处理推理问题时扮演着越来越关键的角色;而SFT模型的各层重要性则相对均匀。这表明RL训练从根本上重塑了模型处理推理问题的内部结构。

此外,论文还分析了在多次采样中token数量的变化,以观察模型是否自适应地分配计算资源。结果发现,部分RL模型比SFT模型表现出更高的变异性,但另一些则与SFT模型相当。这说明token分配策略可能更多取决于整体训练流程,而非单纯的RL或SFT方法。这种变异性或许反映了模型策略的稳定性,以及是否存在多种可能的推理路径。

这项研究为理解RL训练为何能提升推理能力提供了新的视角,也为未来优化模型训练策略提供了参考。不过,论文也指出,token分配行为可能因模型和训练细节而异,尚需更多研究来厘清。

该论文发表于AAAI 2026的XAI4Science研讨会,作者包括Antyabha Rahman等。

延伸阅读

  1. 更多欺骗:混合动机LLM多智能体系统中的目标错位
  2. ClinLens:面向纵向多模态临床数据科学的长期编码智能体评测基准
  3. 基准测试的推理并不总能组合:AI评估中的可投射性
查看原文