SheepNav
新上线今天0 投票

“停止向量”:将因果干预内化到权重中,实现高效推理

推理模型为何“想太多”?

大语言模型在推理时,常会生成远超必要长度的思维链(Chain of Thought)。以 DeepSeek-R1-Distill-Qwen-7B 为例,其思维链长度约为模型自身答案概率稳定所需时长的两倍。这种“过度思考”不仅浪费计算资源,还可能引入错误。传统方法如全局长度惩罚难以奏效,因为不同问题的可压缩空间差异巨大。

“停止向量”的发现

一篇来自 COLM 2026 高效推理研讨会的新论文提出了一种名为“停止向量”(Halt Vector)的机制。研究者通过因果可解释性分析,在该模型的第 18 层发现了一个方向:沿着这个方向进行干预,可以控制模型思考的时长;而另一个复制值轴(replicated value axis)则无此效果。这暗示存在一个专门控制“何时停止”的因果通道。

从干预到权重内化

将这一干预直接嵌入权重并非易事。简单地在标量投影方向上最大化,会破坏下游读者依赖的离轴维度,导致生成变长而非变短。研究者最终采用重构整个激活向量的方法,将关键维度固定在其自然值上,成功实现了干预的内化。

效果与局限

在仅用 24 个问题拟合、无强化学习的情况下,该方法在五个未见基准上保持准确率的同时,削减了约四分之一的思考量。其削减量与每个问题自身的可移除冗余度相关性达 0.70。此外,该方法还修复了一种随难度增加而恶化的不终止病理现象,而解码时的置信度钩子反而会加剧该问题。

作者坦言,该方法的原始权衡并不优于精心调优的长度惩罚或解码时早期退出,其核心贡献在于如何获得“停止”能力——通过因果可解释性而非训练或解码策略。

意义与展望

这项工作展示了可解释性研究直接转化为模型效率优化的潜力。未来,类似方法或可推广至更大模型,与强化学习结合,实现更精准的推理时长控制。不过,当前结果基于单一模型,其泛化性有待验证。

延伸阅读

  1. 通用编码计算迎来学习理论新基础:应对分布式系统中的慢节点问题
  2. 语义ID推荐器的离线策略评估:模型自身的代码层级是否有帮助?
  3. Conservative Hybrid Graph Networks for Process Systems with Learned Routing
查看原文