SheepNav
新上线今天0 投票

注意力敏感性不足:微调中注意力层与行为层上下文学习的分离

近来,大语言模型(LLM)的上下文学习(In-Context Learning, ICL)能力备受关注,它使模型能根据少量示例快速适应新任务。然而,微调(Fine-Tuning)往往会削弱这种能力。为了检测这一退化,研究者常关注注意力机制:如果注意力在示例变化时发生改变,便认为模型保持上下文敏感。但这一代理指标(proxy)是否可靠?最新研究对此提出了质疑。

来自 arXiv 的论文《Attention Sensitivity Is Not Enough: Dissociating Attention-Level and Behavioural In-Context Learning under Fine-Tuning》深入探讨了这一问题。作者提出了 上下文敏感性(In-Context Sensitivity, ICS) 指标,衡量模型在匹配和不匹配的示例前缀下,最后 token 注意力的平均行距离,并配以 ICL-GAP(行为准确率差距)作为对照。在 Llama-2-7B 上进行四组消融实验后,他们发现:一种最大化 ICS 的正则化器($armKL$)能将 ICS 推至 1.413,接近其几何上限的 0.5%,但行为层面的 ICL-GAP 几乎为零,MMLU 准确率却从 0.371 降至 0.279。这揭示了注意力代理指标的 Goodhart 效应——优化一个指标却导致另一个目标失效。

机制分析显示,注意力变得尖锐且在不同前缀间近乎不相交,但主要聚焦于格式和演示文本的 token,而非标签。随机标签协议进一步确认,行为探针在相同检查点仍保持动态范围。在建设性研究中,行为门控部分缓解了该效应,而锚定预训练计算的目标则能保持高 MMLU 和中等 ICS 的区域,这是发散最大化方法所欠缺的。

该研究的主要启示是:注意力级别的 ICL 代理指标只有在经过行为差距验证后,才能作为训练目标使用。这提醒研究者和工程师,在评估模型能力时,应谨慎依赖单一指标,需结合行为层面的验证,以避免陷入优化陷阱。

延伸阅读

  1. 聚类结构向量的随机复杂度计算新方法:线性时间递归公式
  2. RW-LoRA:基于随机游走的低通信成本去中心化LoRA微调方法
  3. ReNFT:通过内部概率质量重新校准修复奖励后训练中的模式坍缩
查看原文