新上线9天前0 投票
机制断层扫描:面向控制的可解释性设计测量方法
机制可解释性(Mechanistic Interpretability)旨在揭示模型内部不直接暴露的表示状态、组件效应、交互关系以及干预响应。然而,现有的测量方法——如激活修补(Patching)、梯度计算、Hessian-向量积以及子集干预——在不同的访问权限下,针对不同的目标量,缺乏统一的数学框架。最新研究提出“机制断层扫描”(Mechanistic Tomography)概念,将测量结构统一为线性模型 y = Ax + w,其中 A 描述干预,x 是目标映射,w 包含非线性响应、采样误差和基失配。这一框架提供了一套实用流程:从低成本测量开始,在预期规模上测试留出干预,校准简单失配,并在结构残差出现时扩展测量家族。控制场景成为验证该方法的理想试验场,因为估计结果若用于指导干预,其角色类似于观测器。在双隐马尔可夫模型(HMM)实验中,控制误差随观测器误差增大而上升,而目标改善可能掩盖干扰状态的运动。在仅前向访问条件下,稀疏聚合测量能以比坐标修补更少的干预次数恢复有限效应映射;在梯度访问下,有限探针改进局部归因映射;提升测量和 Hessian-向量积能恢复一阶映射遗漏的交互,而 Tracr 实验表明所需测量家族依赖于基底选择。在 GPT-2-small 的 IOI 任务中,Name Mover 与 Negative Name Mover 的交互是三个跨组对中最大的留出预测项;而在 Qwen-2.5-7B 上,有限校准使加法拒绝响应映射足够充分,留出误差不支持成对提升。该研究为可解释性测量提供了设计原则,并强调控制导向的验证对于确保解释的可靠性至关重要。
