SheepNav
新上线今天0 投票

量化后门攻击:语言模型部署中的隐藏威胁

一项新研究揭示,大型语言模型(LLM)在部署到边缘设备时,常用的量化压缩技术可能触发隐藏的恶意行为,而现有的安全审计流程却无法察觉。该研究由Jacopo Dardini等人完成,并已被第21届国际可用性、可靠性和安全性会议(ARES)接收。

量化:看似安全的优化,实则暗藏风险

后训练量化(PTQ)通常被视为一种语义中立的优化手段,用于将全精度模型压缩至INT8或4-bit等低精度格式,以适配边缘设备。然而,研究者指出,这一过程本质上是一种“多对一”的映射,即多个不同的全精度参数集合可能对应同一个量化后的结果。这意味着,在原始全精度模型上通过的安全验证,并不能保证量化后模型的行为依然安全。这种“验证与部署之间的鸿沟”为攻击者提供了可乘之机。

量化行为等价类(QBEC)的理论基础

为了系统化地描述这一漏洞,研究者引入了“量化行为等价类”(QBEC)的概念。他们严格证明了,即使两个模型属于同一个QBEC(即量化后参数相同),它们的行为也可能存在显著差异。这一理论为“量化触发后门”攻击提供了坚实的数学依据:攻击者可以在全精度模型中植入潜伏的恶意行为,这些行为在原始精度下不会显现,但一旦模型被量化,就会激活。

攻击演示:从零到85%的颠覆

研究团队构建了一个三阶段的对抗性微调框架,并在两个实际场景中验证了攻击的有效性:战术机器翻译和政治内容分析。实验结果显示,在修复后的FP16精度下,被植入后门的翻译模型对“敌友”语料的破坏率为0%,但经过INT8或4-bit量化后,其反转率飙升至85.02%。同时,在政治内容分析场景中,一个配对的立场分类器在量化后表现出高达ΔBias=0.33的意识形态偏移。值得注意的是,这是首次在编码器-解码器架构的多语言序列到序列模型上验证此类攻击,而此前的研究主要集中于解码器-only的因果语言模型。

跨量化器迁移:并非比特宽度决定一切

研究还探讨了后门攻击在不同量化方案和模型架构之间的迁移性。结果表明,攻击的持久性并不仅仅取决于名义上的比特宽度(如INT8或4-bit),而是与具体的量化算法和模型结构密切相关。这意味着,单纯依赖比特宽度来选择防御策略是不够的。

安全启示:部署配置必须纳入认证范围

这项研究对AI安全领域提出了重要警示:仅对源精度模型进行审计,不足以排除量化触发的恶意行为。为了确保可信的边缘AI,最终部署的配置(包括量化方案、硬件环境等)必须被纳入行为认证的范畴。研究者呼吁,未来的安全标准应要求对部署后的模型进行重新评估,而不仅仅是依赖训练时的验证。

这一发现对于依赖边缘AI的行业,如国防、金融、医疗等,具有深远意义。在追求模型压缩和效率的同时,安全验证的流程也需要同步升级,以应对新型的、隐蔽的威胁。

延伸阅读

  1. 曲率感知的自适应最近邻分类:CARSANN 框架
  2. 自解释多标签图神经网络:为关联证据归因而生
  3. Dandelion:球面神经模拟行星动力学的新方法
查看原文