SW-ProxyCE:从公共EEG编码器到私有下游模型的零查询对抗迁移攻击
脑电图(EEG)基础模型通过在大规模异质神经记录上学习可复用表示,已成为EEG解码的一种有前景的范式。然而,公开释放EEG基础编码器虽促进了下游开发,却也引入了此前未被探索的安全风险:公开可用的表示可能使私有下游模型变得脆弱。本文研究在公共编码器和私有下游设置下的对抗迁移攻击,其中攻击者可白盒访问已发布的编码器和小型任务匹配的标记参考集,但无法访问或查询受害者的参数、输出或梯度。
我们提出了收缩-白化代理交叉熵(SW-ProxyCE),一种免查询的任务感知攻击框架,通过收缩-白化的类原型从小型标记参考集中恢复任务级决策几何,从而无需训练额外代理分类器即可生成可迁移的对抗样本。我们在三个EEG任务上评估了SW-ProxyCE,使用三个通用基础编码器和一个范式特定预训练编码器,覆盖了跨受试者和受试者内场景下的线性探测和全微调下游模型。结果表明,从公共编码器和有限标记参考生成的对抗样本能有效迁移至不可访问的下游模型。SW-ProxyCE始终优于任务无关的表示偏移攻击,揭示EEG基础模型的强迁移性并不必然带来对抗鲁棒性。代码将在GitHub上提供。
背景与动机
EEG基础模型的开放发布促进了社区发展,但也引入了新的攻击面。攻击者可能利用公开编码器生成对抗样本,攻击下游私有模型,而无需任何查询。这种攻击方式在现实场景中具有可行性,因为许多部署模型基于公开编码器进行微调。
方法:SW-ProxyCE
SW-ProxyCE的核心创新在于利用收缩-白化类原型来近似任务决策边界,从而在无查询条件下生成可迁移的对抗扰动。该方法无需训练额外的代理分类器,降低了攻击成本,同时保持了攻击有效性。
实验与结果
实验覆盖多个EEG任务和多种编码器架构,结果一致表明SW-ProxyCE生成的对抗样本能有效攻击私有下游模型,且性能优于现有方法。这提示基础模型的迁移性可能被恶意利用,需引起重视。
总结与展望
本研究首次系统探讨了EEG基础模型的安全风险,提出了高效的攻击方法,并呼吁社区关注模型的鲁棒性。未来工作可探索防御策略,如对抗训练或模型净化,以增强EEG基础模型部署的安全性。
