精选今天0 投票
PlanFlip:利用规划阶段提示注入攻击多智能体LLM系统
研究背景与核心发现
多智能体LLM系统通常依赖一个**Planner(规划器)**来将用户目标分解为子任务序列,再由Executor(执行器)和Critic(评审器)执行与审计。然而,最新研究揭示了这一架构的致命弱点:规划阶段成为关键攻击面——一次注入到Planner上下文的恶意提示,就能引发级联放大效应,同时污染所有下游子任务。
来自研究者Yuhang Wang的论文《PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection》提出了PlanFlip框架,包含四种规划阶段提示注入攻击方法:GoalSubstitution(PF-1,目标替换)、PriorityInversion(PF-2,优先级反转)、ContextPollution(PF-3,上下文污染)和RoleConfusion(PF-4,角色混淆)。这些攻击伪装成合理的工具输出,以绕过关键词过滤器。
关键实验结果
研究团队在9个前沿LLM上进行了3479次实验,得出三个重要发现:
- 能力越强,漏洞越深:GPT-5的攻击成功率(ASR)高达0.68,打破了“更强模型更安全”的假设。
- 同质化管线的盲区:GPT-4o和Llama-3.3-70B的ASR接近0,但Stealth(隐蔽性)=1.00,且StepShift(步骤偏移)>0——攻击成功改变了规划,而同一基座的Critic却报告一致。两位独立评审员确认语义偏差仅为-0.20到-0.32,相关性r=0.943。
- 推理增强模型的抵抗力:DeepSeek-R1在所有攻击中StepShift=0.00,表现出色。
防御方案与启示
论文提出两种检测方法:GoalAnchorCheck(D1)和CrossAgentConsensus(D2),在15/16个测试单元中检测率高达1.00,远超同基座基线。核心结论是:异构模型多样性是多智能体系统的安全前提,而同质基座内的冗余无法防御规划阶段攻击。
这一研究为多智能体LLM系统的设计者敲响警钟:在追求能力的同时,必须引入模型多样性和规划阶段的安全校验机制。