多智能体LLM系统面临新威胁:PlanFlip攻击通过规划阶段提示注入实现级联破坏
随着多智能体LLM系统日益普及,系统通常依赖规划器将目标分解为子任务序列,再由执行器和审核器分别执行与审计。最新研究发现,规划阶段已成为关键攻击面——只需在规划器上下文中注入恶意提示,就能实现级联放大效应,同时破坏所有下游子任务。
研究团队提出PlanFlip攻击框架,包含四种规划阶段提示注入攻击方式:目标替换(PF-1)、优先级反转(PF-2)、上下文污染(PF-3)和角色混淆(PF-4)。这些攻击均伪装为合理的工具输出,以规避关键词过滤器检测。
通过对9个前沿LLM模型进行3,479次实验,研究人员得出三个重要发现:首先,模型能力越强反而越脆弱,GPT-5攻击成功率最高达68%,打破了“越强越安全”的固有认知;其次,同质化流水线存在相关智能体盲区,GPT-4o和Llama-3.3-70B虽然攻击成功率接近0,但攻击仍能成功重构计划,而相同架构的审核器却报告任务对齐;第三,推理增强型模型展现出抗攻击能力,DeepSeek-R1在所有攻击中均保持零步骤偏移。
研究团队提出两种防御方案:目标锚定检查(D1)和跨智能体共识(D2),检测率最高可达100%,在16个测试单元中15个优于同架构基线。核心结论是:异构模型多样性是多智能体系统的安全前提,同质化架构内的冗余无法抵御规划阶段攻击。