多智能体框架自动生成对抗样本,提升多模态大模型安全防御能力
多模态大语言模型在内容安全审核等任务中应用日益广泛,但其仍面临对抗攻击和分布外边缘案例的威胁。传统主动学习和人工标注方法难以应对新型多模态威胁的复杂性和规模。针对这一挑战,研究团队提出了一种全自动、智能化的红队测试框架。该框架采用多智能体架构,包含一个高推理能力的架构师智能体、一个先进的图像生成器以及一个多层级验证委员会。系统通过迭代策略自主生成新颖假设并对过往尝试进行变异,无需人工干预即可发现边界违规和模糊策略边缘案例。研究团队利用这些精心合成的对抗样本作为上下文演示,通过测试时检索技术显著提升了目标模型的鲁棒性。在公开图像安全基准测试中,该方法将目标模型的假阴性率从41.2%降低至24.5%,且完全无需人工标注。这项研究为自动化模型安全测试提供了新思路,有望推动多模态大模型在实际应用中的安全部署。