RIFT-Bench:面向智能体AI系统的动态红队测试新框架
随着基于大语言模型的智能体AI系统逐渐演变为自主决策系统,其面临的安全威胁已超越传统LLM漏洞范畴。现有安全评估方法多局限于特定实现或领域,难以在异构系统间进行统一比较。为填补这一空白,研究团队提出了RIFT-Bench——一种基于图表示的动态红队测试框架。该方法采用新颖的层次化表示,通过自动化“发现”和“扫描”两阶段工作流程:前者提取系统结构,后者部署自适应对抗攻击并生成全面评估报告。该框架直接评估目标系统本身,利用广泛可动态调整的对抗探针覆盖多种攻击向量和目标。实验在45种不同实现的智能体系统上验证了该方法的有效性,证明其能良好泛化至异构架构。除系统与攻击评估外,RIFT-Bench还支持直接评估缓解策略。这些关键能力使其成为智能体AI系统安全评估的可扩展基础工具,为未来自主AI系统的安全防护提供了新思路。