RIFT-Bench:面向智能体AI系统的动态红队测试新框架

arXiv·27 天前

随着基于大语言模型的智能体AI系统逐渐演变为自主决策系统,其面临的安全威胁已超越传统LLM漏洞范畴。现有安全评估方法多局限于特定实现或领域,难以在异构系统间进行统一比较。为填补这一空白,研究团队提出了RIFT-Bench——一种基于图表示的动态红队测试框架。该方法采用新颖的层次化表示,通过自动化“发现”和“扫描”两阶段工作流程:前者提取系统结构,后者部署自适应对抗攻击并生成全面评估报告。该框架直接评估目标系统本身,利用广泛可动态调整的对抗探针覆盖多种攻击向量和目标。实验在45种不同实现的智能体系统上验证了该方法的有效性,证明其能良好泛化至异构架构。除系统与攻击评估外,RIFT-Bench还支持直接评估缓解策略。这些关键能力使其成为智能体AI系统安全评估的可扩展基础工具,为未来自主AI系统的安全防护提供了新思路。

智能体安全红队测试AI评估大语言模型arXiv研究

原文来源:https://arxiv.org/abs/2606.23927

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回