大模型代理安全新突破:基于溯源分析防止指令偏离

arXiv·18 天前

随着大模型代理获得越来越多强大工具的访问权限,确保其行为与用户意图保持一致变得至关重要。当代理提出的工具调用偏离用户意图时,可能导致难以撤销的有害后果。现有运行时防护机制依赖“大模型即裁判”范式,缺乏系统化的对齐推理框架,常产生不一致或难以审计的判断。

受溯源分析启发,研究团队提出基于溯源的概念框架,将偏离检测形式化为判断代理提出的工具调用是否能在其上下文中找到可追溯的证据支持。基于此框架,他们开发了ProvenanceGuard多阶段管道,在执行选定工具前分析代理行为的三种偏离类型,仅当行为被认为与用户输入查询一致时才允许执行。

研究在Agent-SafetyBench和WorkBench两个基准上评估了该方法,涵盖10个基础大模型。与“大模型即裁判”基线相比,ProvenanceGuard在Agent-SafetyBench上将偏离轨迹的错误率从42.9%降至1.8%,在WorkBench上从32.1%降至17.3%。同时,在任务成功轨迹上的干预负担从30.5%降至12.8%,且在对齐轨迹上未引入统计显著的不必要干预增加。

这些结果表明,基于溯源的推理为保护大模型代理免受偏离提供了有效且实用的基础。该研究为大模型代理安全领域提供了新的技术路径,有望在实际应用中提升AI系统的可靠性和可控性。

大模型安全AI代理溯源分析对齐研究arXiv

原文来源:https://arxiv.org/abs/2607.01236

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回