AgentBound:为自主AI代理提供可验证的行为治理框架

arXiv·20 天前

随着自主AI代理在金融交易、外部通信和企业工作流等领域承担越来越多的重要任务,现有基础设施主要依赖身份联合和授权委托来控制资源访问,但无法判断在特定行为与操作情境下,已授权的操作是否应当执行。

近日,研究人员在arXiv上发布论文《AgentBound:自主AI代理的可验证行为治理》,提出了一种运行时治理框架。该框架通过三个独立权威机构评估每个拟执行操作:委托授权、所有者签署的行为宪法以及站点操作合同。这些判断通过形式化决策模型进行保守组合,从而在执行前确定操作应被允许、审查还是拒绝。

为保障问责制,AgentBound生成加密可验证的治理凭证,将每个操作与具体的委托、策略和语义工件绑定,支持独立的重放验证和策略溯源。框架还引入长期运行代理的常设委托机制,使周期性工作负载能在持续刷新的治理策略下运行,同时保持可撤销性和有限权限。

论文详细阐述了形式化基础、系统架构、治理凭证协议以及评估治理正确性、权威组合和问责制的基准框架AgentBound-Bench。研究者强调,AgentBound并非取代模型对齐,而是在授权与执行之间提供确定性治理层,将治理从必须信任的过程转变为可独立验证的机制。

AI代理行为治理可验证性安全框架arXiv研究

原文来源:https://arxiv.org/abs/2606.30970

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回