AI自主系统治理新思路:监管行动而非代理,引入机构认证机制

arXiv·25 天前

随着自主AI代理开始执行临床处方、软件部署等具有重大影响且不可逆的行动,如何有效治理这些系统成为紧迫问题。最新研究指出,人类机构历史上治理强大自主行为者时,并非监控其推理过程,而是在关键行动节点要求提供独立认证的证据。

基于这一观察,研究者将这种机构模式形式化为AI代理系统的计算治理模型。在该模型中,代理在规划和推理方面保持完全自主,但对指定的高风险行动没有执行权限。执行需满足一系列前提条件,每个条件都必须由独立的权威来源进行认证,并通过加密方式与声明的意图绑定,最后由确定性策略进行评估。

所有决策记录在防篡改日志中,支持独立重新验证。研究团队已提供概念验证实现,并以软件部署和临床处方为例说明了该模型的应用。这种方法旨在平衡AI系统的自主性与关键行动的安全性,为未来AI治理提供了一种可验证、可审计的框架。

AI治理自主系统机构认证安全机制计算模型

原文来源:https://arxiv.org/abs/2606.26298

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回