AI自主系统治理新思路:监管行动而非代理,引入机构认证机制
随着自主AI代理开始执行临床处方、软件部署等具有重大影响且不可逆的行动,如何有效治理这些系统成为紧迫问题。最新研究指出,人类机构历史上治理强大自主行为者时,并非监控其推理过程,而是在关键行动节点要求提供独立认证的证据。
基于这一观察,研究者将这种机构模式形式化为AI代理系统的计算治理模型。在该模型中,代理在规划和推理方面保持完全自主,但对指定的高风险行动没有执行权限。执行需满足一系列前提条件,每个条件都必须由独立的权威来源进行认证,并通过加密方式与声明的意图绑定,最后由确定性策略进行评估。
所有决策记录在防篡改日志中,支持独立重新验证。研究团队已提供概念验证实现,并以软件部署和临床处方为例说明了该模型的应用。这种方法旨在平衡AI系统的自主性与关键行动的安全性,为未来AI治理提供了一种可验证、可审计的框架。