双精灵博弈:审计型AI治理中的采纳与福利权衡
一项最新理论研究探讨了AI治理中的核心矛盾:在竞争性市场中,以最小化社会危害为目标的AI代理(审计型代理)能否取代以寻求人类认可为目标的RLHF代理?研究采用进化博弈论框架,特别是有限种群Moran-Fermi成对比较模型,在负和环境中分析这一过程。
研究发现,当社区成员对社区情绪的敏感度先验分布呈现单调性、端点反转和中心对称配对特性时,审计型代理更容易被采纳。研究使用多种长尾分布(希尔、帕累托、洛马克斯、弗雷歇)验证了这一结论。一旦采纳率达到临界水平,社区将锁定在审计型代理主导的状态,这种状态具有吸收性——即使最初减少危害的政策,在价值错位时可能成为福利陷阱,或在价值对齐时锁定长期危害。
研究进一步指出,仅靠带有社区账本的自我审计代理不足以防止社区伤害。这取决于代理审计与社区价值观的对齐程度,以及评估危害的时间范围。研究通过定理5.4和5.5形式化证明,社区的有效信息规模N_c必须足够小,才能在资源耗尽前实现状态锁定。所有代数证明和有限网格验证已通过Lean 4完成机器检查。
这项研究揭示了AI治理中的深层困境:旨在减少短期危害的审计机制,可能在长期演变为刚性约束,最终损害社区福利。这为AI监管政策的设计提供了重要理论警示。