双向信息不对称下的AI监督博弈:当人类与AI各有秘密
在AI系统与人类监督者协作的场景中,信息不对称往往不是单向的。最新研究通过建立“上下文赌博机监督博弈”模型,刻画了双向私有信息的典型情境:人类监督者私下知晓自身奖励函数(即真实偏好),而AI系统则私下知晓其建议行动的实际质量。这种不对称性常见于自主机器人或软件代理勘察人类无法直接评估的场景时。
研究基于合作逆强化学习(CIRL)和监督博弈理论,设计了包含“执行/询问/信任/监督”交互界面的团队博弈框架。通过采用赌博机结构(忽略物理状态转移),研究获得了精确的单轮博弈解析解——这在完全的部分可观测马尔可夫决策过程(POMDP)中通常只能作为猜想存在。
研究发现存在一个“可避免的损害区间”:当AI私下知道建议行动有害且停机有益时,基于先验信任的短视人类监督者却可能拒绝启动监督机制,导致损害发生。这一区间被证明是非可信监督沟通的代价。研究进一步分析了在多轮重复博弈中,通过被动学习与主动信号传递(伴随滞后一期的监督响应),该损害区间如何被动态消解。这一工作为设计更鲁棒的人机协作监督机制提供了理论洞察。