让强化学习“说人话”:新方法将黑盒策略转化为可执行的Prolog逻辑程序

arXiv·1 天前

深度强化学习策略通常被视为难以理解的“黑盒”。近日,一项发表在arXiv上的研究提出了一种创新方法,旨在将这些黑盒策略转化为可解释、可执行的逻辑程序。该方法采用三阶段后处理转换:首先提取一个冻结的近端策略优化教师策略;接着以经典关系学习的方式,从其决策中归纳出一个有序规则列表;最后将结果输出为Prolog程序,该程序的每个决策都可由现成的逻辑引擎执行。研究还包含一个后续的扩展阶段,该阶段会编辑规则库,并且仅在策略评估确认回报增加时才接受编辑。

研究团队为此方法提供了四项理论保证:在有限马尔可夫决策过程中,一个回报损失界限使得提炼出的程序成为机器可验证的证书;扩展循环能单调改进并最终终止。对于连续观测设置,研究回答了转换是否可能的问题:命题阈值实例化可将网络以任意保真度转换,其分歧和回报差距均以O(1/B)的速率缩小,同时一个匹配的下界表明,对于倾斜决策边界,其成本在观测维度上是指数级的。

实证结果显示,在一个拥有16,944个可达状态的“两房间钥匙与门”任务中,扩展后的Prolog程序在所有随机种子下都达到了精确的最优回报。在三个连续控制任务中,生成的程序成功替代了原神经网络:在Acrobot任务上以11条子句匹配了神经教师策略的性能(在噪声范围内);在CartPole任务上恢复了约97%的回报;而在控制更精细的LunarLander任务上仅部分恢复,这与指数下界预测的上限相符。这项工作为强化学习模型的可靠性与可解释性提供了新的技术路径。

可解释AI强化学习Prolog规则提取模型蒸馏

原文来源:https://arxiv.org/abs/2607.15459

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回