新研究:用逻辑编程量化强化学习策略的可解释性

arXiv·5 天前

在安全关键和人机协作场景中,强化学习(RL)策略的可解释性至关重要。当前的可解释强化学习(XRL)方法多依赖用户研究,缺乏统一的客观评估标准。而基于逻辑的可解释人工智能(XAI)方法虽能提供人类可读的决策抽象,但其可解释性程度难以系统量化。

近日,一项发表于arXiv的研究旨在推动XRL领域发展,为RL策略的可解释性引入了客观且面向规划的量化指标。该研究同时为逻辑在XAI中的应用提供了新思路,提出了一种量化逻辑规则可解释性的原则性方法,超越了常识性评估和简单的命题逻辑片段。

研究团队采用归纳逻辑编程(ILP)提取RL策略的符号化表示,并定义了一套新颖的可解释性指标,包括激活率、特征覆盖率、句法距离和语义距离。这些指标能够量化符号规则与智能体行为之间的对齐程度、特征在决策中的作用,以及单智能体和多智能体RL训练过程中策略的演变。

在不同RL领域的实验中,所提出的指标不仅揭示了超越全局回报的、特定于动作的学习动态,提供了比传统全局特征重要性估计方法更细粒度的领域特征洞察,还揭示了多智能体强化学习中的协调、专业化和适应模式。此外,这些指标为特定动作策略的迁移和泛化提供了关键见解。

强化学习可解释AI归纳逻辑编程策略可解释性评估指标

原文来源:https://arxiv.org/abs/2607.13655

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回