DROPJ:通过人类偏好与解释训练安全智能体行为
在安全关键环境中,传统强化学习往往因缺乏合适的奖励函数而难以适用。arXiv最新研究提出DROPJ这一以人为中心的方法,通过结合人类偏好与解释来训练和部署安全智能体。该方法首先从真实世界轨迹数据中学习世界模型(即模拟器),然后让人类在模拟环境中生成信息丰富的轨迹。研究者从这些轨迹中采样片段,邀请人类标注偏好选择并说明理由。基于这些带解释的偏好数据,系统训练奖励模型,并结合世界模型通过模型预测控制直接部署智能体。实验表明,与现有策略相比,从用户生成信息轨迹显著降低了训练计算成本,并提升了部署性能。研究进一步证明,偏好数据相比其他反馈形式能大幅改善部署效果,而伴随偏好的安全解释能显著增强安全性,或优先保障用户指定的安全维度。该方法为未知动态环境中的安全智能体训练提供了新思路。