DROPJ:通过人类偏好与解释训练安全智能体行为

arXiv·5 天前

在安全关键环境中,传统强化学习往往因缺乏合适的奖励函数而难以适用。arXiv最新研究提出DROPJ这一以人为中心的方法,通过结合人类偏好与解释来训练和部署安全智能体。该方法首先从真实世界轨迹数据中学习世界模型(即模拟器),然后让人类在模拟环境中生成信息丰富的轨迹。研究者从这些轨迹中采样片段,邀请人类标注偏好选择并说明理由。基于这些带解释的偏好数据,系统训练奖励模型,并结合世界模型通过模型预测控制直接部署智能体。实验表明,与现有策略相比,从用户生成信息轨迹显著降低了训练计算成本,并提升了部署性能。研究进一步证明,偏好数据相比其他反馈形式能大幅改善部署效果,而伴随偏好的安全解释能显著增强安全性,或优先保障用户指定的安全维度。该方法为未知动态环境中的安全智能体训练提供了新思路。

安全AI强化学习人机交互世界模型偏好学习

原文来源:https://arxiv.org/abs/2607.13172

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回