AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
安全AI
1 篇相关内容
相关话题
强化学习
人机交互
世界模型
偏好学习
DROPJ:通过人类偏好与解释训练安全智能体行为
研究者提出DROPJ方法,通过人类在模拟环境中的偏好选择和理由说明,训练出更安全可靠的智能体策略,无需预设奖励函数即可在未知动态环境中实现安全部署。
a
arXiv
·
5 天前
安全AI
强化学习
人机交互
世界模型
a