AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
自我监督
1 篇相关内容
相关话题
大语言模型
伦理对齐
直接偏好优化
人工智能安全
大语言模型自我觉醒:通过“良心审查”实现伦理对齐
研究者提出一种在线对齐技术,让大语言模型通过自我审查和直接偏好优化,在训练、微调等场景中主动识别并修正不道德输出。
a
arXiv
·
32 天前
大语言模型
伦理对齐
直接偏好优化
自我监督
a