AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
偏好标注
1 篇相关内容
相关话题
RLHF
模型对齐
数据偏差
人工智能安全
RLHF偏好数据暗藏标注者状态偏差,研究团队提出审计框架
研究人员发现强化学习人类反馈(RLHF)偏好标注中存在结构化偏差:标注者的情绪状态会影响其判断,这种偏差可能通过奖励模型传播至最终模型。团队提出了一套可验证的审计框架。
a
arXiv
·
10 小时前
RLHF
偏好标注
模型对齐
数据偏差
a