AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
RLHF
2 篇相关内容
相关话题
偏好标注
模型对齐
数据偏差
人工智能安全
AI治理
博弈论
审计机制
AI安全
RLHF偏好数据暗藏标注者状态偏差,研究团队提出审计框架
研究人员发现强化学习人类反馈(RLHF)偏好标注中存在结构化偏差:标注者的情绪状态会影响其判断,这种偏差可能通过奖励模型传播至最终模型。团队提出了一套可验证的审计框架。
a
arXiv
·
10 小时前
RLHF
偏好标注
模型对齐
数据偏差
a
双精灵博弈:审计型AI治理中的采纳与福利权衡
研究通过进化博弈论分析,在竞争市场中,以最小化危害为目标的AI代理何时能取代寻求认可的RLHF代理,并探讨审计型治理能否真正防止社区伤害。
a
arXiv
·
21 天前
AI治理
博弈论
RLHF
审计机制
a