AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
人工智能安全
3 篇相关内容
相关话题
RLHF
偏好标注
模型对齐
数据偏差
Claude
Anthropic
AI可解释性
逆向工程
大语言模型
伦理对齐
直接偏好优化
自我监督
RLHF偏好数据暗藏标注者状态偏差,研究团队提出审计框架
研究人员发现强化学习人类反馈(RLHF)偏好标注中存在结构化偏差:标注者的情绪状态会影响其判断,这种偏差可能通过奖励模型传播至最终模型。团队提出了一套可验证的审计框架。
a
arXiv
·
10 小时前
RLHF
偏好标注
模型对齐
数据偏差
a
科学家解码Claude AI思维,发现奇特内部机制
研究人员通过逆向工程窥探Claude AI的内部工作过程,揭示其决策逻辑中存在的非直观模式与潜在偏差。
A
Anthropic
·
31 天前
Claude
Anthropic
AI可解释性
逆向工程
A
大语言模型自我觉醒:通过“良心审查”实现伦理对齐
研究者提出一种在线对齐技术,让大语言模型通过自我审查和直接偏好优化,在训练、微调等场景中主动识别并修正不道德输出。
a
arXiv
·
31 天前
大语言模型
伦理对齐
直接偏好优化
自我监督
a