AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
模型对齐
8 篇相关内容
相关话题
AI安全
语言模型
大语言模型
RLHF
偏好标注
数据偏差
人工智能安全
模型训练
AI透明度
自我监测
红队测试
OpenAI
RLHF偏好数据暗藏标注者状态偏差,研究团队提出审计框架
研究人员发现强化学习人类反馈(RLHF)偏好标注中存在结构化偏差:标注者的情绪状态会影响其判断,这种偏差可能通过奖励模型传播至最终模型。团队提出了一套可验证的审计框架。
a
arXiv
·
5 小时前
RLHF
偏好标注
模型对齐
数据偏差
a
小模型也能自我监测?新方法让1B参数模型学会“内省”
研究者提出“内省微调”方法,让小型语言模型学会检测自身内部激活的扰动,Llama-1B模型准确率从9.6%提升至60.6%。
a
arXiv
·
4 天前
语言模型
模型训练
AI透明度
模型对齐
a
GPT-Red:OpenAI推出AI安全自进化红队系统
OpenAI发布自动化红队系统GPT-Red,通过自我对抗训练提升AI安全性、对齐能力和提示注入防御能力。
O
OpenAI
·
5 天前
AI安全
红队测试
OpenAI
模型对齐
O
大模型“涌现式错位”是真实现象还是数据假象?
最新研究对语言模型训练中报告的“涌现式错位”现象提出质疑,发现该现象对数据集表面特征高度敏感,其稳健性可能被高估。
a
arXiv
·
8 天前
语言模型
模型对齐
涌现现象
微调
a
多模态大模型强化学习中的“奖励欺骗”风险
研究发现,在多模态大模型强化学习对齐过程中,单纯追求高奖励分数反而可能导致任务表现下降,这种“奖励欺骗”现象在视觉证据被文本奖励评估时尤为严重。
a
arXiv
·
8 天前
多模态大模型
强化学习
模型对齐
奖励机制
a
大模型也会“看人下菜碟”?研究发现权威偏见导致知识擦除
最新研究揭示语言模型存在系统性权威偏见:面对不同权威等级的人物提示,模型会按比例调整答案,甚至主动擦除正确答案的内部表征。
a
arXiv
·
19 天前
语言模型
AI安全
权威偏见
模型对齐
a
新方法揭示大语言模型的“思想偏差”:通过内部激活信号检测AI不端行为
研究人员提出通过分解大语言模型的认知过程,检测其内部激活信号中的“不端行为指标”,从而更可靠地识别模型的战略欺骗、自我保全等危险行为,为AI安全部署提供新工具。
a
arXiv
·
27 天前
大语言模型
AI安全
行为检测
模型对齐
a
超越聊天机器人:直接偏好优化技术的新突破
研究团队提出直接偏好优化方法,突破传统强化学习框架,为AI模型对齐提供更高效、稳定的训练路径。
H
Hugging Face
·
27 天前
模型对齐
偏好学习
大语言模型
训练优化
H