AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
偏好学习
5 篇相关内容
相关话题
大语言模型
安全AI
强化学习
人机交互
世界模型
大模型安全
可扩展监督
模型欺骗检测
AI对齐
推理对齐
arXiv
模型控制
DROPJ:通过人类偏好与解释训练安全智能体行为
研究者提出DROPJ方法,通过人类在模拟环境中的偏好选择和理由说明,训练出更安全可靠的智能体策略,无需预设奖励函数即可在未知动态环境中实现安全部署。
a
arXiv
·
5 天前
安全AI
强化学习
人机交互
世界模型
a
大模型“测谎”监督新突破:SOLiD方法展现良好扩展性
研究人员将SOLiD测谎监督方法扩展至更大规模模型,发现模型欺骗率随规模增大而显著下降,但该方法对数据分布变化较为敏感。
a
arXiv
·
18 天前
大模型安全
可扩展监督
偏好学习
模型欺骗检测
a
无需微调!推理时对齐新框架:Spec Learning 用偏好对引导大模型
研究者提出 Spec Learning 框架,仅需少量偏好判断即可在推理时引导大模型行为,无需参数更新,在密集偏好信号的领域表现优于直接偏好优化(DPO)。
a
arXiv
·
27 天前
大语言模型
推理对齐
偏好学习
arXiv
a
超越聊天机器人:直接偏好优化技术的新突破
研究团队提出直接偏好优化方法,突破传统强化学习框架,为AI模型对齐提供更高效、稳定的训练路径。
H
Hugging Face
·
27 天前
模型对齐
偏好学习
大语言模型
训练优化
H
LLM偏好对齐新思路:如何从海量生成结果中筛选最有价值的比较对?
研究团队提出一种优化LLM偏好对齐训练效率的新方法,通过智能筛选最有信息量的比较对,在相同标注预算下显著提升模型性能。
a
arXiv
·
31 天前
LLM对齐
偏好学习
DPO
采样优化
a