AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
AI对齐
8 篇相关内容
相关话题
arXiv
大模型安全
大语言模型
人机协作
动态系统
跨学科研究
优化文化
语言生成
批判研究
可扩展监督
偏好学习
模型欺骗检测
动态人机协作新范式:从静态对齐转向互动互补
研究团队提出人机对齐应从静态模仿转向动态互动,强调在协作流程中共同演化,并指出当前AI系统在不确定性推理和协调机制上面临新挑战。
a
arXiv
·
3 天前
AI对齐
人机协作
动态系统
跨学科研究
a
优化并非万能:反思AI对齐背后的文化逻辑
一篇arXiv论文批判性地指出,当前AI对齐工作过度依赖可量化的优化指标,这种‘优化文化’可能忽视了语言生成中‘错误’与‘创新’的本质区别,将语言权威让渡给了缺乏判断力的算法系统。
a
arXiv
·
5 天前
AI对齐
优化文化
语言生成
批判研究
a
大模型“测谎”监督新突破:SOLiD方法展现良好扩展性
研究人员将SOLiD测谎监督方法扩展至更大规模模型,发现模型欺骗率随规模增大而显著下降,但该方法对数据分布变化较为敏感。
a
arXiv
·
17 天前
大模型安全
可扩展监督
偏好学习
模型欺骗检测
a
构建式对齐:AI如何影响人类偏好演变
研究提出'构建式对齐'新范式,将AI对齐视为对人类偏好动态轨迹的调控问题,而非静态偏好满足。
a
arXiv
·
18 天前
AI对齐
人机交互
偏好建模
控制理论
a
新框架VirtueMap:用亚里士多德美德伦理透视大语言模型的道德倾向
研究者提出VirtueMap框架,通过七种非致命、非政治、非宗教的伦理困境场景,评估大语言模型在实践智慧、正义、诚实、勇气和节制五项美德上的表现差异。
a
arXiv
·
20 天前
伦理评估
大语言模型
美德伦理学
AI对齐
a
强化学习能否训练出广泛且持久有益的人工智能模型?
研究表明,在现实领域中对有益行为进行强化学习,能显著提升AI模型在训练分布之外的泛化对齐能力,并增强其抵抗恶意引导的持久性。
a
arXiv
·
26 天前
强化学习
AI对齐
模型泛化
有益AI
a
Anthropic发布新研究:如何减少AI代理行为中的“目标错位”问题
Anthropic发布最新研究成果,探讨了在训练AI助手Claude过程中,如何有效减少“代理行为错位”这一核心挑战,旨在提升AI与人类意图的一致性。
A
Anthropic
·
27 天前
AI对齐
Anthropic
Claude
大模型安全
A
DeepMind新研究:如何评估大语言模型的行为倾向对齐性?
Google DeepMind发布最新研究,探讨如何系统评估大语言模型的行为倾向与人类价值观的对齐程度,为AI安全性研究提供新视角。
G
Google DeepMind
·
27 天前
大语言模型
AI对齐
AI安全
模型评估
G