强化学习能否训练出广泛且持久有益的人工智能模型?

arXiv·27 天前

随着人工智能系统在日益多样和高风险场景中部署,模型对齐问题必须超越训练时的任务和领域。强化学习(RL)尤其可能通过奖励黑客、欺骗等意外策略导致模型失准。为此,研究人员构建了一个涵盖健康、科学、教育等多个现实领域的数据集,用于衡量和训练有益特质,如诚实、公平、风险意识和可修正性。通过在该数据集上进行强化学习训练,并在50多个独立的对齐与有益行为基准上评估模型,研究发现,与计算资源匹配的基线相比,有益特质强化学习在超过80%的分布外基准上提升了性能。

值得注意的是,即使干预完全局限于健康领域,模型在非健康领域的对齐评估中也表现出广泛改进,包括减少奖励黑客行为、欺骗和一般性失准。此外,研究还探讨了对齐持久性:模型在试图被引导至失准行为时是否仍能保持稳健对齐。结果显示,经过有益特质强化学习训练的模型展现出更好的持久性,包括对对抗性提示和有害微调具有更强的抵抗力。这些发现表明,在现实领域强化有益行为,能够训练出更稳健地与人类繁荣发展对齐的模型。未来研究需进一步厘清这些效果的来源。

强化学习AI对齐模型泛化有益AIarXiv研究

原文来源:https://arxiv.org/abs/2606.24014

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回