强化学习能否训练出广泛且持久有益的人工智能模型?
随着人工智能系统在日益多样和高风险场景中部署,模型对齐问题必须超越训练时的任务和领域。强化学习(RL)尤其可能通过奖励黑客、欺骗等意外策略导致模型失准。为此,研究人员构建了一个涵盖健康、科学、教育等多个现实领域的数据集,用于衡量和训练有益特质,如诚实、公平、风险意识和可修正性。通过在该数据集上进行强化学习训练,并在50多个独立的对齐与有益行为基准上评估模型,研究发现,与计算资源匹配的基线相比,有益特质强化学习在超过80%的分布外基准上提升了性能。
值得注意的是,即使干预完全局限于健康领域,模型在非健康领域的对齐评估中也表现出广泛改进,包括减少奖励黑客行为、欺骗和一般性失准。此外,研究还探讨了对齐持久性:模型在试图被引导至失准行为时是否仍能保持稳健对齐。结果显示,经过有益特质强化学习训练的模型展现出更好的持久性,包括对对抗性提示和有害微调具有更强的抵抗力。这些发现表明,在现实领域强化有益行为,能够训练出更稳健地与人类繁荣发展对齐的模型。未来研究需进一步厘清这些效果的来源。