HARC新方法:耦合有害性与拒绝方向,提升大模型安全对齐鲁棒性
理解大语言模型内部如何表征安全性对诊断对齐漏洞至关重要,这能解释越狱攻击为何成功,并为设计鲁棒对齐策略提供依据。先前研究表明,对齐后的LLM会在提示端词元位置的残差流中将有害性与拒绝编码为可分离的方向。最新研究发现,越狱攻击之所以成功,是因为在生成任何词元前就抑制了拒绝或有害性方向,不同攻击类别占据有害性-拒绝平面的不同区域。
将分析扩展到响应端词元位置后,研究者发现模型在生成有害内容时能识别其危害性,即使它在提示端未能识别输入的有害性。基于这一发现,团队提出HARC(有害性与拒绝耦合)微调方法,将提示端和响应端的两个方向进行配对。由于干预仅限于有害性-拒绝子空间,该方法保持残差流其余部分完整,不会降低通用能力或导致过度拒绝。
在大量实验中,HARC在涵盖主要训练时和推理时安全方法的六个基线中实现了最强的鲁棒性-能力-可用性平衡。提示端和响应端的有害性与拒绝方向在测试的五大模型家族和两种规模上可迁移,无需架构特定调整。这项研究为构建更安全、更鲁棒的大模型对齐方案提供了新思路。