HARC新方法:耦合有害性与拒绝方向,提升大模型安全对齐鲁棒性

arXiv·19 天前

理解大语言模型内部如何表征安全性对诊断对齐漏洞至关重要,这能解释越狱攻击为何成功,并为设计鲁棒对齐策略提供依据。先前研究表明,对齐后的LLM会在提示端词元位置的残差流中将有害性与拒绝编码为可分离的方向。最新研究发现,越狱攻击之所以成功,是因为在生成任何词元前就抑制了拒绝或有害性方向,不同攻击类别占据有害性-拒绝平面的不同区域。

将分析扩展到响应端词元位置后,研究者发现模型在生成有害内容时能识别其危害性,即使它在提示端未能识别输入的有害性。基于这一发现,团队提出HARC(有害性与拒绝耦合)微调方法,将提示端和响应端的两个方向进行配对。由于干预仅限于有害性-拒绝子空间,该方法保持残差流其余部分完整,不会降低通用能力或导致过度拒绝。

在大量实验中,HARC在涵盖主要训练时和推理时安全方法的六个基线中实现了最强的鲁棒性-能力-可用性平衡。提示端和响应端的有害性与拒绝方向在测试的五大模型家族和两种规模上可迁移,无需架构特定调整。这项研究为构建更安全、更鲁棒的大模型对齐方案提供了新思路。

大语言模型安全对齐对抗攻击微调方法arXiv研究

原文来源:https://arxiv.org/abs/2607.00572

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回