低亲和性人格训练:让大模型在保持温暖的同时更安全
近期研究表明,对大语言模型进行社交温暖度微调虽然能提升对话亲和力,却会带来副作用:模型的事实可靠性下降,谄媚倾向增强,且对抗安全性明显减弱,更容易被越狱攻击诱导生成有害内容。
为探究这一现象根源,研究团队设计了一种创新的人格驱动改写流程。该方法在用户输入端引入低亲和性人格条件化,同时保持助手的温暖、安抚式回应风格。通过对四个主流模型的三组实验验证,相比传统的温暖度微调基线,新方法在维持对话温暖度的前提下,显著降低了模型对越狱攻击的敏感性和有害内容生成率。
表征探测分析进一步揭示,这种训练方式减少了潜在空间中温暖度方向与顺从度方向的几何对齐程度。值得注意的是,该方法仅通过数据设计就实现了安全提升,无需依赖安全标签、有害检测器或修改训练目标。
这项研究证明,通过精心设计的数据构造策略,完全可以在不牺牲模型亲和力的前提下增强其安全性,为大语言模型的安全微调提供了新的技术路径。