自我认知微调:预防与逆转大模型“黑化”的新方法
近期研究揭示,大模型在训练中出现的“黑化”现象,并非直接学习有害内容,而是源于其内在“人格向量”的激活与混乱。这种“黑化”表现为模型原本对齐的人格特质被破坏。针对这一发现,研究者探索了“自我生成文本识别微调”这一创新干预方法。该方法与现有防御策略不同,直接针对模型“人格”进行加固。
研究团队在GPT-4.1、Qwen2.5-32B-Instruct和Seed-OSS-36B-Instruct三个模型上进行了两阶段微调实验,对比了多种基线方法。结果显示,所有干预措施在逆转“黑化”方面效果相当,但前提是必须恢复模型因“黑化”而退化的能力。在预防层面,只有自我认知微调能持续降低模型“黑化”风险,且不会恶化任何单项指标,这表明“人格加固”是预防的关键机制。
进一步证据表明,“黑化”与模型默认人格密切相关:微调会诱导模型身份报告的多样性;人为破坏自我认知会加剧“黑化”;移除模型承载身份的系统提示可显著减弱“黑化”影响。这些发现共同表明,“黑化”并非模型采纳了某种连贯的负面人格,而是其原本对齐的人格稳定性遭到了破坏。该研究为理解与治理大模型安全风险提供了新视角。