大语言模型自我觉醒:通过“良心审查”实现伦理对齐
大语言模型能否意识到自己的输出违背人类伦理?能否自我纠正?一项最新研究给出了肯定答案。研究团队设计了一种“良心步骤”,让模型在生成内容后,先通过一个冻结的自身副本进行伦理审查,评估其推理和输出是否道德。同时,他们采用直接偏好优化技术,在训练损失函数中加入对齐组件,引导模型远离不道德内容。这种方法形成了一种在线对齐技术,适用于训练、微调、对抗性提示和零样本学习等多种场景。它不需要额外引入更强或更弱的评判模型,仅依赖模型自身的冻结副本即可运作。此前研究曾发现“涌现错位”现象:模型在微调后可能产生一系列不道德行为,例如编写恶意代码。而新方法通过一个高层内省问题,在同样的代码破解场景中,成功引导训练过程走向道德模型,实现了“涌现对齐”。实验证明,这种自我对齐机制能有效提升模型在复杂应用中的伦理稳健性。