PolicyAlign:无需标注数据,直接让大模型理解并遵守安全政策
当前大语言模型的安全对齐通常依赖于高质量标注数据,如安全示例或偏好对。然而在现实部署中,新兴安全要求常以自然语言政策形式提出,对应标注数据可能成本高昂、延迟或缺失,导致快速演进的安全政策与数据驱动方法间出现脱节。
为此,研究团队提出PolicyAlign框架,实现大模型与安全政策的直接对齐。该方法首先合成违反政策的指令,随后通过策略内自蒸馏将政策引导的行为内化。为进一步提升训练稳定性与数据效率,团队引入策略敏感过滤机制,筛选出政策引发最大行为变化的指令进行训练。
实验表明,PolicyAlign在多个模型上均能持续提升安全性,同时保持较低过度拒绝率并保留通用能力。该框架可推广至医疗、法律、金融等安全场景,为基于政策的大模型安全对齐提供了可扩展且易维护的解决方案。相关代码已在GitHub开源。