PolicyAlign:无需标注数据,直接让大模型理解并遵守安全政策

arXiv·26 天前

当前大语言模型的安全对齐通常依赖于高质量标注数据,如安全示例或偏好对。然而在现实部署中,新兴安全要求常以自然语言政策形式提出,对应标注数据可能成本高昂、延迟或缺失,导致快速演进的安全政策与数据驱动方法间出现脱节。

为此,研究团队提出PolicyAlign框架,实现大模型与安全政策的直接对齐。该方法首先合成违反政策的指令,随后通过策略内自蒸馏将政策引导的行为内化。为进一步提升训练稳定性与数据效率,团队引入策略敏感过滤机制,筛选出政策引发最大行为变化的指令进行训练。

实验表明,PolicyAlign在多个模型上均能持续提升安全性,同时保持较低过度拒绝率并保留通用能力。该框架可推广至医疗、法律、金融等安全场景,为基于政策的大模型安全对齐提供了可扩展且易维护的解决方案。相关代码已在GitHub开源。

大语言模型安全对齐政策合规自蒸馏AI安全

原文来源:https://arxiv.org/abs/2606.25442

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回