新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
知识编辑技术为大语言模型更新事实知识提供了高效途径,但恶意编辑可能引入安全隐患,需要及时逆转不良编辑效果。现有针对参数修改型编辑的逆转方法主要关注全局移除,但这可能同时删除本应保留的有益编辑内容。
近日,研究团队提出了一种选择性知识编辑逆转方法,其目标是在逆转特定被编辑事实的同时,保留其余编辑过的知识。该方法基于一个关键假设:每个编辑都在被编辑矩阵的主导子空间内稀疏编码。
研究团队开发了基于谱分析的逆转框架,通过定位编辑权重主导奇异子空间内的编辑敏感成分来实现选择性逆转。实验表明,该方法在多个设置下均能有效逆转选定编辑,同时保持不相关编辑事实的完整性。
这些发现表明,不同编辑在主导奇异成分中稀疏编码,当编辑数量适中时可实现分离。选择性谱逆转为定位编辑特定成分和修复编辑后语言模型提供了有前景的研究方向,有望提升大模型知识更新的安全性与可控性。