新方法实现大模型知识编辑的精准逆转:只删恶意不改良性

arXiv·7 小时前

知识编辑技术为大语言模型更新事实知识提供了高效途径,但恶意编辑可能引入安全隐患,需要及时逆转不良编辑效果。现有针对参数修改型编辑的逆转方法主要关注全局移除,但这可能同时删除本应保留的有益编辑内容。

近日,研究团队提出了一种选择性知识编辑逆转方法,其目标是在逆转特定被编辑事实的同时,保留其余编辑过的知识。该方法基于一个关键假设:每个编辑都在被编辑矩阵的主导子空间内稀疏编码。

研究团队开发了基于谱分析的逆转框架,通过定位编辑权重主导奇异子空间内的编辑敏感成分来实现选择性逆转。实验表明,该方法在多个设置下均能有效逆转选定编辑,同时保持不相关编辑事实的完整性。

这些发现表明,不同编辑在主导奇异成分中稀疏编码,当编辑数量适中时可实现分离。选择性谱逆转为定位编辑特定成分和修复编辑后语言模型提供了有前景的研究方向,有望提升大模型知识更新的安全性与可控性。

大语言模型知识编辑模型安全参数修改奇异值分解

原文来源:https://arxiv.org/abs/2609.02091

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
无需训练!IDEEA实现输入依赖的激活匹配引导
HyGRAIL:融合图神经网络与LLM的智能科学假设发现框架

← 返回