Moir:让模型自导知识编辑,破解跨域编辑难题

arXiv·41 天前

语言模型训练完成后通常保持冻结状态,但现实世界持续演变。知识编辑作为完全重新训练的替代方案,其应用面临核心能力退化的瓶颈:数学和编程推理能力大幅下降,而百科知识回忆却保持完好。研究发现这种不对称退化源于分布不匹配问题。传统基于协方差的编辑方法仅保留参考语料库张成的子空间,但无法捕捉到模型在监督微调(SFT)和直接偏好优化(DPO)等后训练过程中形成的操作分布。包括维基百科甚至原始预训练混合数据在内的静态外部语料库,都无法恢复这种偏移的流形。为此,研究者提出Moir方法,直接从模型自身解码分布中采样来估计保留协方差C。该方法仅需使用单个随机词汇标记作为生成种子,即可绕过通常主导采样输出的指令跟随模板,揭示模型已内化的更广泛子空间。Moir无需外部数据,可作为任何基于协方差编辑器的即插即用组件,这一优势尤其重要,因为大多数现代大语言模型的预训练和后训练语料库并不公开。在OLMo-2、Llama-3.1和Qwen-3(7-8B)模型上,无论是使用MEMIT还是AlphaEdit编辑方法,在批量和顺序编辑场景下,Moir都能在最脆弱的领域持续扩展保留能力。最显著的是,Qwen3-8B经过20,000次AlphaEdit批量编辑后,使用Moir的GSM8K准确率保持在79.9%,而基于维基百科基线的准确率仅为10.9%。这些结果表明,将保留分布与模型的操作分布对齐是非破坏性编辑的关键因素,而模型本身可能是已部署系统获取该分布的最便捷来源。

知识编辑大语言模型模型优化推理能力跨域学习

原文来源:https://arxiv.org/abs/2607.20433

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回