小模型持续学习新突破:MIITA框架实现推理时记忆自适应

arXiv·37 天前

在资源受限的实际部署中,小语言模型需要持续学习能力以适应不断变化的需求,但直接更新其有限参数会导致灾难性遗忘。传统基于记忆的方法虽然能解耦知识保留与参数更新,但这些为大模型设计的方法依赖充足的存储和强大的上下文推理能力,而小模型往往不具备这些条件。

针对这一挑战,研究团队提出了MIITA框架——一种面向存储受限环境下监督式持续学习的记忆诱导推理时自适应方法。该框架将监督学习经验存储为紧凑的校正方向原型,并配备语义锚点。在推理时,系统通过语义和不确定性线索检索这些方向,并通过门控临时隐藏状态自适应机制应用检索结果。

这一设计实现了对过往监督知识的非破坏性重用,无需更新模型主干、扩展提示词或进行测试时反向传播。理论分析表明,该框架与一阶损失减少、不确定性引导检索以及保持旧阶段知识的方向覆盖度存在内在联系。

在多种监督式持续学习场景下的实验证明,MIITA在固定内存预算下能持续提升最终性能并有效缓解遗忘现象,为小模型在现实场景中的持续进化提供了可行方案。

小语言模型持续学习推理时适应记忆机制灾难性遗忘

原文来源:https://arxiv.org/abs/2607.22556

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回