ForgetBench:首个评估大模型长期记忆遗忘动态的基准

arXiv·35 天前

大语言模型在知识获取与推理方面表现出色,但其在持续更新过程中保留已学知识的能力仍未被充分理解。现有评估方法多关注单步推理或静态知识编辑,难以捕捉模型持续修改过程中知识保留与退化的动态变化。

为此,研究人员提出ForgetBench基准,专门用于系统评估大模型在持续知识编辑中的遗忘行为。该基准引入两种互补评估范式:基于概念的问答和基于场景的问答,以区分孤立事实保留与结构化关系知识保存。通过构建时序知识流,研究团队评估了模型在多个编辑阶段的行为表现。

为量化分析长期记忆动态,研究进一步提出统一评估框架,模拟知识随时间演变的过程,能够测量时间衰减、保留强度和跨实例稳定性。跨多种模型和编辑方法的实验表明,现有方法难以在长期记忆保留与泛化质量之间取得平衡。

这项研究凸显了未来大模型需要更鲁棒的记忆机制,以实现知识的有效获取、更新和长期保存。相关代码将在论文被接受后开源。

大语言模型知识编辑基准测试记忆机制机器学习

原文来源:https://arxiv.org/abs/2607.26455

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回