LLM智能体遭遇“记忆更新鸿沟”:长期对话中事实更迭成难题

arXiv·22 天前

在长期多轮对话场景中,现实信息会不断变化——用户搬家、价格调整、计划修改。智能体需要准确使用最新事实并摒弃过时信息。最新研究通过真实对话数据发现,当前LLM智能体在这一能力上存在显著缺陷。

在LongMemEval的知识更新测试集中,即使使用前沿模型(如GPT-5.4),当将完整上下文替换为有限的自维护记忆时,准确率从92%骤降至77%。统计检验显示这一差距显著存在,且随着模型规模扩大,完整上下文准确率稳定在92%附近,而记忆维护能力未见改善。研究表明瓶颈在于记忆维护机制而非理解能力。

实验进一步发现,问题并非源于记忆容量不足:当对话长度增长24倍时,准确率从68%进一步跌至28%,即使按比例增加记忆容量也未见恢复。失败程度与对话长度成正比,而非压缩比率。

为此,研究团队发布了Supersede强化学习训练环境。该环境将记忆更新能力转化为训练信号:智能体因使用最新事实获得奖励,因依赖陈旧信息受到惩罚。实验显示,基于Qwen2.5-3B模型进行GRPO微调后,其在真实未见过对话中的事实更新准确率几乎翻倍(从9.0%提升至16.7%),单调上升的检查点曲线表明提升来自学习到的策略而非测试框架。

这是首个以时序事实新鲜度为训练目标的可行环境,也是首次证明“记忆更新鸿沟”可通过训练有效缩小的实证研究。

LLM智能体记忆更新强化学习对话系统模型训练

原文来源:https://arxiv.org/abs/2606.27472

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回