ViSAGE框架:构建自校正记忆系统,提升长视频理解能力
在多模态智能体处理长时程环境任务时,构建并持续更新多媒体记忆系统对保持实体一致性和时间基础推理至关重要。然而,现有记忆方法往往因过度压缩和分段处理而丢失细粒度实体线索,且过度依赖向量相似性检索,容易导致实体混淆、错误传播和幻觉答案。
为此,研究团队提出ViSAGE多模态记忆框架,该框架构建了具有自校正能力的实体中心化记忆系统。ViSAGE通过跨模态绑定技术在长时间范围内锚定实体身份,并采用双向记忆优化机制传播延迟的身份证据,从而统一历史记录并提升未来推理质量。
框架还引入了多智能体验证机制,在身份-证据对齐约束下评估检索到的证据,当证据缺失时可主动放弃回答而非提供无依据的答案。实验结果显示,ViSAGE在多项基准测试中均优于现有最强基线方法,准确率提升达5.9%。该研究为长视频理解、智能体记忆系统等方向提供了新的技术思路。