ViSAGE框架:构建自校正记忆系统,提升长视频理解能力

arXiv·31 天前

在多模态智能体处理长时程环境任务时,构建并持续更新多媒体记忆系统对保持实体一致性和时间基础推理至关重要。然而,现有记忆方法往往因过度压缩和分段处理而丢失细粒度实体线索,且过度依赖向量相似性检索,容易导致实体混淆、错误传播和幻觉答案。

为此,研究团队提出ViSAGE多模态记忆框架,该框架构建了具有自校正能力的实体中心化记忆系统。ViSAGE通过跨模态绑定技术在长时间范围内锚定实体身份,并采用双向记忆优化机制传播延迟的身份证据,从而统一历史记录并提升未来推理质量。

框架还引入了多智能体验证机制,在身份-证据对齐约束下评估检索到的证据,当证据缺失时可主动放弃回答而非提供无依据的答案。实验结果显示,ViSAGE在多项基准测试中均优于现有最强基线方法,准确率提升达5.9%。该研究为长视频理解、智能体记忆系统等方向提供了新的技术思路。

多模态AI视频理解记忆系统实体识别arXiv研究

原文来源:https://arxiv.org/abs/2607.28678

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回