ReMem框架:无需训练即可实现长视频问答,自适应时序粒度选择关键帧
多模态大语言模型在基础视频任务中展现出强大泛化能力,但受限于上下文窗口长度,难以处理长视频理解任务。传统方法通常采用关键帧选择策略,但均匀采样或静态查询引导的选择往往忽略关键时序上下文,无法适应不同查询的时序粒度变化。
为此,研究团队提出ReMem框架,这是一种时序粒度自适应的关键帧选择框架,专为无需训练的长视频问答设计。ReMem采用双级记忆增强机制:在查询级别,记忆驱动问题解析利用大语言模型的长期记忆解码问题时序粒度并提取语义实体;在视频级别,协同双语义帧对齐利用内在结构记忆将帧与查询语义对齐,引导结构感知动态帧路由聚类事件并优化采样预算分配。
通过显式保留时序信息的记忆机制,ReMem有效抑制冗余,赋能多模态大模型执行鲁棒的多粒度视频推理。在四个流行长视频问答基准测试中,使用三种多模态大模型的评估显示,ReMem实现了高效、先进的零样本性能。其中,搭载ReMem的LLaVA-Video在LVBench上达到54.5%(提升12.3%),在LongVideoBench上达到67.1%(提升8.2%)。该框架为长视频理解提供了新的解决方案,尤其适用于资源受限场景。