ReMem框架:无需训练即可实现长视频问答,自适应时序粒度选择关键帧

arXiv·36 天前

多模态大语言模型在基础视频任务中展现出强大泛化能力,但受限于上下文窗口长度,难以处理长视频理解任务。传统方法通常采用关键帧选择策略,但均匀采样或静态查询引导的选择往往忽略关键时序上下文,无法适应不同查询的时序粒度变化。

为此,研究团队提出ReMem框架,这是一种时序粒度自适应的关键帧选择框架,专为无需训练的长视频问答设计。ReMem采用双级记忆增强机制:在查询级别,记忆驱动问题解析利用大语言模型的长期记忆解码问题时序粒度并提取语义实体;在视频级别,协同双语义帧对齐利用内在结构记忆将帧与查询语义对齐,引导结构感知动态帧路由聚类事件并优化采样预算分配。

通过显式保留时序信息的记忆机制,ReMem有效抑制冗余,赋能多模态大模型执行鲁棒的多粒度视频推理。在四个流行长视频问答基准测试中,使用三种多模态大模型的评估显示,ReMem实现了高效、先进的零样本性能。其中,搭载ReMem的LLaVA-Video在LVBench上达到54.5%(提升12.3%),在LongVideoBench上达到67.1%(提升8.2%)。该框架为长视频理解提供了新的解决方案,尤其适用于资源受限场景。

视频理解多模态大模型长视频问答关键帧选择零样本学习

原文来源:https://arxiv.org/abs/2607.24794

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回