仿生记忆系统革新视觉语言模型测试时自适应

arXiv·20 天前

视觉语言模型(VLMs)在动态现实环境中的稳健部署,关键在于测试时自适应(TTA)能力。现有TTA方法常局限于局部适应,缺乏跨时间知识积累,或仅关注单一模态,未能充分利用VLMs固有的多模态特性。受生物大脑互补记忆系统启发,arXiv最新研究提出ComMem框架,创新性地模拟海马体与新皮质的分工协作机制。该框架包含两大核心组件:类海马体的快速适应详细记忆,通过高置信度测试样本构建动态视觉缓存;以及类新皮质的慢速整合抽象记忆,持续优化全局文本原型。针对每个测试实例,ComMem协同优化双记忆系统以确保跨模态一致性。在15个基准数据集上的实验表明,ComMem在自然分布偏移和跨数据集泛化场景中均显著优于现有最优方法,为增强VLMs实际适应性开辟了新路径。该研究将神经科学原理与机器学习相结合,为多模态模型的自适应学习提供了生物启发式解决方案。

视觉语言模型测试时自适应记忆系统多模态学习仿生计算

原文来源:https://arxiv.org/abs/2606.28719

相关阅读

AI评分系统防作弊新突破:自动检测并抑制语言评估中的“捷径依赖”
前沿大模型竟不会“抄作业”?研究者提出2D文本表示新思路
AI在商业案例分析中表现如何?新基准揭示前沿模型已接近专家水平
Loopie:迄今最强循环Transformer模型,IMO/IPhO金牌表现无需工具
对话状态追踪新突破:BERT助力零样本跨领域适应

← 返回