对话式视觉地点识别:让AI像人类一样通过对话定位场景
传统基于语言的视觉地点识别方法通常采用一次性检索模式,难以处理真实场景中自然语言描述的模糊性和不完整性。受人类交流空间信息方式的启发,研究团队提出对话式视觉地点识别新范式,将定位任务转化为交互式对话推理过程。
为支持这一创新任务,团队构建了首个大规模对话式地点识别基准数据集DlgQuest-Cities,并开发了统一推理框架。该框架将跨模态多级检索器与智能提问器DQ-pilot相结合,通过课程学习策略进行训练:先在精选的DQ-cities-20k子集上进行监督微调,再通过GRPO方法在更难的DQ-cities-10k数据集上进行强化学习优化。
研究设计了两个任务对齐的评估指标:用于课程采样的判别难度指数和直接衡量问题引发检索改进的位置检索增益奖励。实验表明,这种基于推理的方法在性能上显著超越传统基线模型。相关代码和模型已在GitHub开源,为对话式视觉定位研究提供了新思路和实用工具。