UESF-Bench:首个统一化具身智能寻人跟随基准发布

arXiv·5 天前

当前具身智能领域的人体跟随任务基准普遍存在局限性:多数假设目标人物在任务开始时即处于可见状态,忽略了现实场景中智能体需要先寻找语言描述的目标、再持续跟随的动态需求。虽然已有研究开始探索人体搜索任务,但现有评估通常局限于特定场景,且依赖较强的环境先验知识,更关键的是将搜索与跟随视为独立任务,缺乏系统性统一评估基准。

为突破这些限制,研究团队提出了统一化具身智能寻人跟随基准UESF-Bench。该基准具备大规模和多样性特点,要求智能体同时具备语义引导探索、可靠行为切换与恢复、延迟身份识别三大能力。基准环境涵盖单人与多人场景,更贴近真实应用需求。

配套提出的SeekFollow-VLA视觉-语言-行动框架采用任务驱动路由机制,通过潜在阶段推断实现搜索与跟随状态的自适应切换。实验表明,该框架在单人和多人环境中均显著优于单头与双头基线模型,为统一化寻人跟随任务建立了新的性能基准。这项研究推动了具身智能在动态环境中的综合任务处理能力发展。

具身智能人机交互基准测试多模态学习机器人导航

原文来源:https://arxiv.org/abs/2607.13621

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回