UESF-Bench:首个统一化具身智能寻人跟随基准发布
当前具身智能领域的人体跟随任务基准普遍存在局限性:多数假设目标人物在任务开始时即处于可见状态,忽略了现实场景中智能体需要先寻找语言描述的目标、再持续跟随的动态需求。虽然已有研究开始探索人体搜索任务,但现有评估通常局限于特定场景,且依赖较强的环境先验知识,更关键的是将搜索与跟随视为独立任务,缺乏系统性统一评估基准。
为突破这些限制,研究团队提出了统一化具身智能寻人跟随基准UESF-Bench。该基准具备大规模和多样性特点,要求智能体同时具备语义引导探索、可靠行为切换与恢复、延迟身份识别三大能力。基准环境涵盖单人与多人场景,更贴近真实应用需求。
配套提出的SeekFollow-VLA视觉-语言-行动框架采用任务驱动路由机制,通过潜在阶段推断实现搜索与跟随状态的自适应切换。实验表明,该框架在单人和多人环境中均显著优于单头与双头基线模型,为统一化寻人跟随任务建立了新的性能基准。这项研究推动了具身智能在动态环境中的综合任务处理能力发展。