当搜索智能体该提问时:DiscoBench评测澄清感知的深度搜索
随着大语言模型驱动的搜索智能体被越来越多地应用于解决复杂的信息检索任务,多步骤的检索与推理成为实现用户目标的关键。然而,现有评测基准通常假设用户查询是完整且明确的,忽略了现实世界中搜索请求往往模糊、不完整甚至存在事实错误的情况。在深度搜索场景中,这种模糊性可能沿着多步推理链传播,导致智能体走向错误的搜索轨迹。为填补这一空白,研究团队提出了DiscoBench——一个专注于澄清感知深度搜索的评测基准,旨在评估搜索智能体是否能主动识别模糊性、提出有效的澄清问题,并通过与用户的交互恢复正确的推理路径。DiscoBench包含来自11个真实领域的211个样本和463个模糊实例,覆盖四种模糊类型。团队还设计了一个用于多轮交互的用户模拟器,并从任务效用、模糊性检测、交互策略和成本效率四个维度评估模型性能。对代表性大语言模型的实验表明,模糊性检测和有效澄清是两种不同的能力,反复搜索而不请求澄清的行为往往比直接猜测表现更差,这凸显了当前搜索智能体在检索能力与交互式问题解决之间存在关键差距。