检索指标会误导?长程工具使用智能体中政策信号的真实测量

arXiv·27 天前

在人工智能领域,评估检索系统性能时,精确匹配召回率常被用作衡量检索内容对下游决策模型是否有用的代理指标。然而,最新研究对这一传统做法提出了质疑。

研究人员在tau-bench基准测试中使用Qwen2.5-3B/7B分类器进行预行动政策分类实验。实验发现,在黄金政策条件下,经过调优的紧凑结构化状态比原始轨迹的宏F1分数提高了0.13-0.17。随后,研究团队用决策时上下文中排名最高的检索条款替换基准指定的政策条款。

结果显示,虽然仅有7%的航空状态能精确检索到排名第一的治理条款,但主要的3B分类器使用检索条款获得的宏F1分数为0.58,与使用黄金条款的0.60相差无几(差值仅-0.02)。相比之下,不匹配政策和无政策对照组的得分分别为0.32和0.21。

尽管置信区间仍然较宽,无法确立非劣效性,但在此配置下未检测到检索条款与黄金条款在宏F1上的显著差异。同样的定性模式在第二个检索器和7B模型中重现,并在不同的微调配置中保持一致。

这些发现表明,在该基准设置中,精确匹配条款召回率可能低估了下游政策效用,强调了需要在分类循环中使用检索政策进行评估,而非仅仅依赖召回率指标。这一研究对改进AI智能体的评估方法具有重要启示意义。

检索系统评估指标智能体Qwen政策分类

原文来源:https://arxiv.org/abs/2606.23937

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回