AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
评估指标
3 篇相关内容
相关话题
智能体
大语言模型
工具调用
AI效率
强化学习
可解释AI
归纳逻辑编程
策略可解释性
检索系统
Qwen
政策分类
新指标登场:如何科学衡量大模型工具调用效率?
研究人员提出“工具效率”与“边际工具效用”两项新指标,为评估大语言模型工具调用性能提供量化标准,助力构建更精简高效的工具套件。
a
arXiv
·
4 天前
大语言模型
工具调用
评估指标
智能体
a
新研究:用逻辑编程量化强化学习策略的可解释性
研究者提出一套基于归纳逻辑编程的客观指标,用于量化强化学习策略的可解释性,为安全关键和人机协作场景提供更透明的决策依据。
a
arXiv
·
5 天前
强化学习
可解释AI
归纳逻辑编程
策略可解释性
a
检索指标会误导?长程工具使用智能体中政策信号的真实测量
研究发现,在长程工具使用智能体评估中,传统精确匹配检索召回率可能低估下游政策效用,实际分类性能差距远小于指标暗示。
a
arXiv
·
27 天前
检索系统
评估指标
智能体
Qwen
a