AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
AI评测
4 篇相关内容
相关话题
大语言模型
模型评估
任务对齐
人机交互
语言模型
POMDP
预测分析
判断质量评估
自然语言处理
基准测试
可复现性
人机协作
AI助手新挑战:如何与用户“对齐”模糊任务意图?
研究发现当前语言模型在用户任务不明确时表现不佳,仅能识别22-32%的真实意图,远低于人类的48%。论文提出将任务对齐问题建模为POMDP框架,揭示AI在交互式任务理解上的关键短板。
a
arXiv
·
10 小时前
任务对齐
人机交互
语言模型
POMDP
a
用AI评估专家判断质量:新方法在预测竞赛中表现优异
研究人员提出基于大语言模型的解释质量标记方法,通过分析5.5万份预测报告发现,该方法能有效识别判断质量,尤其擅长发现表现不佳的预测者。
a
arXiv
·
20 天前
大语言模型
预测分析
判断质量评估
自然语言处理
a
当AI评测饱和后:CORE-Bench揭示的六大性能维度
研究发现,当AI评测基准达到准确率饱和后,不应简单废弃,而应转向评估构造有效性、泛化能力、效率等六个关键维度。CORE-Bench案例展示了超越准确率的全面评估方法。
a
arXiv
·
25 天前
AI评测
基准测试
模型评估
可复现性
a
大规模评估揭示:LLM评委存在系统性偏差,当前验证方法存疑
最新研究对21个LLM评委模型进行系统性评估,发现当前依赖精确匹配的验证方法普遍高估模型判别能力,同时揭示评委模型存在显著的位置偏差与一致性矛盾。
a
arXiv
·
31 天前
大语言模型
模型评估
AI评测
算法偏差
a