AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
评估方法
6 篇相关内容
相关话题
基准测试
大语言模型
AI代理
工具进化
办公文档
多模态理解
LLM评测
语法纠错
提示工程
视觉问答
多模态AI
知识推理
AI代理“工具进化”真的有效吗?新研究质疑现有评估方法
最新研究重新审视了大语言模型代理自动工具进化的评估方法,发现现有评估协议存在根本性缺陷,可能导致结果夸大。
a
arXiv
·
6 天前
大语言模型
AI代理
评估方法
工具进化
a
首个办公文档理解基准OCB发布,GPT-4o仅得59.3分
研究者推出首个面向Word、Excel、PowerPoint原生格式的综合性基准OCB,测试显示当前最强模型在专业领域问答中仅获59.3%准确率。
a
arXiv
·
18 天前
基准测试
办公文档
多模态理解
评估方法
a
提示框架扭曲大语言模型错误检测评估:锚定效应导致F1虚高
研究发现,基于计数的F1指标可能因提示框架中的数字锚定效应而虚高,无法真实反映大语言模型的错误定位能力。
a
arXiv
·
18 天前
大语言模型
评估方法
语法纠错
提示工程
a
知识型视觉问答基准测试的缺陷识别与修复
研究发现现有知识型视觉问答基准测试存在系统性缺陷,导致模型能力被高估。团队提出审计修复方案并构建增强数据集,推动更可靠的评估方法。
a
arXiv
·
19 天前
视觉问答
基准测试
评估方法
多模态AI
a
对话系统韵律评估新方法:基于参考样本的语音节奏分析
研究者提出基于匹配参考样本的韵律评估框架,通过对比AI语音输出与人类对话数据,量化评估语音语调、语速、停顿等韵律特征,为语音对话系统提供可解释的评估指标。
a
arXiv
·
20 天前
语音合成
对话系统
评估方法
韵律分析
a
文本分类性能评估新方法:如何更准确计算LLM置信区间
研究提出针对小样本和高性能场景的置信区间计算方法,解决传统方法在社会科学文本分类中的不足,提升机器学习应用透明度。
a
arXiv
·
25 天前
文本分类
置信区间
大语言模型
评估方法
a