AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
评测基准
7 篇相关内容
相关话题
大语言模型
问答系统
垂直领域
上下文对齐
医疗AI
时序数据
临床决策
金融AI
思维链推理
俄语NLP
AI基础设施
国产芯片
CANDI-QA:专为垂直领域问答设计的上下文对齐评测基准
研究者推出CANDI-QA数据集,专门评估大语言模型在医疗、金融等专业领域的上下文对齐与用户感知能力。评测显示当前模型在专业领域仍面临显著挑战。
a
arXiv
·
6 天前
评测基准
垂直领域
问答系统
大语言模型
a
CLIR-Bench:首个专为不规则临床时序数据问答设计的评测基准
研究者发布CLIR-Bench基准,专门评估AI模型在稀疏、不规则采样的临床时间序列数据上进行问答推理的能力,填补了现有医学AI评测的空白。
a
arXiv
·
7 天前
医疗AI
时序数据
问答系统
评测基准
a
俄语金融推理基准RusFinChain发布:首个支持可验证思维链的评测数据集
研究人员推出首个俄语金融领域可验证思维链推理基准RusFinChain,涵盖17个金融领域172个主题,包含5280个参数化示例,并引入模糊数值对齐等增强评估指标。
a
arXiv
·
18 天前
大语言模型
评测基准
金融AI
思维链推理
a
中国信通院发布AI基础设施运维领域首个评测基准
中国信通院近日发布了AI基础设施运维领域的首个评测基准,覆盖了五款主流国产芯片,旨在提升AI基础设施的运维效率与标准化水平。
中
中国信通院
·
21 天前
AI基础设施
评测基准
国产芯片
运维
中
当搜索智能体该提问时:DiscoBench评测澄清感知的深度搜索
研究团队推出DiscoBench基准,用于评估搜索智能体在深度搜索中识别模糊查询、主动提出澄清问题并通过交互修正推理路径的能力。
a
arXiv
·
22 天前
大语言模型
搜索智能体
评测基准
人机交互
a
多模态知识图谱增强生成迎来专用评测基准:MKG-RAG-Bench
研究者推出首个专注于多模态知识图谱检索增强生成(MKG-RAG)中检索环节的跨领域评测基准MKG-RAG-Bench,通过实验证明有效检索仍是提升系统性能的关键瓶颈。
a
arXiv
·
25 天前
知识图谱
RAG
多模态检索
评测基准
a
LaViSA:首个视觉语言模型结构歧义评测基准发布
研究团队推出LaViSA基准,专门评估视觉语言模型利用视觉场景解决句子结构歧义的能力,实验发现现有模型在部分歧义类型和视觉语义细微差异上仍存在局限。
a
arXiv
·
31 天前
视觉语言模型
结构歧义
评测基准
多模态理解
a