AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
基准评测
3 篇相关内容
相关话题
大语言模型
法律科技
信息提取
公司治理
长文档推理
证据整合
自然语言处理
AI评估
医学AI
多模态大模型
临床对话
视觉语言模型
DECODEM:大模型如何从公司章程中自动提取治理信息?
研究者推出DECODEM基准数据集,评估大语言模型从公司组织文件中自动提取治理条款的能力,结果显示前沿模型能以高准确率完成这项复杂任务。
a
arXiv
·
1 天前
大语言模型
法律科技
信息提取
公司治理
a
WILDTRACE:首个自然证据链长文档推理基准,挑战AI深层理解能力
研究者发布WILDTRACE基准数据集,专注于评估AI模型在长文档中整合自然分散证据的能力,包含481个任务和214个真实场景文档,填补了现有基准在真实世界推理评估上的空白。
a
arXiv
·
8 天前
长文档推理
基准评测
证据整合
自然语言处理
a
IMCBench:首个图像对话医学基准,评测多模态大模型临床能力
研究者推出首个图像引导多轮医学对话基准IMCBench,通过真实临床图像与合成病历模拟医患互动,评测多模态大模型在安全、准确与不确定性表达三方面的临床能力。
a
arXiv
·
21 天前
医学AI
多模态大模型
基准评测
临床对话
a