AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
评估基准
4 篇相关内容
相关话题
大语言模型
假设发现
科学研究
AI能力评估
金融AI
自动评估
研究工具
贝叶斯推理
多轮对话
认知不确定性
科学推理
证据校准
大模型前瞻性假设发现能力首测:HypoArena 基准揭示模型在开放探索阶段的差异
研究团队提出前瞻性假设发现(PHD)任务,评估大语言模型在证据不完整、结论未定时自主构建可检验假设空间的能力。新基准 HypoArena 涵盖 988 个科学分析案例,实验显示不同模型在该任务上存在明显能力分层。
a
arXiv
·
1 天前
大语言模型
评估基准
假设发现
科学研究
a
金融研究新基准:AI自动生成评估标准,替代专家标注
研究人员提出FinResearchBench II基准,通过大模型自动生成金融报告质量评估标准,实验显示AI评估与人类专家一致性达98.67%,大幅降低人工标注成本。
a
arXiv
·
6 天前
金融AI
评估基准
大语言模型
自动评估
a
BayesBench:多轮证据累积下评估大语言模型信念轨迹的新基准
研究者提出BayesBench基准,首次系统评估大语言模型在多轮对话中能否像理性贝叶斯推理者那样更新信念。研究发现模型规模提升有助于潜在变量推断,但推断能力不一定能转化为理性的下游预测。
a
arXiv
·
20 天前
大语言模型
评估基准
贝叶斯推理
多轮对话
a
AI科研助手新挑战:大模型能否根据证据强度校准科学简报?
研究者推出诊断性基准CalBrief,评估大语言模型在科学简报生成中根据证据强度与范围校准结论的能力,发现模型在证据强度判断上存在系统性保守倾向。
a
arXiv
·
22 天前
大语言模型
科学推理
评估基准
证据校准
a