AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
假设发现
1 篇相关内容
相关话题
大语言模型
评估基准
科学研究
AI能力评估
大模型前瞻性假设发现能力首测:HypoArena 基准揭示模型在开放探索阶段的差异
研究团队提出前瞻性假设发现(PHD)任务,评估大语言模型在证据不完整、结论未定时自主构建可检验假设空间的能力。新基准 HypoArena 涵盖 988 个科学分析案例,实验显示不同模型在该任务上存在明显能力分层。
a
arXiv
·
1 天前
大语言模型
评估基准
假设发现
科学研究
a