大模型前瞻性假设发现能力首测:HypoArena 基准揭示模型在开放探索阶段的差异

arXiv·1 天前

当前大语言模型在回答预设问题方面表现出色,但其在开放探索阶段——即结论尚未形成前的发现能力——尚未得到系统评估。为此,研究团队提出前瞻性假设发现(PHD)任务,要求模型基于不完整的证据(如异常观测或碎片化记录)自主构建具有基础、可区分且可检验的假设空间,以指导后续研究。

为评估这一能力,团队构建了 HypoArena 基准,包含 HypoData 数据集与 HypoEval 评估框架。HypoData 涵盖六个科学与分析领域的 988 个案例,通过“回顾上下文回归”方法构建:从已完成的专家文档中移除明确结论、目标假设及回顾性因果归因,仅保留事实基础,从而还原“结论前”的研究情境。

由于 PHD 允许多种合理输出,HypoEval 采用双向成对判断与 Bradley–Terry–Davidson 聚合进行排序,并结合六维评分标准进行诊断。在 15 个前沿大语言模型上的实验显示:模型在该任务上存在清晰的能力分层;结构化分析技能对不同模型产生差异化影响——部分低性能模型在 HypoArena 上表现提升,而其他系统(包括某顶级模型)却出现倒退。

与绝对评分相比,竞技场式评估能更精细地区分模型差异,其聚合排名与人类专家及独立评审结果高度一致。研究结果表明,PHD 可作为独立评估目标,衡量大语言模型在最终结论缺失时如何规划研究方向。相关代码与数据已开源。

大语言模型评估基准假设发现科学研究AI能力评估

原文来源:https://arxiv.org/abs/2607.15766

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回