大模型前瞻性假设发现能力首测:HypoArena 基准揭示模型在开放探索阶段的差异
当前大语言模型在回答预设问题方面表现出色,但其在开放探索阶段——即结论尚未形成前的发现能力——尚未得到系统评估。为此,研究团队提出前瞻性假设发现(PHD)任务,要求模型基于不完整的证据(如异常观测或碎片化记录)自主构建具有基础、可区分且可检验的假设空间,以指导后续研究。
为评估这一能力,团队构建了 HypoArena 基准,包含 HypoData 数据集与 HypoEval 评估框架。HypoData 涵盖六个科学与分析领域的 988 个案例,通过“回顾上下文回归”方法构建:从已完成的专家文档中移除明确结论、目标假设及回顾性因果归因,仅保留事实基础,从而还原“结论前”的研究情境。
由于 PHD 允许多种合理输出,HypoEval 采用双向成对判断与 Bradley–Terry–Davidson 聚合进行排序,并结合六维评分标准进行诊断。在 15 个前沿大语言模型上的实验显示:模型在该任务上存在清晰的能力分层;结构化分析技能对不同模型产生差异化影响——部分低性能模型在 HypoArena 上表现提升,而其他系统(包括某顶级模型)却出现倒退。
与绝对评分相比,竞技场式评估能更精细地区分模型差异,其聚合排名与人类专家及独立评审结果高度一致。研究结果表明,PHD 可作为独立评估目标,衡量大语言模型在最终结论缺失时如何规划研究方向。相关代码与数据已开源。