用AI评估专家判断质量:新方法在预测竞赛中表现优异
在专业决策领域,专家判断往往伴随着书面解释,但如何大规模评估这些解释的质量一直是个难题。最近一项发表于arXiv的研究提出了创新解决方案——解释质量标记(EQMs)。该方法基于60种理论指导的推理模式,利用大语言模型对预测报告中的自然语言解释进行评分。研究团队对多年预测竞赛中超过5.5万份预测-解释配对数据进行了预先注册分析,结果显示EQMs在预测层面和预测者层面都能有效预测准确性,其表现持续优于传统文本分析方法。值得注意的是,超过90%具有统计显著性的模式-准确性相关性符合研究假设方向。该方法表现出不对称性:在识别可能表现不佳的预测者方面更为可靠,而在区分最优秀预测者方面稍显不足。与传统预测技能指标相比,EQMs在预测层面是最强预测因子,在预测者层面也具有竞争力,虽然弱于历史准确性数据。研究还发现,人工对解释质量的评分与准确性的相关性不够稳定,且过度重视解释长度。该方法在独立预测研究中同样有效,为从书面解释中提取判断相关信息提供了可扩展、可解释的新途径。