金融研究新基准:AI自动生成评估标准,替代专家标注
随着深度研究智能体越来越多地用于生成长篇金融报告,如何高效评估报告质量成为关键挑战。传统方法依赖人类专家制定评估标准,耗时耗力且难以规模化。针对这一瓶颈,研究团队提出了一种可扩展的自动化流程,能够在无需人类专家参与的情况下生成高质量评估标准。
该研究基于104个真实用户查询构建金融深度研究基准,从模型生成的报告中自动合成14,450个查询特定的候选评估标准。为验证AI替代人类专家的可行性,研究人员将三位人类专家的评估结果与三个大语言模型组成的评审小组进行比较。结果显示,基于大模型的评估与人类评估高度一致,在共同达成一致的项目上标签级别一致率达到98.67%,证明AI评估足以替代人工进行大规模标准筛选。
研究采用两级筛选机制确定最终评估标准:首先通过严格一致性筛选,仅保留三个大模型评审对同一查询下所有报告都达成一致的评估标准;然后进行区分度筛选,仅保留能够对评估系统产生至少一个多数通过和至少一个多数不通过标签的标准。经过这一流程,从3,687个通过一致性筛选的标准中最终保留了2,600个具有区分度的标准,形成共识衍生的黄金评估标准集。
使用这一标准集对10个深度研究系统进行评估,结果显示系统表现差异明显,项目级通过率从58.58%到22.23%不等。更重要的是,由于该流程在评估标准生成和评估环节都无需人类专家参与,天然具备可扩展性,为基准评估、自动系统比较以及评估驱动的系统改进研究提供了新思路。