FinReportBench:专业金融报告生成评测基准问世,揭示机构级报告生成瓶颈
尽管大语言模型能够生成流畅的金融分析报告,但流畅性本身并不能保证报告达到机构交付标准。近日,研究人员在arXiv上发布了FinReportBench基准,这是首个专门用于衡量和改进机构级金融报告生成的专家基准。
该研究通过专家评审揭示了当前模型在报告身份识别、机构组件完整性、数据来源规范性和视觉呈现等方面存在的系统性缺陷。研究团队基于专家偏序评估、多模态证据和决策边界审计,开发了一套包含35个评估项的评分标准,涵盖可交付性、报告身份识别和机构完整性三个维度。
基准数据集包含来自中英文金融研究记录的10,000条平衡样本,最终构建了244个双语任务,涵盖三种研究对象和两个输入层级。每个任务都明确区分了公开查询、重构的研究轨迹和隐藏的源数据包。三个独立的评审组以接近天花板的一致性复现了专家偏序评估,表明有限且可观察的标准能够支持可靠评估。
在测试的九个模型系列中,基本可交付性已接近饱和,而报告身份识别和机构完整性仍是主要瓶颈。跨模型的最大差距体现在生成轨迹控制、信息密度和数据规范性方面,而非基本报告框架。研究团队进一步利用基准指导的技能蒸馏方法,将反复出现的失败案例转化为可重用的生成和自我审查约束。在五个模型系列上的实验显示,经过技能优化的模型在G1指标上平均提升33.85分,G2指标提升13.83分,同时保持G0指标不变。
该基准及相关代码已开源发布,为金融领域专业报告生成提供了重要的评估工具和改进方向。