FinReportBench:专业金融报告生成评测基准问世,揭示机构级报告生成瓶颈

arXiv·28 天前

尽管大语言模型能够生成流畅的金融分析报告,但流畅性本身并不能保证报告达到机构交付标准。近日,研究人员在arXiv上发布了FinReportBench基准,这是首个专门用于衡量和改进机构级金融报告生成的专家基准。

该研究通过专家评审揭示了当前模型在报告身份识别、机构组件完整性、数据来源规范性和视觉呈现等方面存在的系统性缺陷。研究团队基于专家偏序评估、多模态证据和决策边界审计,开发了一套包含35个评估项的评分标准,涵盖可交付性、报告身份识别和机构完整性三个维度。

基准数据集包含来自中英文金融研究记录的10,000条平衡样本,最终构建了244个双语任务,涵盖三种研究对象和两个输入层级。每个任务都明确区分了公开查询、重构的研究轨迹和隐藏的源数据包。三个独立的评审组以接近天花板的一致性复现了专家偏序评估,表明有限且可观察的标准能够支持可靠评估。

在测试的九个模型系列中,基本可交付性已接近饱和,而报告身份识别和机构完整性仍是主要瓶颈。跨模型的最大差距体现在生成轨迹控制、信息密度和数据规范性方面,而非基本报告框架。研究团队进一步利用基准指导的技能蒸馏方法,将反复出现的失败案例转化为可重用的生成和自我审查约束。在五个模型系列上的实验显示,经过技能优化的模型在G1指标上平均提升33.85分,G2指标提升13.83分,同时保持G0指标不变。

该基准及相关代码已开源发布,为金融领域专业报告生成提供了重要的评估工具和改进方向。

金融大模型评测基准报告生成机构应用AI金融

原文来源:https://arxiv.org/abs/2608.04374

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回