俄语金融推理基准RusFinChain发布:首个支持可验证思维链的评测数据集

arXiv·18 天前

在金融分析中,多步骤符号推理至关重要,但现有基准大多忽视中间推理步骤的验证。虽然FINCHAIN引入了可验证思维链评估,但仅限于英语;FINESSE-Bench包含俄语模块,却依赖选择题形式且缺乏步骤级监督。

为此,研究团队推出了RusFinChain——首个俄语金融领域可验证思维链推理基准。该数据集覆盖17个金融领域、172个主题,包含5280个从可执行Python模板生成的参数化示例,确保评估过程不受数据污染影响。每个示例都提供包含中间数值的黄金标准推理链,支持自动验证。

团队还引入了两项增强评估指标:模糊数值对齐和软注意力对齐。在对8个开源大语言模型的8100个回答进行分层抽样评估后,结果显示模型在步骤对齐方面的硬F1分数约为0.65,但最终答案正确率仅为29%左右,揭示出显著的推理能力差距。

值得注意的是,新提出的模糊和软评估指标与最终答案正确性的相关性更强,斯皮尔曼相关系数约为0.48,优于原始ChainEval指标的0.38-0.46,展现出更优越的诊断能力。研究团队已公开数据集、代码和评估框架,旨在推动俄语社区可验证金融AI的发展。

大语言模型评测基准金融AI思维链推理俄语NLP

原文来源:https://arxiv.org/abs/2607.01388

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回