日本运筹学基准JOR-Bench发布:评估大语言模型解决实际优化问题能力
近日,研究团队在arXiv发布了JOR-Bench基准测试集,这是首个专门针对日语环境设计的运筹学评估基准。该基准包含五个子数据集,均由现有英文基准翻译而来,覆盖线性规划、混合整数规划、非线性规划和组合优化等1319个实际问题。
JOR-Bench采用问题描述与预期数值答案配对的形式,不依赖特定求解器或编程语言,确保评估的通用性。研究团队使用OR-Tools的Python接口标准化执行流程,对包括多语言通用模型和日语专用模型在内的七种大语言模型进行了测试。
结果显示,对于强大的多语言模型,运筹学问题建模能力基本不受语言影响,英文与日文的平均准确率差异仅为-0.3个百分点。然而深入分析发现,在某些领域存在微妙的跨语言差异:当日语提示存在歧义时,部分模型会错误输出决策变量值而非目标函数值。
该基准的发布填补了日语运筹学评估工具的空白,为研究大语言模型在非英语环境下的实际应用能力提供了重要工具,特别有助于评估模型在商业优化、物流规划等实际场景中的表现。