AI在商业案例分析中表现如何?新基准揭示前沿模型已接近专家水平
当前AI基准测试多关注事实回忆、数学解题、编码等能力,但鲜少评估AI在专业白领日常工作中的表现——如综合复杂信息、在不确定条件下做出判断、进行战略思考等主观性较强的分析任务。
来自学术界的团队借鉴顶尖商学院采用的“案例教学法”,构建了BusinessCaseBench基准。该基准包含来自18个商业学科的数百个问题,每个问题都配有基于专家编写的教学案例解决方案的评分标准。
研究发现,在BusinessCaseBench上,前沿AI模型已能获得接近专家评分标准的高分。同一模型系列在两年内的性能提升显著,表明AI在这类分析性工作上的表现不仅已经达到较高水平,而且正在快速进步。
这一发现对商学院教育具有启示意义:案例教学法长期以来被用于培养本科生和MBA学生的分析推理能力,而AI的进步可能改变相关教学方式和入门级专业岗位的技能要求。研究为衡量AI在复杂知识工作领域的进展提供了新视角。