CAFE:开源平台助力复合AI系统评估,揭示组件性能影响
近日,arXiv平台发布了一项名为CAFE(Compound-AI Factorial Evaluation)的开源评估框架,旨在解决复合AI系统(CAIS)评估中的难题。复合AI系统通常包含多个可互换组件,如检索器、模型或提示模板,但实践中很难确定哪些组件对最终输出质量影响最大。CAFE允许用户将流水线中的每个可交换组件注册为“因素”,构建因子实验设计,运行不同配置,并使用可配置的LLM评判器与人工评分员基于统一标准对答案进行评分。通过混合效应模型分析评分数据,CAFE能够量化各组件及其交互对答案质量方差的贡献,报告效应大小、显著性、最佳配置、成本与延迟权衡以及评判者与人工的一致性。与现有工具仅专注于搜索最优配置或孤立评分不同,CAFE进一步解释了质量差异的来源及统计显著性。研究团队在HotpotQA基准数据集上的检索增强问答流水线中验证了CAFE的有效性,成功恢复了预设因素效应并保持了校准性。CAFE已作为Python包和Web应用程序开源发布,为AI系统开发者提供了更科学的评估工具。