CANDI-QA:专为垂直领域问答设计的上下文对齐评测基准
随着大语言模型在医疗诊断、金融咨询等高风险专业领域的应用增多,传统通用问答评测已难以准确评估模型在垂直场景中的实际表现。为此,研究团队在arXiv上发布了CANDI-QA(Contextual Alignment for Niche Domains Question Answering)数据集,专门用于评测模型在专业领域中的上下文对齐能力。
该数据集包含专家精心构建的两类问答对:一是信息辅助类问题,要求模型精准提取事实信息;二是应用推理类问题,需要模型结合情境进行多步推理并生成可操作的见解。研究团队评估了十余个不同规模的模型,包括开源轻量模型与顶尖闭源系统。
作为对比基线,论文提出了MTSS-Net——一个融合神经检索与规则推理的轻量级神经符号框架。实验结果表明,当前大语言模型在缺乏增强上下文或符号推理支持时,在专业领域的表现仍存在明显局限。CANDI-QA的推出,为开发面向高风险领域的可信赖AI提供了重要的评测基准,将推动上下文感知语言模型的研究进展。