CANDI-QA:专为垂直领域问答设计的上下文对齐评测基准

arXiv·6 天前

随着大语言模型在医疗诊断、金融咨询等高风险专业领域的应用增多,传统通用问答评测已难以准确评估模型在垂直场景中的实际表现。为此,研究团队在arXiv上发布了CANDI-QA(Contextual Alignment for Niche Domains Question Answering)数据集,专门用于评测模型在专业领域中的上下文对齐能力。

该数据集包含专家精心构建的两类问答对:一是信息辅助类问题,要求模型精准提取事实信息;二是应用推理类问题,需要模型结合情境进行多步推理并生成可操作的见解。研究团队评估了十余个不同规模的模型,包括开源轻量模型与顶尖闭源系统。

作为对比基线,论文提出了MTSS-Net——一个融合神经检索与规则推理的轻量级神经符号框架。实验结果表明,当前大语言模型在缺乏增强上下文或符号推理支持时,在专业领域的表现仍存在明显局限。CANDI-QA的推出,为开发面向高风险领域的可信赖AI提供了重要的评测基准,将推动上下文感知语言模型的研究进展。

评测基准垂直领域问答系统大语言模型上下文对齐

原文来源:https://arxiv.org/abs/2607.11891

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回