零售对话AI评估新框架:兼顾多维度与可审计的大规模评测系统

arXiv·6 天前

在零售对话系统的评估中,传统基于词汇重叠的指标已无法全面衡量意图对齐、事实准确性、有用性、清晰度、语气匹配等关键维度。虽然基于大语言模型的自动评估方法提供了可扩展的替代方案,但在实际生产部署中仍面临治理、可复现性、成本控制、模式一致性、可追溯性及可靠性等多重挑战。

近日,研究团队在arXiv上发布了题为《面向对话系统的多维评估操作化:具备选择性重评与模型基准测试的可扩展治理管道》的论文,提出GenAI评估框架。该框架采用配置驱动的治理管道,通过对生产环境聊天记录进行规范化处理、分片、异步执行及模式约束的大模型评分,实现对有用性、真实性、清晰度、语气匹配及翻译专项等多维度的系统评估。

框架创新性地引入选择性重评机制,仅对不完整、格式错误或模式无效的记录进行重新处理,同时通过模式锁定、版本化配置、验证日志及记录级溯源等功能确保系统的可审计性。目前该系统每日处理约5万条记录,累计评估交互超过200万次。

为验证框架效果,研究团队采用12,980条经四位专业标注员分层随机标注的人工标记数据进行测试,覆盖14种意图、156个子意图、18个主领域及129个子领域。结果显示,该管道在翻译任务中达到0.93的宏观F1分数,人工可接受准确率达89%,展现出可靠的评估性能。

对话系统AI评估大语言模型可解释AI零售科技

原文来源:https://arxiv.org/abs/2607.12085

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回