对话系统韵律评估新方法:基于参考样本的语音节奏分析
随着语音到语音(S2S)AI智能体的快速发展,现有评估方法缺乏针对对话韵律和节奏的可解释性语音原生指标。由于基频(F₀)、语速、发音速率和停顿等特征会随模型预测的说话人特质和交互状态而变化,传统基于汇总人类统计数据的评估方法往往难以准确校准特定输出的质量。
研究团队利用Seamless Interaction数据集中超过4000小时的英语对话数据,构建了匹配参考体系,涵盖基频均值、基频表现力、语速、发音速率、停顿比例及平均停顿时长等关键韵律指标。在此基础上,研究者设计了基于百分位数的评估协议:从S2S输出波形中提取相同指标,将其与最匹配的人类参考层进行比较,并报告百分位偏差或超出正常范围(5th-95th百分位)的标记。
在保留的人类数据测试中,传统汇总参考方法会过度标记状态相关的基频表现力和节奏异常,而匹配参考方法将异常标记率控制在接近名义10%的水平,并使偏差方向更具可解释性。该评估框架可作为行为合理性检查工具,与感知评估和用户中心评估形成互补,而非替代关系。