新加坡团队成功适配语音大模型,多语言任务表现优异
语音大模型(SLMs)能够统一语音感知与推理能力,但其在敏感领域的适配应用仍面临挑战,特别是在原始训练数据不可获取、且应用场景需要多语言口语交互的情况下。新加坡研究团队近期提出创新方案,将开源语音大模型成功适配至新加坡内政团队(Home Team)的实际应用场景。
该研究覆盖了新加坡四种官方语言的五项语音任务,采用LoRA微调技术,结合防灾难性遗忘的替代文本问答数据集,并将CoBa重加权方案创新性地应用于语音任务的多目标优化。团队还构建了HTD-multilingual-QA数据集,包含50.4万个多语言文本与语音问答样本。
实验结果显示,最终开发的HT-Moonstone模型(50亿参数)在多数任务中表现优于或持平规模达其7倍的语音大模型,在所有评估模型中取得了最佳的口音和性别识别准确率,同时原始语音问答能力损失不到2%。这项研究为语音大模型在特定地域和敏感领域的落地应用提供了重要参考。