新加坡团队成功适配语音大模型,多语言任务表现优异

arXiv·7 天前

语音大模型(SLMs)能够统一语音感知与推理能力,但其在敏感领域的适配应用仍面临挑战,特别是在原始训练数据不可获取、且应用场景需要多语言口语交互的情况下。新加坡研究团队近期提出创新方案,将开源语音大模型成功适配至新加坡内政团队(Home Team)的实际应用场景。

该研究覆盖了新加坡四种官方语言的五项语音任务,采用LoRA微调技术,结合防灾难性遗忘的替代文本问答数据集,并将CoBa重加权方案创新性地应用于语音任务的多目标优化。团队还构建了HTD-multilingual-QA数据集,包含50.4万个多语言文本与语音问答样本。

实验结果显示,最终开发的HT-Moonstone模型(50亿参数)在多数任务中表现优于或持平规模达其7倍的语音大模型,在所有评估模型中取得了最佳的口音和性别识别准确率,同时原始语音问答能力损失不到2%。这项研究为语音大模型在特定地域和敏感领域的落地应用提供了重要参考。

语音大模型多语言适配新加坡LoRA微调数据集

原文来源:https://arxiv.org/abs/2607.10092

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回