低资源多模态翻译:尼泊尔语语音驱动情感化手语虚拟人生成
一项发表于arXiv的预印本研究展示了针对低资源语言的情感化手语生成系统的初步探索。该研究提出了名为NEST-V1(尼泊尔情感与语音Transformer-版本1)的多模态概念验证框架,旨在从语音输入生成带有情感状态的尼泊尔手语虚拟人动画。作为一项试点研究,团队选取了四个常见尼泊尔词汇(“谢谢”、“你好”、“房子”、“我”)和三种情感状态(快乐、中性、悲伤),以验证其核心技术路径。该系统采用轻量级架构,使用共享声学编码器同时进行自动语音识别和情感分类,在来自50名说话者的600个标注音频样本数据集上,实现了81.1%的语音识别准确率和79.21%的情感识别准确率。与独立模型架构相比,该系统的参数量效率提升了37%,总参数量仅为2210万,适合边缘设备部署。这项试点工作为低资源场景下的情感感知手语翻译奠定了技术基础,并为未来扩展至更大词汇量和更丰富情感表达提供了可扩展框架。初步结果表明,面向听障社区的实时情感化手语通信系统具有可行性,并在后续开发阶段存在明确的改进路径。