手语模型能听懂“语音”吗?研究发现AI具备初步音系感知能力

arXiv·21 天前

手语作为组合系统,其意义通过手形、位置、动作等亚词汇音系参数组合产生。尽管深度学习模型在手语识别任务上性能不断提升,但其是否真正理解抽象音系特征,还是仅依赖低层统计关联,始终是未解之谜。

近日发表于arXiv的研究通过最小对立对探测和人类行为数据对齐评估,系统检验了美式手语识别模型的音系感知能力。结果显示:手语识别模型确实展现出新兴的音系敏感性,但存在明显的架构权衡——基于姿态的模型对手形对比更敏感,而基于像素的模型则能更好地捕捉位置变化。

值得注意的是,姿态模型学习到的潜在表征与人类感知相似性判断呈现显著相关性(r≈0.49)。这表明当前手语识别模型虽已具备初步的音系感知能力,但现有训练范式仍不足以让它们突破架构本身的归纳偏置,实现更全面的音系理解。该研究为构建更接近人类语言认知的手语AI系统提供了重要参考。

手语识别音系感知多模态AI模型可解释性arXiv研究

原文来源:https://arxiv.org/abs/2606.28667

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回