手语模型能听懂“语音”吗?研究发现AI具备初步音系感知能力
手语作为组合系统,其意义通过手形、位置、动作等亚词汇音系参数组合产生。尽管深度学习模型在手语识别任务上性能不断提升,但其是否真正理解抽象音系特征,还是仅依赖低层统计关联,始终是未解之谜。
近日发表于arXiv的研究通过最小对立对探测和人类行为数据对齐评估,系统检验了美式手语识别模型的音系感知能力。结果显示:手语识别模型确实展现出新兴的音系敏感性,但存在明显的架构权衡——基于姿态的模型对手形对比更敏感,而基于像素的模型则能更好地捕捉位置变化。
值得注意的是,姿态模型学习到的潜在表征与人类感知相似性判断呈现显著相关性(r≈0.49)。这表明当前手语识别模型虽已具备初步的音系感知能力,但现有训练范式仍不足以让它们突破架构本身的归纳偏置,实现更全面的音系理解。该研究为构建更接近人类语言认知的手语AI系统提供了重要参考。