手语数据集规模化:全面盘点资源、基准与标注标准
手语作为聋人及听障群体使用的视觉语言,其技术发展长期受限于数据碎片化、标注不一致及语言覆盖不足等问题。近日,一项发表于arXiv的研究对全球手语数据集进行了系统性盘点,覆盖35种手语的120个资源,并深入剖析了当前数据集的三大核心挑战:模态失衡(如视频与文本数据比例失调)、标注粒度差异(从词汇级到句子级标注混杂),以及手语者多样性偏差。研究团队同时提出24字段的“手语数据表”规范,并开源GitHub仓库(https://github.com/Ginqwerty/Open-Sign-Language),旨在推动数据文档标准化与可复现评估。该工作为开发适用于真实场景的规模化手语识别、翻译与生成技术提供了实践框架,强调未来数据集设计需兼顾语言学完整性与社区实际沟通需求。