非洲低资源语言语料库许可兼容性分析:开源背后的法律陷阱

arXiv·21 天前

在非洲低资源语言的自然语言处理研究中,Creative Commons(CC)许可协议已成为语料库发布的主流选择。然而,最新研究揭示了一个严峻的现实:这些许可协议的兼容性规则在实践中极少被正确应用。CC-BY-SA(署名-相同方式共享)与CC-BY-NC(署名-非商业性使用)两种许可无法在同一数据集中合并使用,而“禁止演绎”(NoDerivs)条款则隐性地禁止了分词和标注等基础处理操作。

研究团队对非洲NLP领域使用的二十多个语料库系列进行了许可溯源审计,构建了六层级的兼容性矩阵,并以基图巴/穆努库图巴语、扎尔马语和莫雷语三种语言为案例进行分析。研究发现了四种典型的许可失败模式:

1. 明确禁止使用:JW300语料库因违反服务条款,在法务审计后已从OPUS平台移除。

2. 复合许可误标:WAXAL语料库声称采用CC-BY 4.0许可,但其HuggingFace数据集卡片内容与此相矛盾。

3. 隐藏禁止演绎条款:Tanzil语料库在CC-BY标签下隐藏了NoDerivs条款。

4. 数据持久性失效:刚果广播语料库405个源URL中已有402个失效。

论文最后提出了预标注尽职调查清单,并调研了法律合规的数据增强机会。这项研究为非洲语言资源建设者敲响了警钟:开源许可的复杂性不容忽视,否则可能引发严重的法律后果。

语料库许可非洲语言开源协议法律合规低资源NLP

原文来源:https://arxiv.org/abs/2606.28867

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回