非洲低资源语言语料库许可兼容性分析:开源背后的法律陷阱
在非洲低资源语言的自然语言处理研究中,Creative Commons(CC)许可协议已成为语料库发布的主流选择。然而,最新研究揭示了一个严峻的现实:这些许可协议的兼容性规则在实践中极少被正确应用。CC-BY-SA(署名-相同方式共享)与CC-BY-NC(署名-非商业性使用)两种许可无法在同一数据集中合并使用,而“禁止演绎”(NoDerivs)条款则隐性地禁止了分词和标注等基础处理操作。
研究团队对非洲NLP领域使用的二十多个语料库系列进行了许可溯源审计,构建了六层级的兼容性矩阵,并以基图巴/穆努库图巴语、扎尔马语和莫雷语三种语言为案例进行分析。研究发现了四种典型的许可失败模式:
1. 明确禁止使用:JW300语料库因违反服务条款,在法务审计后已从OPUS平台移除。
2. 复合许可误标:WAXAL语料库声称采用CC-BY 4.0许可,但其HuggingFace数据集卡片内容与此相矛盾。
3. 隐藏禁止演绎条款:Tanzil语料库在CC-BY标签下隐藏了NoDerivs条款。
4. 数据持久性失效:刚果广播语料库405个源URL中已有402个失效。
论文最后提出了预标注尽职调查清单,并调研了法律合规的数据增强机会。这项研究为非洲语言资源建设者敲响了警钟:开源许可的复杂性不容忽视,否则可能引发严重的法律后果。