土耳其语与阿拉伯语仇恨言论检测研究:多维度分析模型发布
随着网络仇恨言论在全球范围内加剧针对少数群体的暴力事件,如何平衡言论自由与内容治理成为多语言社会面临的难题。近日,一项发表于arXiv的研究聚焦土耳其语与阿拉伯语,发布了覆盖难民、巴以冲突、土耳其境内反希腊情绪、民族宗教群体及LGBTI+等六大主题的仇恨言论数据集。该数据集包含土耳其语五个细分话题及阿拉伯语难民话题,为多语言仇恨言论研究提供了重要资源。
研究团队进一步基于BERT架构开发了先进检测模型,能够同时实现仇恨类别分类、仇恨强度预测、目标群体识别及仇恨言论片段定位四重功能。这种多维度分析框架有助于更全面理解网络言论中的仇恨内容结构,为平台内容审核、政策制定及跨文化比较研究提供技术支持。当前,针对非英语语言的仇恨言论检测工具仍相对稀缺,此项工作填补了土耳其语与阿拉伯语领域的空白,也为其他低资源语言的相关研究提供了方法论参考。