土耳其语与阿拉伯语仇恨言论检测研究:多维度分析模型发布

arXiv·19 天前

随着网络仇恨言论在全球范围内加剧针对少数群体的暴力事件,如何平衡言论自由与内容治理成为多语言社会面临的难题。近日,一项发表于arXiv的研究聚焦土耳其语与阿拉伯语,发布了覆盖难民、巴以冲突、土耳其境内反希腊情绪、民族宗教群体及LGBTI+等六大主题的仇恨言论数据集。该数据集包含土耳其语五个细分话题及阿拉伯语难民话题,为多语言仇恨言论研究提供了重要资源。

研究团队进一步基于BERT架构开发了先进检测模型,能够同时实现仇恨类别分类、仇恨强度预测、目标群体识别及仇恨言论片段定位四重功能。这种多维度分析框架有助于更全面理解网络言论中的仇恨内容结构,为平台内容审核、政策制定及跨文化比较研究提供技术支持。当前,针对非英语语言的仇恨言论检测工具仍相对稀缺,此项工作填补了土耳其语与阿拉伯语领域的空白,也为其他低资源语言的相关研究提供了方法论参考。

仇恨言论检测多语言NLPBERT模型内容安全社交媒体分析

原文来源:https://arxiv.org/abs/2607.00143

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回