Transformer模型新突破:多语言极化内容检测准确率提升
近日,一项发表于arXiv的研究提出了针对多语言、多文化和多事件在线极化内容检测的创新方法。该研究针对SemEval-2026 Task 9竞赛的三个子任务展开:二元极化检测、极化类型分类以及表现形式识别,覆盖英语和斯瓦希里语两种语言。
研究团队采用基于Transformer的预训练模型架构,针对英语使用RoBERTa-base模型,斯瓦希里语则选用AfroXLMR-base模型。为解决数据标签严重不平衡问题,研究人员创新性地引入类别加权损失函数,并通过逐标签阈值调优技术优化多标签分类性能。
实验结果显示,在测试集上,二元极化检测子任务(Subtask 1)的F1宏平均得分达到0.7901(英语)和0.7910(斯瓦希里语);极化类型分类(Subtask 2)得分分别为0.4615和0.4808;表现形式识别(Subtask 3)则获得0.4791和0.5830的成绩。这些结果在竞赛排行榜上表现出竞争力,验证了该方法在处理不平衡多标签极化检测任务中的有效性。
值得注意的是,错误分析表明模型在识别非人化表达和缺乏同理心的内容方面仍存在挑战,这为未来研究指明了改进方向。该技术有望应用于社交媒体内容审核、网络舆情分析等领域,助力构建更健康的网络交流环境。