乌尔都语假新闻检测研究揭示数据集长度陷阱:跨数据集泛化能力严重失衡
乌尔都语作为全球超过2.31亿人使用的语言,其假新闻检测研究长期面临资源不足的挑战。虽然已有研究在单一数据集上取得了良好的领域内性能,但模型在不同数据集间的泛化能力尚未得到系统评估。
近日,研究人员首次对乌尔都语假新闻检测进行跨数据集泛化研究,使用两个公开的平衡数据集:Ax-to-Grind乌尔都语语料库(10,083篇文章,15个领域)和Notri-Fact乌尔都语数据集(13,388篇文章)。研究团队在四种实验条件下微调XLM-RoBERTa-base模型,包括在每个数据集上的领域内训练以及两个零样本跨领域迁移方向,并与使用逻辑回归和支持向量机的TF-IDF基线进行比较。
实验结果揭示了一个惊人的不对称现象:从Notri-Fact到Ax-to-Grind的迁移取得了0.771的宏观F1分数,而反向迁移则崩溃至0.005的F1分数,模型对99.7%的测试文章都预测为假新闻。研究人员发现,这种崩溃源于Ax-to-Grind数据集中存在的系统性长度混淆因素:假新闻文章平均117个词,而真新闻文章平均仅35个词,这种3.4倍的长度不对称性诱导了模型的捷径学习。
通过将文章长度限制在50个词的长度消融实验,F1分数仅下降0.0067,证实了长度混淆因素虽然夸大了领域内性能,但并非其唯一驱动因素。该研究提供了一种可重复使用的诊断方法,结合双向迁移分析和预测崩溃检查,可用于识别多语言假新闻检测环境中的混淆驱动行为。