乌尔都语假新闻检测研究揭示数据集长度陷阱:跨数据集泛化能力严重失衡

arXiv·4 天前

乌尔都语作为全球超过2.31亿人使用的语言,其假新闻检测研究长期面临资源不足的挑战。虽然已有研究在单一数据集上取得了良好的领域内性能,但模型在不同数据集间的泛化能力尚未得到系统评估。

近日,研究人员首次对乌尔都语假新闻检测进行跨数据集泛化研究,使用两个公开的平衡数据集:Ax-to-Grind乌尔都语语料库(10,083篇文章,15个领域)和Notri-Fact乌尔都语数据集(13,388篇文章)。研究团队在四种实验条件下微调XLM-RoBERTa-base模型,包括在每个数据集上的领域内训练以及两个零样本跨领域迁移方向,并与使用逻辑回归和支持向量机的TF-IDF基线进行比较。

实验结果揭示了一个惊人的不对称现象:从Notri-Fact到Ax-to-Grind的迁移取得了0.771的宏观F1分数,而反向迁移则崩溃至0.005的F1分数,模型对99.7%的测试文章都预测为假新闻。研究人员发现,这种崩溃源于Ax-to-Grind数据集中存在的系统性长度混淆因素:假新闻文章平均117个词,而真新闻文章平均仅35个词,这种3.4倍的长度不对称性诱导了模型的捷径学习。

通过将文章长度限制在50个词的长度消融实验,F1分数仅下降0.0067,证实了长度混淆因素虽然夸大了领域内性能,但并非其唯一驱动因素。该研究提供了一种可重复使用的诊断方法,结合双向迁移分析和预测崩溃检查,可用于识别多语言假新闻检测环境中的混淆驱动行为。

假新闻检测多语言NLP数据集偏差XLM-RoBERTa迁移学习

原文来源:https://arxiv.org/abs/2607.14131

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回