多数投票掩盖少数观点:仇恨言论标注中的边界争议

arXiv·21 天前

在仇恨言论检测模型的训练中,标注者间的分歧常通过多数投票机制被简化为单一标签。最新研究通过对HateXplain数据集的分析发现,这种聚合并非中性:42.6%的标注分歧集中在仇恨与冒犯的边界区域。统计检验显示,分歧源于标注者对“仇恨”起始阈值的不同理解。实验表明,无论是硬标签BERT模型还是软标签模型,在标注一致的帖子上准确率约为80%,但在分歧帖子上骤降至58%。更值得注意的是,标准的模型评估指标无法检测到这一失败——模型在边界错误案例上反而表现出更高的置信度。研究尝试了三种不同复杂度的干预措施,均未能有效恢复边界识别准确率。作者指出,问题的根源在于标注设计本身:多数投票机制将存在争议的判断呈现为“地面真相”,而模型则继承了这种虚假的确定性。真正的解决方案需要上游的标注设计变革,而非下游的模型调整。

仇恨言论检测数据标注NLP机器学习偏差模型评估

原文来源:https://arxiv.org/abs/2606.28772

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回