多数投票掩盖少数观点:仇恨言论标注中的边界争议
在仇恨言论检测模型的训练中,标注者间的分歧常通过多数投票机制被简化为单一标签。最新研究通过对HateXplain数据集的分析发现,这种聚合并非中性:42.6%的标注分歧集中在仇恨与冒犯的边界区域。统计检验显示,分歧源于标注者对“仇恨”起始阈值的不同理解。实验表明,无论是硬标签BERT模型还是软标签模型,在标注一致的帖子上准确率约为80%,但在分歧帖子上骤降至58%。更值得注意的是,标准的模型评估指标无法检测到这一失败——模型在边界错误案例上反而表现出更高的置信度。研究尝试了三种不同复杂度的干预措施,均未能有效恢复边界识别准确率。作者指出,问题的根源在于标注设计本身:多数投票机制将存在争议的判断呈现为“地面真相”,而模型则继承了这种虚假的确定性。真正的解决方案需要上游的标注设计变革,而非下游的模型调整。