分层检测:级联模型与联合模型在有害语言识别中的量化对比
在细粒度有害语言检测任务中,标签通常被组织为层次结构,目前存在两种主流建模范式:级联分解与联合多任务建模。然而,先前研究很少对这两种范式在准确率、参数量和推理延迟等维度进行直接、可控的比较,也鲜有验证所选类别不平衡处理策略是否真正最优。
近日,一项发表于arXiv的研究提出了一套三级级联检测系统,其训练策略针对每个子任务进行定制化设计,并引入两种验证机制。首先,通过控制性消融实验确定每个子任务最佳的类别不平衡处理策略;其次,训练一个共享编码器的联合多任务模型作为架构对照,从而在准确率、参数量和推理延迟三个维度获得真实测量数据。
实验结果显示,该级联系统在官方测试集的三个子任务上分别取得了0.795、0.716和0.557的宏F1分数。消融研究发现,仅凭不平衡严重程度直觉配置损失函数并非最优选择;基于消融结果重新配置后,系统性能和稳定性均得到提升。端到端级联评估表明,约五分之一的级联管道错误源自第一阶段过滤器,且无法被后续阶段纠正。
与联合多任务模型相比,级联架构在全部三个子任务上均实现了更高的准确率,在最严重不平衡子任务上取得了7.1个百分点的宏F1提升,代价是参数量增加三倍、推理延迟提高1.67倍。这些结果共同确立了级联架构在准确率优势与部署成本之间明确、可量化的权衡关系。