多语言与语码混合场景下,毒性信号可靠性需“看情况”

arXiv·1 天前

内容审核系统正越来越多地依赖外部毒性检测工具,但一项最新研究揭示,这些工具在多语言混合、语码转换、音译、俚语及语言不匹配的场景下表现并不可靠。来自arXiv的研究论文《Conditional Reliability of Toxicity Signals for Multilingual and Code-Mixed Abuse Detection》聚焦印度多语言及语码混合的短文本环境,深入探讨了毒性先验信息的“条件可靠性”。研究发现,英语毒性信号、印度语辱骂内容以及基于规则的严重性线索,仅在特定的语言和辱骂严重性背景下才能作为有效证据。

为此,研究团队提出了名为“ToxGate”的信任融合头方法。该方法的核心创新在于,先将每个辅助信号与编码器表征进行条件化处理,再将其融入预测状态。在针对三个短文本辱骂数据集、四种Transformer编码器模型以及每种设置下五个随机种子的广泛实验中,ToxGate在12个域内设置中的10个,以及8个迁移设置中的7个,均超越了匹配的普通编码器基线。提升最为显著且可解释性最强的场景,出现在高风险的内容审核切片中,例如明确的人身攻击、暴力威胁以及跨数据集迁移任务。

研究传递的核心启示是:内容审核系统应将外部毒性工具和先验信息视为“条件证据”,而非固定的特征或绝对真理。在细致的消融实验中,针对特定信号源进行门控处理,在迁移学习、严重辱骂内容切片以及高风险分类任务中取得了最强效果。这为构建更稳健、更适应全球化多语言互联网环境的AI审核工具提供了新思路。

内容审核多语言NLP毒性检测语码混合AI安全

原文来源:https://arxiv.org/abs/2607.15861

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回