DriftGuard:面向动态毒性内容的安全感知多监控检测与选择性适应框架

arXiv·21 天前

在线内容审核系统常面临有害行为不断演化的问题,例如使用隐晦语言、转移攻击目标或规避检测策略。现有漂移检测方法多关注全局分布变化,但可能忽略局部危害子空间或高风险模型错误区域中出现的安全相关变化。为此,研究人员提出了DriftGuard框架,该框架结合了多监控器漂移检测与选择性模型更新机制。DriftGuard同时追踪全局文本漂移、身份相关危害漂移、模型不确定性、毒性风险漂移及假阴性风险漂移。一旦检测到与安全相关的变化,系统会使用一个“硬混合”适应集对模型进行更新,该集合优先包含可能的假阴性样本、身份相关高风险示例、假阳性风险示例以及不确定的边界案例。在Civil Comments时间漂移和Jigsaw至DynaHate跨数据集漂移上的实验表明,安全感知监控器能够发现仅靠全局漂移检测所遗漏的风险。采用硬混合适应策略后,在毒性召回率和准确率上均优于不更新及随机平衡基线方法,在Civil Comments上将毒性召回率提升至0.8777,在DynaHate上从0.7107提高至0.8523。自助法分析进一步显示,DynaHate上的安全性提升稳定,毒性召回率增加0.1418,假阴性发生率降低0.0781。总体而言,DriftGuard将安全感知的漂移检测与有针对性的轻量级模型更新相结合,为实现更鲁棒的自适应毒性内容审核提供了新思路。

内容审核漂移检测自适应系统自然语言处理AI安全

原文来源:https://arxiv.org/abs/2606.28725

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回