多图组合暗藏风险:当无害图片叠加产生有害语义

arXiv·19 天前

在社交媒体日益流行的多图内容中,出现了一种新型安全隐患——多图隐性毒性(MIIT)。这种现象表现为单张图片看似无害,但当多张图片组合观看时,却可能产生有害的语义联想。由于每张图片本身缺乏明显的风险线索,现有的商业内容审核API和模型难以有效识别此类风险。

研究团队首先对MIIT进行了明确定义,并分析了检测面临的三大挑战。为解决该领域数据稀缺问题,他们通过自动生成流程构建了MIIT-dataset,这是一个仅包含图片的多图安全数据集,覆盖了七个代表性风险类别。

在此基础上,团队开发了MiShield模型,采用渐进式蒸馏推理监督进行训练,使其不仅能做出安全判断,还能明确分析导致危害的相关实体。实验结果显示,MiShield-8B模型在检测效果上超越了主流审核服务甚至更大规模的模型,展现了其在这一广泛应用视觉格式上的有效性和实用价值。该研究为社交媒体平台的内容安全审核提供了新的技术思路。

内容安全多模态AI社交媒体数据集计算机视觉

原文来源:https://arxiv.org/abs/2607.00576

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回