多图组合暗藏风险:当无害图片叠加产生有害语义
在社交媒体日益流行的多图内容中,出现了一种新型安全隐患——多图隐性毒性(MIIT)。这种现象表现为单张图片看似无害,但当多张图片组合观看时,却可能产生有害的语义联想。由于每张图片本身缺乏明显的风险线索,现有的商业内容审核API和模型难以有效识别此类风险。
研究团队首先对MIIT进行了明确定义,并分析了检测面临的三大挑战。为解决该领域数据稀缺问题,他们通过自动生成流程构建了MIIT-dataset,这是一个仅包含图片的多图安全数据集,覆盖了七个代表性风险类别。
在此基础上,团队开发了MiShield模型,采用渐进式蒸馏推理监督进行训练,使其不仅能做出安全判断,还能明确分析导致危害的相关实体。实验结果显示,MiShield-8B模型在检测效果上超越了主流审核服务甚至更大规模的模型,展现了其在这一广泛应用视觉格式上的有效性和实用价值。该研究为社交媒体平台的内容安全审核提供了新的技术思路。