JUMP攻击:单次查询即可检测扩散语言模型训练数据泄露

arXiv·10 小时前

在人工智能安全领域,成员推理攻击旨在判断特定数据是否被用于训练目标模型。最新研究针对经过微调的离散扩散语言模型提出JUMP攻击方法,该技术充分利用扩散模型的两大特性:任意顺序解码和并行解码能力。

传统攻击方法SAMA需要多次随机采样掩码并平均重建信号,导致查询成本高昂。JUMP创新性地通过联合不确定性引导掩码探测,首先选择参考模型置信度较低的关键位置,然后通过单次联合掩码查询对所有选定位置进行评分。

实验显示,在六个MIMIR领域微调的LLaDA-8B-Base模型上,JUMP将平均ROC-AUC从0.82提升至0.90,显著改善了低误报率下的检测性能。更重要的是,JUMP仅需对目标模型和参考模型各进行一次选择器传递和一次评分传递,大幅降低了计算开销。

这项研究揭示了扩散语言模型在隐私保护方面的新挑战,为模型训练数据的安全评估提供了更高效的检测工具,对AI模型的安全部署具有重要参考价值。

扩散模型隐私安全成员推理攻击语言模型AI安全

原文来源:https://arxiv.org/abs/2607.16207

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回