低查询预算下的文本硬标签对抗攻击新方法LBA

arXiv·4 天前

在硬标签对抗攻击场景中,如何在有限查询次数下生成高质量对抗文本一直是个难题。现有方法多采用贪心算法,逐个替换文本位置,这种局部搜索策略不仅难以发现优质对抗样本,还常导致查询成本过高。理想情况下,最优对抗样本应考虑文本中所有可能的位置组合,但穷举搜索在计算上不可行。为解决这一挑战,研究团队提出了基于采样的LBA方法。该方法通过整合先验知识与后验知识,构建高质量对抗样本的近似分布,并利用该分布进行采样。随着采样进行,后验知识不断更新近似分布,进而指导更有效的采样过程。在六个语言模型(涵盖从小型到大型架构)和四个数据集上的大量实验表明,LBA在所有评估指标上均显著优于现有最优基线方法。此外,基于大语言模型的评估显示,LBA生成的对抗文本在语义保持和可理解性方面表现更优。这项研究为低查询预算下的文本对抗攻击提供了新思路,有望推动对抗防御技术的发展。

对抗攻击自然语言处理文本安全机器学习arXiv

原文来源:https://arxiv.org/abs/2607.14101

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回