BPE分词成安全漏洞:字符级扰动如何绕过大语言模型对齐机制

arXiv·18 天前

最新研究揭示了大语言模型安全对齐中的一个结构性漏洞:BPE分词机制。该机制会将安全相关词汇拆分为子词片段,而现有三大公开对齐数据集中均未包含故意拆分的输入样本。研究人员在五个主流模型家族(Qwen-3-4B、Qwen-2.5-7B、Gemma-3-4B、Llama-3.1-8B、Mistral-7B)上进行了端到端测试。实验显示,针对安全词分段的优化攻击能够翻转80-100%原本被拒绝的有害提示,其中48%的翻转产生了真正的有害输出。激活修补技术将受干扰信号定位到模型最后约30%的层。在对30,000个对齐数据样本的扫描中,研究人员未发现任何分段的提示样本。防御方面,通过68个配置网格(55个训练检查点)的测试表明,没有DPO配置能在三个模型家族上实现稳定且封闭的攻击成功率。虽然在分段提示上训练的SFT能在3/5模型家族上关闭攻击成功率,但这仅通过全局崩溃实现,同时也会提高对良性提示的拒绝率。为区分选择性修复与全局崩溃,研究团队引入了Conv-Benign诊断工具。所有攻击成功率声明均经过三位评审校准,细胞排名在评审间保持稳定。

大语言模型安全对齐BPE分词对抗攻击模型安全

原文来源:https://arxiv.org/abs/2607.01239

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回