BPE分词成安全漏洞:字符级扰动如何绕过大语言模型对齐机制
最新研究揭示了大语言模型安全对齐中的一个结构性漏洞:BPE分词机制。该机制会将安全相关词汇拆分为子词片段,而现有三大公开对齐数据集中均未包含故意拆分的输入样本。研究人员在五个主流模型家族(Qwen-3-4B、Qwen-2.5-7B、Gemma-3-4B、Llama-3.1-8B、Mistral-7B)上进行了端到端测试。实验显示,针对安全词分段的优化攻击能够翻转80-100%原本被拒绝的有害提示,其中48%的翻转产生了真正的有害输出。激活修补技术将受干扰信号定位到模型最后约30%的层。在对30,000个对齐数据样本的扫描中,研究人员未发现任何分段的提示样本。防御方面,通过68个配置网格(55个训练检查点)的测试表明,没有DPO配置能在三个模型家族上实现稳定且封闭的攻击成功率。虽然在分段提示上训练的SFT能在3/5模型家族上关闭攻击成功率,但这仅通过全局崩溃实现,同时也会提高对良性提示的拒绝率。为区分选择性修复与全局崩溃,研究团队引入了Conv-Benign诊断工具。所有攻击成功率声明均经过三位评审校准,细胞排名在评审间保持稳定。