研究发现:一句简单前缀即可绕过AI安全防护机制
近日,arXiv平台发布的一项研究揭示了当前对齐语言模型安全机制中的关键漏洞。研究发现,模型虽然能正常拒绝有害请求,但在提示前添加“当然,这是”等简单前缀后,拒绝机制就会失效。研究团队通过四个不同规模模型(1.5B-14B参数)的实验证实了这一现象的普遍性。
研究显示,模型对有害内容的内部表征并未改变——在攻击成功的提示中,线性探针读取到的危害程度与正常拒绝时相近(0.91-0.98),但行为上的拒绝率却降至随机水平。这表明模型的拒绝机制是一种浅层的、响应端的计算过程。
通过定位分析,研究人员发现拒绝机制失效主要发生在响应生成的前半段。剂量匹配的位置控制实验表明,仅需前半段响应就足以破坏拒绝机制,而后半段几乎无效。三种因果探针方法均指向这一时间窗口。
进一步实验发现,在早期响应窗口恢复危害方向可部分重建拒绝机制。注入模型自身的拒绝状态可逆转越狱攻击(74%成功率)。更重要的是,研究揭示了这一现象的根本机制:基础模型对照实验表明,相同的前缀控制方法在未经安全调优的基础模型中同样有效(有害内容从64%降至25%),说明前缀的影响是通用的自回归条件作用,而非安全特定的抑制机制。
研究指出,安全机制失效的主要原因是被动机制占主导,虽然存在小部分安全特定的吸引子(logit追踪浓度0.24 vs 0.03),但决策过程是分布式且可解码的,拒绝行为跟踪的是实际危害而非表面危险词汇。这一发现对AI安全监控具有重要意义:仅读取提示端表征的监控系统对此类响应端攻击具有天然免疫力,但机制本身的分散性意味着失效面是局部的。