破解大模型越狱攻击新视角:中间层熵动态变化暗藏玄机
越狱攻击一直是安全对齐后大语言模型的软肋——精心设计的提示词能绕过安全训练,诱使模型输出违规内容。现有防御多聚焦于提示词或输出层面,但恶意意图如何在模型内部表征中编码仍不明确。
一项最新研究通过分析冻结大语言模型各层的词元级预测熵轨迹,揭示了关键发现:静态的提示级熵统计量(如均值、方差)区分度有限,而捕捉熵在词元位置间演化趋势的特征(如基于单调排序的趋势得分)则更具信息量。
尤为重要的是,这种信号在模型深度上分布不均——它集中于中间层,在最终输出层反而减弱,表明越狱相关结构在中层网络表征中最为显著。研究在多个模型(Llama、Qwen、Gemma)和对抗基准测试中验证了这一规律,熵动态变化无需额外训练即可提供架构一致的区分度。
该成果不仅明确了哪些熵衍生特征编码了有害意图,更揭示了这些信号在网络中的集中位置,为理解模型内部安全机制提供了新视角。