破解大模型越狱攻击新视角:中间层熵动态变化暗藏玄机

arXiv·26 天前

越狱攻击一直是安全对齐后大语言模型的软肋——精心设计的提示词能绕过安全训练,诱使模型输出违规内容。现有防御多聚焦于提示词或输出层面,但恶意意图如何在模型内部表征中编码仍不明确。

一项最新研究通过分析冻结大语言模型各层的词元级预测熵轨迹,揭示了关键发现:静态的提示级熵统计量(如均值、方差)区分度有限,而捕捉熵在词元位置间演化趋势的特征(如基于单调排序的趋势得分)则更具信息量。

尤为重要的是,这种信号在模型深度上分布不均——它集中于中间层,在最终输出层反而减弱,表明越狱相关结构在中层网络表征中最为显著。研究在多个模型(Llama、Qwen、Gemma)和对抗基准测试中验证了这一规律,熵动态变化无需额外训练即可提供架构一致的区分度。

该成果不仅明确了哪些熵衍生特征编码了有害意图,更揭示了这些信号在网络中的集中位置,为理解模型内部安全机制提供了新视角。

大语言模型安全对齐越狱攻击模型可解释性熵分析

原文来源:https://arxiv.org/abs/2606.25182

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回