概念链:用自然文本隐式操控大模型推理路径

arXiv·4 天前

大语言模型在表面上展现出可靠的推理能力,但重复采样常会得到正确与错误的混合答案,揭示了最终决策形成的底层脆弱性。最新研究探索了如何通过“隐式推理操控”利用这种脆弱性:使用自然语言文本使模型偏向指定答案,而无需明确指令、触发词或直接答案提示。

研究团队提出的“概念链”方法,通过生成简短的连接段落,将问题实体与目标选项通过一两个中间概念联系起来。随后对目标模型在这些连接段落上进行持续预训练,并评估其在原始选择题上的答案偏好是否发生偏移。

实验结果表明,间接、看似自然的文本能够系统性地操控模型预测,同时其可推断性远低于直接改写文本。这证明推理脆弱性不仅是评估假象,更构成了一个实际通道:看似普通的文本可通过该通道放大潜在偏见,从而隐蔽地重定向模型决策。这一发现对模型安全部署和对抗性攻击防御提出了新的挑战。

大语言模型推理脆弱性对抗攻击模型安全概念链

原文来源:https://arxiv.org/abs/2607.14242

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回