概念链:用自然文本隐式操控大模型推理路径
大语言模型在表面上展现出可靠的推理能力,但重复采样常会得到正确与错误的混合答案,揭示了最终决策形成的底层脆弱性。最新研究探索了如何通过“隐式推理操控”利用这种脆弱性:使用自然语言文本使模型偏向指定答案,而无需明确指令、触发词或直接答案提示。
研究团队提出的“概念链”方法,通过生成简短的连接段落,将问题实体与目标选项通过一两个中间概念联系起来。随后对目标模型在这些连接段落上进行持续预训练,并评估其在原始选择题上的答案偏好是否发生偏移。
实验结果表明,间接、看似自然的文本能够系统性地操控模型预测,同时其可推断性远低于直接改写文本。这证明推理脆弱性不仅是评估假象,更构成了一个实际通道:看似普通的文本可通过该通道放大潜在偏见,从而隐蔽地重定向模型决策。这一发现对模型安全部署和对抗性攻击防御提出了新的挑战。