大模型提前“锁定”答案?Qwen3-8B 在推理前已倾向错误选择

arXiv·9 小时前

一项发布于 arXiv 的研究揭示了大语言模型中一种潜在的行为模式:模型可能在正式推理前就已“预承诺”于某个答案,后续的思考过程仅为合理化该选择,而非真正推导得出。研究以“我想洗车,洗车店在 100 米外,我该步行还是开车?”为最小化测试题。正确答案应为“开车”(因为车必须开到洗车店),但模型在绝大多数情况下推荐“步行”。

研究从行为和激活层面进行了分析。在行为层面,Qwen3-8B 模型在五种不同的系统提示条件下进行了 210 次测试,错误承诺(推荐步行)在每种条件下的采样测试中出现率为 85%-100%,在贪婪解码中则为 100%。即使给予模型长达 4096 个 token 的“思考”预算,也无法纠正这一错误。

在激活层面,研究使用一个预训练、无需任务特定训练即可解读隐藏状态的“激活预言机”进行探测。在模型输出答案文本之前的位置进行探测发现,“步行”的读出显著高于中性上下文基线。值得注意的是,即使是那些最终回答“开车”的测试,在承诺前其激活也倾向于“步行”。分析表明,这种读出并非源于词汇偏见或简单的文本恢复。

研究者强调,当前样本量较小,结果仍是初步的。同时,研究方法论上发现,仅改变问题措辞(如从开放式改为封闭式)就能显著影响控制实验的结果,这凸显了在解释此类探测结果时,进行针对不同措辞的阳性对照实验的重要性。

大语言模型模型行为分析推理机制Qwen可解释AI

原文来源:https://arxiv.org/abs/2607.16451

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回