新方法检测大模型推理漏洞:GPT-4o的思维链竟有66%问题存在“答对但推理错”
大语言模型生成的思维链推理看似逻辑严谨,但其推理过程可能并未真正依赖所陈述的前提。来自arXiv的最新研究提出了一种名为“干预式基础审计”的黑盒测试方法,专门检测推理步骤对前提的依赖关系。
该方法的核心思路是:针对推理链中的单个前提,将其目标谓词替换为全新符号,然后重新运行模型,检查每个推理步骤的规范化结论是否发生变化。这种干预式测试能够揭示模型推理过程中的真实依赖模式。
研究团队在ProntoQA基准上进行了验证,这是一个包含黄金证明树的合成多跳演绎推理数据集。测试结果显示,该方法在检测证明树依赖关系上达到F1分数0.806(在谓词决定依赖上达0.885),显著优于自一致性基线方法(F1=0.343)。
更值得关注的是,研究发现66%被正确解决的问题中,至少包含一个与直接证明树依赖不一致的推理步骤——这些步骤都涉及实体引入前提,而这正是当前评估方法的盲点。这表明模型可能“答对了问题,但推理过程却是错误的”,这种问题是被动评估方法无法发现的。
该研究为评估大语言模型的推理可靠性提供了新工具,所有审计证书、原始输出和复现脚本已在GitHub开源。不过研究人员也指出,该方法目前主要适用于形式化、可解析的基准测试场景。