新方法检测大模型推理漏洞:GPT-4o的思维链竟有66%问题存在“答对但推理错”

arXiv·5 天前

大语言模型生成的思维链推理看似逻辑严谨,但其推理过程可能并未真正依赖所陈述的前提。来自arXiv的最新研究提出了一种名为“干预式基础审计”的黑盒测试方法,专门检测推理步骤对前提的依赖关系。

该方法的核心思路是:针对推理链中的单个前提,将其目标谓词替换为全新符号,然后重新运行模型,检查每个推理步骤的规范化结论是否发生变化。这种干预式测试能够揭示模型推理过程中的真实依赖模式。

研究团队在ProntoQA基准上进行了验证,这是一个包含黄金证明树的合成多跳演绎推理数据集。测试结果显示,该方法在检测证明树依赖关系上达到F1分数0.806(在谓词决定依赖上达0.885),显著优于自一致性基线方法(F1=0.343)。

更值得关注的是,研究发现66%被正确解决的问题中,至少包含一个与直接证明树依赖不一致的推理步骤——这些步骤都涉及实体引入前提,而这正是当前评估方法的盲点。这表明模型可能“答对了问题,但推理过程却是错误的”,这种问题是被动评估方法无法发现的。

该研究为评估大语言模型的推理可靠性提供了新工具,所有审计证书、原始输出和复现脚本已在GitHub开源。不过研究人员也指出,该方法目前主要适用于形式化、可解析的基准测试场景。

大语言模型推理评估思维链GPT-4oAI安全

原文来源:https://arxiv.org/abs/2607.13069

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回