推理过程为何会出错?新方法让大模型自我纠偏
随着大语言模型能力的快速提升,现代系统不仅能处理复杂知识,还能通过多步骤推理解决难题。然而,当推理链条变长时,模型在推理过程中可能产生大量“幻觉”内容,这些错误往往难以察觉。
最新研究发现,大模型在推理时特别容易出现一种特殊类型的幻觉——“上下文敏感的事实幻觉”。即模型本身具备相关知识,却在推理过程中因上下文干扰而犯下事实性错误。这种现象揭示了当前大模型在复杂推理任务中的深层缺陷。
为解决这一问题,研究团队提出了“步骤级自一致性组相对策略优化”(SSC-GRPO)方法。该方法通过计算多个推理路径中各个步骤的自一致性得分,为推理轨迹分配步骤级奖励。与现有方法相比,SSC-GRPO在数学推理基准测试和幻觉排行榜上都取得了最先进的性能表现。
这项研究为检测和缓解大语言模型推理过程中的幻觉问题提供了新视角,有望推动更可靠、更准确的AI推理系统发展。相关论文已发布在arXiv预印本平台上。