VeryTrace:通过可编译形式化与结构化验证提升推理链可靠性

arXiv·27 天前

在多步推理任务中,思维链(CoT)提示法仍存在脆弱性:早期步骤的逻辑错误或幻觉会无声传播,导致最终结论错误但置信度高。为解决这一问题,arXiv最新研究提出VeryTrace框架,通过零样本验证与修复机制,将自然语言推理轨迹形式化为结构化、可编译的表示。

VeryTrace引入一种领域特定语言(DSL),具备三大特性:一是显式表达步骤依赖关系,二是将定量内容机械化处理为可执行表达式,三是通过演绎模式结构化语义推理。该混合验证器结合了确定性检查(用于计算正确性、依赖关系解析和约束满足)与针对性的大语言模型审计(用于非机械化语义判断),实现了步骤级错误定位与修复。

在三个多样化领域——竞赛数学(AIME 2025)、机器人规划(LLM-BabyBench)和亲属关系推理(CLUTRR)的实验中,VeryTrace在无需领域特定训练或上下文示例的情况下,显著提升了先进大语言模型的零样本基准准确率。这表明形式化轨迹验证既能保证推理精度,又具备良好的泛化能力,为提升复杂推理任务的可靠性提供了新思路。

推理验证思维链形式化方法大语言模型人工智能

原文来源:https://arxiv.org/abs/2606.24124

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回