科学生成自纠错新框架:语言模型也能“知错就改”

arXiv·10 小时前

大型语言模型在生成科技内容时经常违反基础科学原理,这严重影响了其在科学应用中的可靠性。近日,研究人员在arXiv上发布了一项创新研究,提出科学可行性控制框架SFC。该框架采用图结构共形预测方法,通过渐进式绝对-连贯-事实性验证,为科学推理有效性提供统计保证。

SFC将科学推理分解为原子级的绝对-连贯-事实性单元,要求每个单元既符合物理定律,又能从先前上下文中获得逻辑支撑。这种方法特别解决了早期科学错误污染后续推理步骤的级联效应问题。与传统孤立处理声明的方法不同,SFC将逻辑依赖关系建模为近似可推导图,并在检测到科学违规时通过动态分支进行实时验证,系统会以已验证上下文为基础转向替代生成路径。

研究团队在多个科学推理基准测试中验证了SFC的有效性,包括PhyX多模态物理、MATH、ScienceQA和ARC Challenge。在PhyX物理推理任务中,SFC实现了50.1%的准确率,显著超越了DeepSeek-R1的49.8%和GPT-4的45.8%。更重要的是,在α=0.10置信水平下,该系统提供了91.7%的科学有效性保证,并在多种模型架构中将科学定律违反现象减少了73%。这一进展为语言模型在科学领域的可靠应用开辟了新途径。

语言模型科学推理共形预测AI可靠性学术研究

原文来源:https://arxiv.org/abs/2607.16704

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回