图原生强化学习新突破:通过概念重组实现可追溯的科学假设生成
在材料科学等复杂领域中,加速新发现需要AI系统能够通过多步骤、基于领域的推理生成科学有效的假设。传统大语言模型虽然能流畅响应开放式材料设计问题,但其推理过程往往缺乏可追溯性,难以判断最终结论是否基于连贯的中间推理。
为此,研究团队开发了Graph-PRefLexOR模型系列,采用图原生强化学习方法,通过分组相对策略优化(GRPO)进行微调。该模型将推理过程组织为明确的阶段:机制探索、图构建、模式提取和假设合成,从而将神经语言生成与符号关系结构相连接,使得因果关联能够被构建、检查和重用。
在材料科学与力学文献中的100个开放式问题上,Graph-PRefLexOR相比基础模型实现了40-65%的性能提升,其中推理可追溯性方面的进步最为显著。嵌入分析表明,该模型具有更广泛的语义探索能力,语义多样性达到基线模型的2-3倍。语义回溯和分层隐藏状态分析进一步证实,结构化推理与最终答案之间具有更强的对齐性。
此外,测试时的图扩展显示,额外的计算资源主要用于在有限语义空间内增加长距离概念重组,而非简单扩大语义覆盖范围。这一成果为材料设计及其他科学应用中的可解释AI系统开辟了新路径,推动AI在科学假设生成领域向更透明、可靠的方向发展。