HyGRAIL:融合图神经网络与LLM的智能科学假设发现框架
科学知识图谱虽然整理了文献中的实体与关系,但天然存在信息缺失问题。这些缺失的关联可能代表着尚未探索的科学假设,例如新材料与潜在应用之间的未知联系。然而,从海量候选关系中识别真正有价值的假设极具挑战:图神经网络效率高但可靠性有限,大语言模型知识丰富但计算成本高昂且缺乏结构化推理能力。
近日,研究团队在arXiv发布HyGRAIL框架,提出“成本敏感、证据支撑”的混合解决方案。该框架采用两阶段流程:首先使用异构图神经网络对候选假设进行评分,筛选出模型不确定的“模糊区域”;随后仅将这些疑难案例交由大语言模型进行复审。在复审阶段,系统会从知识图谱中检索节点关联和多跳关系路径,通过模板或LLM将其转化为自然语言证据,最终由LLM智能体基于结构化证据进行判断。
在材料科学知识图谱MatKG上的实验显示,HyGRAIL取得0.429的最佳F1分数,较此前最优基线提升0.242,比纯图神经网络方案提升0.322。同时,图神经网络的初筛机制将大语言模型调用频率平均降低54.36%。消融实验进一步证明,检索得到的图谱证据对可靠假设验证至关重要,而精炼的双向证据比单纯增加检索数量更为有效。