MGDT:多模态知识图谱补全新框架,引入MLLM引导的扩散Transformer

arXiv·1 天前

多模态知识图谱补全(MKGC)旨在利用结构、文本和视觉线索推断缺失的实体信息。现有基于扩散模型的MKGC方法通常在原始多模态特征上直接进行去噪,这种设计迫使去噪器同时执行关系相关的线索选择、跨模态语义对齐和结构感知的实体生成,导致扩散过程受到噪声和语义不一致条件的干扰,从而影响补全效果。

为解决这一局限,研究团队提出了MGDT框架,其核心创新在于采用“先对齐后扩散”的范式。该框架包含三个关键模块:首先,关系自适应语义路由专家混合模块(RASR-MoE)能够根据具体关系选择相关的多模态语义转换路径,抑制无关模态的干扰;其次,利用冻结的多模态大语言模型(MLLM)作为语义锚点,将路由后的多模态表征对齐到统一的潜在空间,减少跨模态语义异质性;最后,知识图谱扩散Transformer(KGDT)在对齐后的空间中进行图条件去噪生成,产生缺失的实体表征。

实验结果表明,在三个主流基准数据集上,MGDT框架均持续优于现有强基线模型,验证了其设计的有效性。该方法为多模态知识图谱补全任务提供了一种更精准、更鲁棒的解决方案,有望推动知识图谱与多模态AI技术的进一步融合。

知识图谱多模态AI扩散模型大语言模型Transformer

原文来源:https://arxiv.org/abs/2607.15592

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回