多层级上下文建模提升MoE专家选择一致性
混合专家模型通过将词元路由至少数专家实现Transformer模型的高效扩展,但现有路由机制通常基于浅层或孤立的词元表示进行专家选择,导致不同层级间的路由决策不稳定且语义不一致。针对这一瓶颈,研究团队从表示学习的角度重新审视专家选择问题,发现上下文信息不完整是制约专家有效专业化的关键因素。为此提出的MCF-MOE框架创新性地构建了上下文感知表示:一方面通过跨层语义聚合捕捉全局依赖关系,另一方面结合局部词元级交互信息,形成多层次互补信号。这种融合机制使专家选择过程既包含丰富语义信息,又保持跨层决策一致性。在语言建模与理解基准测试中,MCF-MOE相比现有MoE基线模型,不仅显著提升路由一致性指标,在下游任务性能上也取得稳定改进。该研究揭示了上下文完整性对专家路由机制的重要性,为大规模稀疏模型的高效训练提供了新思路。代码已开源供学术界验证使用。