StickyMoE:让专家模型“记住”路由路径,推理更省内存
混合专家(MoE)模型虽然每个token只激活稀疏的专家子集,但相邻token经常激活不同专家,导致边缘设备在慢速存储和快速内存间频繁交换权重,严重影响推理效率。现有解决方案多为系统级缓存启发式方法或训练后路由微调,未能从根本上解决预训练阶段的路由不稳定性问题。
来自arXiv的最新研究提出StickyMoE方法,通过可微分的路由一致性损失函数,惩罚相邻token间的专家突然切换,鼓励路由器在语义连贯的文本片段中保持相同的专家分配。该方法无需修改模型架构,仅增加一个超参数λ,且与训练后微调方法不同,StickyMoE允许专家表示和路由决策从训练第一步开始协同适应。
实验表明,在小规模MoE语言模型上,StickyMoE能将专家切换率降低高达60%,而困惑度退化不足4%,在质量-局部性边界上帕累托占优于训练后微调方法。研究证明,路由的时间局部性在训练时植入最为有效,这为开发更高效、更适合边缘部署的MoE模型提供了新思路。