StickyMoE:让专家模型“记住”路由路径,推理更省内存

arXiv·8 天前

混合专家(MoE)模型虽然每个token只激活稀疏的专家子集,但相邻token经常激活不同专家,导致边缘设备在慢速存储和快速内存间频繁交换权重,严重影响推理效率。现有解决方案多为系统级缓存启发式方法或训练后路由微调,未能从根本上解决预训练阶段的路由不稳定性问题。

来自arXiv的最新研究提出StickyMoE方法,通过可微分的路由一致性损失函数,惩罚相邻token间的专家突然切换,鼓励路由器在语义连贯的文本片段中保持相同的专家分配。该方法无需修改模型架构,仅增加一个超参数λ,且与训练后微调方法不同,StickyMoE允许专家表示和路由决策从训练第一步开始协同适应。

实验表明,在小规模MoE语言模型上,StickyMoE能将专家切换率降低高达60%,而困惑度退化不足4%,在质量-局部性边界上帕累托占优于训练后微调方法。研究证明,路由的时间局部性在训练时植入最为有效,这为开发更高效、更适合边缘部署的MoE模型提供了新思路。

MoE模型模型训练推理优化边缘计算AI效率

原文来源:https://arxiv.org/abs/2607.08780

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回