英伟达开源MoE优化工具:Transformers v5集成专家并行,微调速度提升3.7倍
英伟达近日开源了针对MoE(混合专家)模型的优化工具,该工具基于Transformers v5框架,新增了专家并行、DeepEP和TransformerEngine三大核心功能。专家并行技术通过将模型参数分配到多个GPU上并行处理,有效解决了MoE模型参数量大、内存占用高的问题。DeepEP则针对专家路由机制进行优化,减少了通信开销。TransformerEngine进一步提升了计算效率。实际测试显示,在相同硬件配置下,使用该工具进行模型微调的速度可提升3.7倍,显著降低了训练成本和时间。这一开源工具预计将推动MoE模型在更多实际场景中的应用,为AI开发者提供更高效的训练方案。