专家模型不要专家并行!微软开源MoE新路径GRIN MoE

微软GRIN MoE大模型通过SparseMixer-v2改进专家路由梯度估计,克服传统MoE梯度反向传播问题;摒弃专家并行,采用数据、pipeline和张量并行避免token丢弃,显著提升训练效率;GRIN MoE在编码和数学基准测试中表现出色,具备高计算扩展潜力,与密集模型相比实现超过80%的训练效率提升。

搜索