
MoE 大模型实战:从专家路由到负载均衡
课程简介
本课程深入讲解 MoE(混合专家模型)的工程实践,覆盖从基础原理到万亿参数级训练的全部关键环节。MoE 是支撑 Qwen 3.8、Kimi K3、DeepSeek V3 等当前最强开源大模型的核心架构——它让模型在拥有万亿参数的同时,保持每次推理的算力开销可控。
课程围绕"为什么用 MoE → MoE 怎么工作 → MoE 怎么训练 → MoE 怎么部署"四个核心问题展开,每个概念配有可运行的代码示例或可视化图解,最终在收尾章节端到端搭建一个迷你 MoE 模型。
学习目标
- 掌握 MoE 稀疏激活的数学原理与 gated routing 机制
- 理解 TopK 路由、容量因子、辅助损失等关键工程组件
- 能够使用 PyTorch 从零实现一个可训练的 MoE Layer
- 掌握专家并行(Expert Parallelism)与 all-to-all 通信的分布式策略
- 理解细粒度专家、共享专家等 2026 年最新架构改进
- 具备阅读并为开源 MoE 项目(如 DeepSeek V3、Kimi K2)做贡献的能力
章节概览
- 第一章:MoE 基础 — 稀疏激活 vs 密集激活,路由器的数学定义
- 第二章:路由策略 — TopK 选择、容量因子、噪声注入与样本丢弃
- 第三章:负载均衡 — 辅助损失设计、专家利用率监控与调参实践
- 第四章:PyTorch 实现 — 从零搭建一个可训练的 MoE Layer
- 第五章:分布式训练 — 专家并行、all-to-all 通信与显存优化
- 第六章:前沿架构 — 细粒度专家、共享专家、MuonClip 与 MTP 协同
图1:MoE 训练损失曲线对比示意