← 返回课程列表
MoE 大模型实战:从专家路由到负载均衡

MoE 大模型实战:从专家路由到负载均衡

课程简介

本课程深入讲解 MoE(混合专家模型)的工程实践,覆盖从基础原理到万亿参数级训练的全部关键环节。MoE 是支撑 Qwen 3.8、Kimi K3、DeepSeek V3 等当前最强开源大模型的核心架构——它让模型在拥有万亿参数的同时,保持每次推理的算力开销可控。

课程围绕"为什么用 MoE → MoE 怎么工作 → MoE 怎么训练 → MoE 怎么部署"四个核心问题展开,每个概念配有可运行的代码示例或可视化图解,最终在收尾章节端到端搭建一个迷你 MoE 模型。

学习目标

  • 掌握 MoE 稀疏激活的数学原理与 gated routing 机制
  • 理解 TopK 路由、容量因子、辅助损失等关键工程组件
  • 能够使用 PyTorch 从零实现一个可训练的 MoE Layer
  • 掌握专家并行(Expert Parallelism)与 all-to-all 通信的分布式策略
  • 理解细粒度专家、共享专家等 2026 年最新架构改进
  • 具备阅读并为开源 MoE 项目(如 DeepSeek V3、Kimi K2)做贡献的能力

章节概览

  1. 第一章:MoE 基础 — 稀疏激活 vs 密集激活,路由器的数学定义
  2. 第二章:路由策略 — TopK 选择、容量因子、噪声注入与样本丢弃
  3. 第三章:负载均衡 — 辅助损失设计、专家利用率监控与调参实践
  4. 第四章:PyTorch 实现 — 从零搭建一个可训练的 MoE Layer
  5. 第五章:分布式训练 — 专家并行、all-to-all 通信与显存优化
  6. 第六章:前沿架构 — 细粒度专家、共享专家、MuonClip 与 MTP 协同
MoE 训练稳定性:AdamW vs MuonClip 0 loss 0 训练步数 AdamW:多次 loss spike MuonClip:零尖峰平滑下降

图1:MoE 训练损失曲线对比示意

MoE 大模型实战:从专家路由到负载均衡 | 必学必会