← 学习中心

混合专家模型(MoE):为什么大模型每次只唤醒一小部分"专家"

混合专家(MoE)是一类用"多个专用子网络+路由器"替代单一大网络的模型结构。它让模型参数量可以做到万亿级,但每次推理只激活其中一小部分(如 896 个专家里只调用 16 个),从而在"知识容量"和"计算成本"之间解耦。本文讲清 MoE 的工作原理、稀疏激活为何省钱,以及它如何成为今天开源大模型的主流骨架。

本节你将能

读完你会理解三件事:① MoE(MoE)长什么样;② 为什么"参数很多但算得很少"在物理上成立;③ 像 Kimi K3 这样的万亿模型,为什么普通显卡也能跑起来一部分。

直觉模型:一家有 896 个专科医生的医院

想象一家超级医院,里面有 896 名专科医生,但前台有一位分诊员(路由器,Router)。每当一位病人(一个 token)进来,分诊员只挑选最对口的 2 名医生会诊,而不是让全体医生都动员。医院"储备的知识"来自 896 名医生的总和(参数量大),但"当下消耗的工时"只是 2 名医生(激活参数少)。这正是 MoE 的核心:知识容量与计算开销解耦。

MoE 推理:每次只唤醒少数专家 输入 token 路由器 Router 挑选 Top-2 专家 专家 E3 ✓ 专家 E71 ✓ 专家 E12 专家 E40 …共 896 个 仅 2 个激活 输出 每个 token 只经过 2/896 ≈ 0.2% 的参数,但模型整体"知道"所有专家的知识

图:MoE 把"总知识"拆给众多专家,路由器为每个 token 只点亮少数几位

核心要点

  • 结构:Transformer 的某些前馈层被替换成"N 个专家网络 + 1 个路由器"。路由器是一个小神经网络,给每个专家打分,只保留分数最高的 Top-k(常取 k=1 或 2)。
  • 稀疏激活:参数量可以做到 2.8 万亿(如 Kimi K3 有 896 个专家),但每个 token 只激活约 1.8% 的参数。显存要装下全部参数,FLOPs 却只按激活部分算——这就是"内存贵、算力省"的由来。
  • 为什么重要:在算力受限(如出口管制)的环境里,MoE 让实验室用"堆内存、省计算"的策略逼近闭源巨模型的能力,是 2026 年开源模型的主流骨架(Kimi K3、DeepSeek V4、GLM 5.2 均属 MoE)。
  • 代价:路由不均会导致"专家饥饿"(部分专家从不激活)、训练稳定性更差、服务时需要把全部参数驻留显存。所以它不是免费午餐,而是一次精明的工程权衡。

一句话总结:MoE 让大模型像一家"按需会诊"的医院——知识总量极大,但每次看病只叫对口的几位医生,于是既能装下万亿参数,又不至于算到破产。

---
混合专家模型(MoE):为什么大模型每次只唤醒一小部分"专家" | 必学必会