深度學習知識地圖 · NLP 與 LLM

MoE 混合專家

Mixture of Experts

在互動地圖中開啟 回深度學習知識地圖

觀念教學

讓模型擁有巨量參數、每次卻只動用一小撮 — MoE 的算盤,是把「知識容量」和「計算成本」拆開來付錢。

核心觀念

MoE(Mixture of Experts,混合專家)把 Transformer 裡的大 FFN 換成多個專家 FFN 加一個路由器(Router)。流程:Gating 對每個 token 打分 → 選出 top-k 個專家 → 加權合併輸出 — 其餘專家原地休息,不耗計算。

白話理解

大醫院掛號。病人(token)到櫃檯(路由器),依症狀分給最相關的一兩位專科醫師(top-k 專家),不必全院會診 — 醫院可以聘很多醫師(容量大),每位病人的看診成本卻沒變(計算低)。

關鍵細節

  • 一句話核心:參數量不等於計算量總參數(所有專家都得存)決定容量與記憶體;啟用參數(實際走過的 top-k)決定每個 token 的計算量
  • 監控指標:啟用參數比FLOPs/token
  • 代價一:負載不均 — 熱門專家塞爆、冷門專家閒置,要加負載平衡輔助損失
  • 代價二:記憶體佔用大(參數全都要放著)、訓練較不穩
  • 實例:Switch Transformer(top-1,每個 token 只走一位專家)、Mixtral 8×7B(top-2;總參數約 47B、啟用約 13B)
🎯 口訣:專家很多、每次只叫幾個 — 總參數看容量,啟用參數看帳單。

iPAS 考點

必考總參數對啟用參數:Mixtral 8×7B 型題目 — 部署記憶體要放全部約 47B,單一 token 的計算只有約 13B 的等級,陷阱就是把兩者混為一談(另一陷阱:8×7B 直接乘成 56B,實際因共用組件約 47B)。考 MoE 動機 → 大容量、低計算;考副作用 → 負載不均、記憶體壓力、訓練不穩。

應用場景

大模型架構推論加速參數擴充

評估指標

啟用參數比FLOPs/token

相關節點