深度學習知識地圖 · 深度強化學習

Actor-Critic (Deep)

A2C, A3C, AlphaGo

在互動地圖中開啟 回深度學習知識地圖

觀念教學

把「演員加教練」的強化學習架構,接上深度神經網路的感知能力 — Deep Actor-Critic 讓 AI 能在圍棋、星海爭霸這種天文數字狀態空間裡學會決策。

核心觀念

Actor(演員)是策略網路,決定當下該出什麼動作;Critic(評論家)是價值網路,評估局面或動作的好壞,回饋給 Actor 修正方向。深度版的關鍵升級:用深度神經網路(如 CNN)當這兩個角色的大腦,直接從棋盤、遊戲畫面這種高維原始輸入讀懂局勢 — 傳統查表法在這種規模下完全塞不下。

白話理解

像職業棋士配隨行教練:棋士(Actor)落子,教練(Critic)即時點評「這一手讓勝算升還是降」,棋士據此調整棋風。目標不是單步輸贏,而是整局的累積獎勵最大化。

代表算法與戰績

  • A2C(Advantage Actor-Critic):用「優勢值」= 這個動作比平均好多少,讓 Critic 的回饋更精準、訓練更穩
  • A3C(Asynchronous Advantage Actor-Critic):開多個分身並行探索環境、非同步更新同一顆大腦,大幅加速訓練
  • AlphaGo:策略網路加價值網路的組合,正是 Actor-Critic 精神的名場面
  • 戰場延伸:星海爭霸這類即時戰略遊戲,狀態空間比圍棋更失控
  • 強度衡量:棋類看 Elo 等級分與對戰勝率;訓練過程盯累積獎勵曲線是否穩定上升
🎯 口訣:Actor 出手,Critic 打分,深度網路當眼睛。

iPAS 考點

考架構配對:「策略網路與價值網路並用」→ Actor-Critic;「只學動作價值函數」→ Q-Learning 與 DQN 家族。判斷關鍵字:演員與評論家、雙網路互相回饋。陷阱:把 A3C 的「非同步並行」當成資料的分散式處理 — 它加速的是強化學習的探索與訓練,不是資料清洗。

應用場景

圍棋 (AlphaGo)Dota 2星海爭霸複雜控制

評估指標

Elo 等級分勝率

相關節點