深度學習知識地圖 · 深度強化學習
Actor-Critic (Deep)
A2C, A3C, AlphaGo
觀念教學
把「演員加教練」的強化學習架構,接上深度神經網路的感知能力 — Deep Actor-Critic 讓 AI 能在圍棋、星海爭霸這種天文數字狀態空間裡學會決策。
核心觀念
Actor(演員)是策略網路,決定當下該出什麼動作;Critic(評論家)是價值網路,評估局面或動作的好壞,回饋給 Actor 修正方向。深度版的關鍵升級:用深度神經網路(如 CNN)當這兩個角色的大腦,直接從棋盤、遊戲畫面這種高維原始輸入讀懂局勢 — 傳統查表法在這種規模下完全塞不下。
白話理解
像職業棋士配隨行教練:棋士(Actor)落子,教練(Critic)即時點評「這一手讓勝算升還是降」,棋士據此調整棋風。目標不是單步輸贏,而是整局的累積獎勵最大化。
代表算法與戰績
- A2C(Advantage Actor-Critic):用「優勢值」= 這個動作比平均好多少,讓 Critic 的回饋更精準、訓練更穩
- A3C(Asynchronous Advantage Actor-Critic):開多個分身並行探索環境、非同步更新同一顆大腦,大幅加速訓練
- AlphaGo:策略網路加價值網路的組合,正是 Actor-Critic 精神的名場面
- 戰場延伸:星海爭霸這類即時戰略遊戲,狀態空間比圍棋更失控
- 強度衡量:棋類看 Elo 等級分與對戰勝率;訓練過程盯累積獎勵曲線是否穩定上升
🎯 口訣:Actor 出手,Critic 打分,深度網路當眼睛。
iPAS 考點
考架構配對:「策略網路與價值網路並用」→ Actor-Critic;「只學動作價值函數」→ Q-Learning 與 DQN 家族。判斷關鍵字:演員與評論家、雙網路互相回饋。陷阱:把 A3C 的「非同步並行」當成資料的分散式處理 — 它加速的是強化學習的探索與訓練,不是資料清洗。