機器學習知識地圖 · 強化學習
Actor-Critic (A2C/A3C)
結合價值與策略
觀念教學
一個負責演(決定動作),一個負責評(打分數)— 演員與影評人搭檔,把價值型和策略型的優點焊在一起。
核心觀念
Actor-Critic 結合策略函數(Actor,演員)與價值函數(Critic,評論家):Actor 依狀態輸出動作,Critic 評估這個動作比平均水準好多少,回饋給 Actor 修正方向。這個「比平均好多少」就是 Advantage 估計 — 用它取代原始獎勵來更新策略,大幅降低 Policy Gradient 的梯度方差,訓練更穩。
白話理解
新人業務(Actor)每天跑客戶,主管(Critic)不只說「這單成交了」,而是說「這單比你平常水準好很多」— 有基準的回饋,學得又快又穩。遊戲對弈、機器人控制、廣告即時競價這類複雜環境,多半用這個骨架訓練。
A2C 與 A3C
- A2C(Advantage Actor-Critic):同步版,多個環境副本一起收集經驗、統一更新
- A3C(Asynchronous Advantage Actor-Critic):非同步版,多個工作者各自探索、各自更新共享參數,訓練效率高
- 兩者都以 Advantage 為核心,是深度強化學習的主流骨架之一
- 驗收:累積獎勵與平均獎勵曲線是否穩定上升、收斂穩定性與訓練效率
🎯 口訣:Actor 演、Critic 評 — 有評分基準,方差小、學得穩。
iPAS 考點
判斷關鍵字:同時有策略與價值兩個角色、Advantage、A2C/A3C。三選一分類題常出:價值型(只學 Q 值)、策略型(只學策略)、Actor-Critic(兩者結合)。陷阱:選動作的是 Actor,Critic 只負責評估,不負責選動作 — 選項把兩個角色寫反就是錯的;另一個誘餌是把 A3C 的「非同步」說成「多個代理互相對打」,其實是多個工作者平行蒐集經驗。