機器學習知識地圖 · 強化學習

Actor-Critic (A2C/A3C)

結合價值與策略

在互動地圖中開啟 回機器學習知識地圖

觀念教學

一個負責演(決定動作),一個負責評(打分數)— 演員與影評人搭檔,把價值型和策略型的優點焊在一起。

核心觀念

Actor-Critic 結合策略函數(Actor,演員)價值函數(Critic,評論家):Actor 依狀態輸出動作,Critic 評估這個動作比平均水準好多少,回饋給 Actor 修正方向。這個「比平均好多少」就是 Advantage 估計 — 用它取代原始獎勵來更新策略,大幅降低 Policy Gradient 的梯度方差,訓練更穩。

白話理解

新人業務(Actor)每天跑客戶,主管(Critic)不只說「這單成交了」,而是說「這單比你平常水準好很多」— 有基準的回饋,學得又快又穩。遊戲對弈、機器人控制、廣告即時競價這類複雜環境,多半用這個骨架訓練。

A2C 與 A3C

  • A2C(Advantage Actor-Critic):同步版,多個環境副本一起收集經驗、統一更新
  • A3C(Asynchronous Advantage Actor-Critic):非同步版,多個工作者各自探索、各自更新共享參數,訓練效率
  • 兩者都以 Advantage 為核心,是深度強化學習的主流骨架之一
  • 驗收:累積獎勵平均獎勵曲線是否穩定上升、收斂穩定性與訓練效率
🎯 口訣:Actor 演、Critic 評 — 有評分基準,方差小、學得穩。

iPAS 考點

判斷關鍵字:同時有策略與價值兩個角色、Advantage、A2C/A3C。三選一分類題常出:價值型(只學 Q 值)、策略型(只學策略)、Actor-Critic(兩者結合)。陷阱:選動作的是 Actor,Critic 只負責評估,不負責選動作 — 選項把兩個角色寫反就是錯的;另一個誘餌是把 A3C 的「非同步」說成「多個代理互相對打」,其實是多個工作者平行蒐集經驗。

應用場景

Atari 遊戲機器人控制自動駕駛

評估指標

累積獎勵平均獎勵訓練效率

相關節點