機器學習知識地圖 · 評估指標

評估指標

累積獎勵、策略熵

在互動地圖中開啟 回機器學習知識地圖

觀念教學

策略梯度直接學「出招的機率」,評估它除了獎勵,還要盯兩個內科指標:策略熵(還在探索嗎)與梯度方差(訓練穩嗎)。

核心觀念

累積獎勵衡量總體表現,仍是主指標。策略熵(Policy Entropy)衡量探索程度 — 熵高代表策略仍廣泛嘗試各種動作;熵快速塌到零代表過早定型,可能鎖死在次佳策略。梯度方差影響訓練穩定性:策略梯度靠抽樣估計梯度,方差大會讓學習曲線劇烈震盪、難以收斂。

白話理解

教 AI 玩廣告競價:初期策略熵高,什麼價位都試;隨訓練下降,出價越來越篤定。若獎勵曲線跳得像心電圖,多半是梯度方差太大 — 加基線(Baseline)或改用 Actor-Critic 來壓。實務也常把熵加進損失函數當正則項,鼓勵策略多探索。

評估重點

  • 累積獎勵:總體表現主指標
  • 策略熵:探索程度的溫度計,驟降是過早收斂的警訊
  • 梯度方差:方差大則訓練不穩,常用基線或 Advantage 降低
  • 學習曲線的平滑度與收斂趨勢要一起看
  • 連續動作空間(如機械手臂控制)是策略梯度的主場,獎勵曲線是驗收核心
🎯 口訣:熵看還敢不敢試,方差看走得穩不穩。

iPAS 考點

判斷關鍵字「直接優化策略、輸出動作機率」→ 策略梯度;考「策略梯度的主要缺點」— 答案方向是梯度方差大、樣本效率低,對策是加基線或改用 Actor-Critic 架構,而不是「加大學習率」這種火上澆油的陷阱選項。

應用場景

累積獎勵 - 總體表現策略熵 - 探索程度梯度方差 - 訓練穩定性

評估指標

累積獎勵策略熵 (Policy Entropy)梯度方差

相關節點