機器學習知識地圖 · 強化學習

Policy Gradient

策略型方法,直接優化

在互動地圖中開啟 回機器學習知識地圖

觀念教學

價值型方法先打分數再挑動作;策略梯度不繞路 — 直接調整「行為本身」,往獎勵高的方向微調策略。

核心觀念

策略梯度(Policy Gradient)策略型(Policy-based)方法:把策略寫成帶參數的函數(輸入狀態、輸出動作機率),直接對策略做梯度優化,讓高獎勵動作的出現機率變大,代表演算法是 REINFORCE。最大優勢:天生適合連續動作空間 — 當動作是「方向盤轉幾度」這種連續值,價值型「逐一比較每個動作的 Q 值」根本列不完。

白話理解

機械手臂學倒水:角度與力道都是連續的,無法列成表格查分。策略梯度讓手臂每輪嘗試後,把「這輪獎勵高」的動作機率調高一點,慢慢收斂出流暢的倒水策略。

關鍵細節

  • 輸出是動作的機率分布,天生帶隨機性,探索內建
  • 弱點:梯度方差大,訓練不穩、樣本效率低 — 這正是 Actor-Critic 出場的理由
  • 策略熵用來監控探索程度:熵掉太快代表過早定型,容易卡在次佳解
  • 驗收仍看累積獎勵曲線是否穩定上升
🎯 口訣:不打分、直接改行為 — 連續動作找它,但小心方差震到暈。

iPAS 考點

判斷關鍵字:直接優化策略函數、連續動作空間。經典比較:價值型(Q-Learning/SARSA,離散動作、先學 Q 值)vs 策略型(Policy Gradient,連續動作、直接學策略)。陷阱選項:「Policy Gradient 需要先學出 Q 表」— 錯,它跳過價值函數直接調策略;題目要「價值與策略兼具」時,答案是 Actor-Critic。

應用場景

機器人手臂控制自動駕駛遊戲 AI

評估指標

累積獎勵策略熵梯度方差

相關節點