機器學習知識地圖 · 強化學習
Policy Gradient
策略型方法,直接優化
觀念教學
價值型方法先打分數再挑動作;策略梯度不繞路 — 直接調整「行為本身」,往獎勵高的方向微調策略。
核心觀念
策略梯度(Policy Gradient)是策略型(Policy-based)方法:把策略寫成帶參數的函數(輸入狀態、輸出動作機率),直接對策略做梯度優化,讓高獎勵動作的出現機率變大,代表演算法是 REINFORCE。最大優勢:天生適合連續動作空間 — 當動作是「方向盤轉幾度」這種連續值,價值型「逐一比較每個動作的 Q 值」根本列不完。
白話理解
機械手臂學倒水:角度與力道都是連續的,無法列成表格查分。策略梯度讓手臂每輪嘗試後,把「這輪獎勵高」的動作機率調高一點,慢慢收斂出流暢的倒水策略。
關鍵細節
- 輸出是動作的機率分布,天生帶隨機性,探索內建
- 弱點:梯度方差大,訓練不穩、樣本效率低 — 這正是 Actor-Critic 出場的理由
- 策略熵用來監控探索程度:熵掉太快代表過早定型,容易卡在次佳解
- 驗收仍看累積獎勵曲線是否穩定上升
🎯 口訣:不打分、直接改行為 — 連續動作找它,但小心方差震到暈。
iPAS 考點
判斷關鍵字:直接優化策略函數、連續動作空間。經典比較:價值型(Q-Learning/SARSA,離散動作、先學 Q 值)vs 策略型(Policy Gradient,連續動作、直接學策略)。陷阱選項:「Policy Gradient 需要先學出 Q 表」— 錯,它跳過價值函數直接調策略;題目要「價值與策略兼具」時,答案是 Actor-Critic。