深度學習知識地圖 · 評估指標

評估指標

累積獎勵, KL散度

在互動地圖中開啟 回深度學習知識地圖

觀念教學

PPO 的儀表板比一般強化學習多幾顆錶:除了看賺多少獎勵,還要盯著策略「每次更新有沒有跨太大步」。

核心觀念

PPO 的精神是限制每次策略更新的幅度,評估因此分兩面。結果面看累積獎勵:總體表現是否持續上升。過程面是健康檢查:KL 散度監控新舊策略更新幅度的差距,太大代表更新過猛;Clip 比例PPO 特有的監控量,記錄多少樣本觸發了裁剪機制;價值損失(Value Loss)看價值網路(Critic)估得準不準。

白話理解

教練帶選手改動作。累積獎勵是比賽成績;KL 散度是「這週動作和上週差多少」— 一次改太多會受傷;Clip 比例是教練喊「停,幅度太大」的次數,喊得太頻繁代表訓練菜單有問題;價值損失是選手自我評估的準度。

關鍵細節

  • 累積獎勵:最終目標,趨勢向上才算學到東西
  • KL 散度:太大代表步幅過猛、策略可能崩壞;趨近零也不妙,代表幾乎沒在學
  • Clip 比例:太高代表大量更新被裁掉、效率差,通常該調小學習率
  • 價值損失:Actor-Critic 架構裡 Critic 的品質指標
  • 同一把 KL 尺在 RLHF 再登場:防止微調後的模型偏離原模型太遠
🎯 口訣:獎勵看結果、KL 看步幅、Clip 看煞車、價值看裁判。

iPAS 考點

考「哪個指標是 PPO 特有」→ Clip 比例。考 KL 散度在此的角色 → 監控策略更新幅度;注意與 VAE 的 KL(潛在分布對常態分布)用途不同,靠情境分辨。陷阱敘述:「KL 散度越低越好」— 錯,它是監控量,太低代表學不動,不是成績單。

應用場景

累積獎勵 - 總體表現KL 散度 - 策略變化監控Clip 比例 - 更新幅度

評估指標

累積獎勵KL 散度Clip 比例價值損失

相關節點