機器學習知識地圖 · 評估指標

評估指標

累積獎勵、安全性指標

在互動地圖中開啟 回機器學習知識地圖

觀念教學

SARSA 是走保守路線的強化學習,評估它除了看獎勵多寡,還多記一本安全帳:訓練過程中闖了幾次禍。

核心觀念

累積獎勵衡量總體表現,與 Q-Learning 相同。安全性指標(如違規次數、掉入危險狀態的次數)衡量避免危險狀態的能力 — 這是 SARSA 的招牌:它是 On-Policy,把「自己會探索、會犯錯」算進更新,學出來的路線天生會閃著危險走。收斂速度看達到穩定表現所需的回合數。

白話理解

經典的懸崖行走問題:Q-Learning 學出貼著懸崖的最短路,訓練中常摔落;SARSA 學出離懸崖一格的安全路。若場景是無人機或產線機械,訓練期的每次違規都是真金白銀的成本。

評估重點

  • 累積獎勵:總體表現
  • 安全性指標(違規次數):訓練與執行期進入危險狀態的頻率
  • 收斂速度:多快學到穩定策略
  • 與 Q-Learning 對照:SARSA 訓練期更安全,最終路徑可能較保守、獎勵略低
  • 評估報告常把兩者畫在同一張學習曲線上,獎勵與違規次數一起比
🎯 口訣:Q-Learning 求最短,SARSA 求平安;安全帳看違規次數。

iPAS 考點

經典考點是 SARSA(On-Policy)與 Q-Learning(Off-Policy)之別:SARSA 用「實際走的下一步」更新,行為保守安全;Q-Learning 用「最大 Q 值的下一步」更新,激進求最優。判斷關鍵字:安全性、避免危險狀態 → SARSA;情境題若強調「訓練過程中的失誤代價高昂」,答案方向也是這類保守更新。

應用場景

累積獎勵 - 總體表現安全性指標 - 風險規避

評估指標

累積獎勵安全性指標 (違規次數)收斂速度

相關節點