機器學習知識地圖 · 強化學習

SARSA

On-policy 價值型方法

在互動地圖中開啟 回機器學習知識地圖

觀念教學

跟 Q-Learning 系出同門,但個性保守:它只根據「自己實際會走的下一步」來學,不做「下一步一定走最好」的白日夢。

核心觀念

SARSA 的名字就是流程:State-Action-Reward-State-Action,用「狀態、動作、獎勵、下一狀態、下一動作」五元組更新。它是 On-policy 方法:評估與改進的正是自己當下執行的策略 — 更新時用「實際採取的下一個動作」的 Q 值,而不是像 Q-Learning 取下一狀態的最大 Q 值。

白話理解

經典的懸崖行走問題:Q-Learning 學出貼著懸崖走的最短路(反正更新時假設自己不會失足);SARSA 知道自己探索時偶爾會亂走,學出離懸崖遠一點的安全路線。比 Q-Learning 保守,原因就在這裡。

關鍵細節

  • 適合需要安全探索的場景:實體機器人、產線控制,任何試錯成本高的環境
  • 學到的是「把探索風險算進去」的務實策略,累積獎勵可能略低,但訓練過程更穩
  • 驗收:累積獎勵之外,特別看安全性指標(訓練過程的失敗或碰撞次數)
  • 與 Q-Learning 同為價值型、可用表格實作,差別只在更新來源
🎯 口訣:SARSA 走老實路 — 用實際的下一步更新,保守但安全。

iPAS 考點

必考對照:SARSA(On-policy,保守,安全探索)vs Q-Learning(Off-policy,激進,直攻最優)。判斷關鍵字:題目強調安全、風險、評估自己實際執行的策略 → SARSA;強調探索與學習分離、學最優策略 → Q-Learning。陷阱:兩者都是價值型方法,別誤選成策略型。

應用場景

機器人控制自動駕駛模擬安全關鍵系統

評估指標

累積獎勵安全性指標

相關節點