機器學習知識地圖 · 評估指標

評估指標

累積獎勵、Q值收斂

在互動地圖中開啟 回機器學習知識地圖

觀念教學

強化學習沒有準確率可看,Q-Learning 的成績單是兩條曲線:獎勵有沒有越拿越多、Q 值有沒有安定下來。

核心觀念

累積獎勵(Cumulative Reward)衡量代理人總體表現 — 一路拿到的獎勵總和,是強化學習最核心的評估量。平均每回合獎勵把它攤平到每回合,方便跨階段比較與畫學習曲線。Q 值收斂曲線追蹤 Q 表中的數值是否隨訓練趨於穩定 — 收斂代表學習穩定,策略不再大幅震盪。

白話理解

倉儲機器人學搬貨路線:前 100 回合撞牆連連、獎勵慘澹;學習曲線一路爬升後趨平,平均每回合獎勵不再進步、Q 值也不再大改 — 這時就能驗收上線。上線後仍要持續監控平均獎勵,環境一變,學好的策略就可能失效。

評估重點

  • 累積獎勵:總體表現的第一指標
  • 平均每回合獎勵:學習曲線的縱軸,看趨勢是否先升後穩
  • Q 值收斂曲線:判斷學習是否穩定、可否停止訓練
  • 訓練期因探索(Exploration)會犧牲短期獎勵,評估要看收斂後的表現
  • 實務常補看成功率與平均步數,例如迷宮任務幾回合內穩定走到終點
🎯 口訣:獎勵爬升代表在學,Q 值不動代表學會。

iPAS 考點

判斷關鍵字「累積獎勵最大化、與環境互動試錯」→ 強化學習;考「如何判斷 Q-Learning 訓練完成」— 答案方向是 Q 值收斂、平均獎勵趨穩。陷阱是拿準確率、MSE 這些監督式指標來評強化學習,任務型態根本不同。

應用場景

累積獎勵 - 總體表現Q 值收斂 - 學習穩定性

評估指標

累積獎勵Q 值收斂曲線平均每回合獎勵

相關節點