機器學習知識地圖 · 評估指標
評估指標
累積獎勵、Q值收斂
觀念教學
強化學習沒有準確率可看,Q-Learning 的成績單是兩條曲線:獎勵有沒有越拿越多、Q 值有沒有安定下來。
核心觀念
累積獎勵(Cumulative Reward)衡量代理人總體表現 — 一路拿到的獎勵總和,是強化學習最核心的評估量。平均每回合獎勵把它攤平到每回合,方便跨階段比較與畫學習曲線。Q 值收斂曲線追蹤 Q 表中的數值是否隨訓練趨於穩定 — 收斂代表學習穩定,策略不再大幅震盪。
白話理解
倉儲機器人學搬貨路線:前 100 回合撞牆連連、獎勵慘澹;學習曲線一路爬升後趨平,平均每回合獎勵不再進步、Q 值也不再大改 — 這時就能驗收上線。上線後仍要持續監控平均獎勵,環境一變,學好的策略就可能失效。
評估重點
- 累積獎勵:總體表現的第一指標
- 平均每回合獎勵:學習曲線的縱軸,看趨勢是否先升後穩
- Q 值收斂曲線:判斷學習是否穩定、可否停止訓練
- 訓練期因探索(Exploration)會犧牲短期獎勵,評估要看收斂後的表現
- 實務常補看成功率與平均步數,例如迷宮任務幾回合內穩定走到終點
🎯 口訣:獎勵爬升代表在學,Q 值不動代表學會。
iPAS 考點
判斷關鍵字「累積獎勵最大化、與環境互動試錯」→ 強化學習;考「如何判斷 Q-Learning 訓練完成」— 答案方向是 Q 值收斂、平均獎勵趨穩。陷阱是拿準確率、MSE 這些監督式指標來評強化學習,任務型態根本不同。