機器學習知識地圖 · 強化學習
Q-Learning
Off-policy 價值型方法
觀念教學
幫每個「狀態+動作」組合打分數,分數表填好了,走到哪查到哪 — Q-Learning 是價值型強化學習的祖師爺。
核心觀念
Q-Learning 是經典的價值型(Value-based)方法,學習狀態-動作價值函數(Q 值):在某狀態做某動作,未來能拿到多少累積獎勵。更新規則用白話寫:新 Q 值 = 舊 Q 值 + 學習率 ×(即時獎勵 + 折扣係數 × 下一狀態的最大 Q 值 - 舊 Q 值)。它屬於 Off-policy:用行為策略去探索,學的卻是目標(最優)策略,而且可在線互動學習。
白話理解
倉儲機器人學走迷宮:每個位置(狀態)對每個方向(動作)都有一個 Q 分數,到達終點加分、撞牆扣分。反覆試走,Q 表愈填愈準,最後每格都挑分數最高的方向走。
關鍵細節
- Off-policy 的意思:探索時可以亂走,更新時卻假設下一步會走最好的那一步 — 學得快,但風格激進
- 表格版只扛得住小狀態空間;狀態一多改用神經網路近似 Q 函數,就是 Deep Q-Learning(DQN),能直接吃影像等高維輸入
- 驗收:累積獎勵是否上升、收斂速度、Q 值收斂曲線是否趨穩
🎯 口訣:查 Q 表挑高分 — 探索歸探索,更新永遠假設下一步走最好。
iPAS 考點
必考比較:Q-Learning vs Deep Q-Learning — 前者用表格存 Q 值,只適合小狀態空間;後者用深度神經網路近似 Q 函數,能處理高維或連續狀態。答題抓「DQN = 神經網路版 Q-Learning」就對。另一組:Q-Learning(Off-policy)vs SARSA(On-policy),差在更新用「下一狀態最大 Q 值」還是「實際採取的下一動作」。
📝 本節掛載 1 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。
應用場景
評估指標
iPAS 歷屆考題詳解(1 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
關於 Q-Learning 與 Deep Q-Learning,下列敘述何者最正確?
- AQ-Learning 需要標記資料,Deep Q-Learning 不需要
- BQ-Learning 比 Deep Q-Learning 更適合處理高維度狀態空間
- CDeep Q-Learning 使用神經網路來近似 Q 值函數
- DQ-Learning 無法搭配經驗回放(Experience Replay)技術
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
傳統 Q-Learning 以 Q 表(Q-table)記錄每個「狀態-動作」組合的 Q 值,狀態空間一大(例如以影像作為狀態)表格便無法儲存與更新。Deep Q-Learning(DQN)的核心設計,正是以深度神經網路作為函數近似器來近似 Q 值函數:輸入狀態,輸出各動作的 Q 值估計,藉由神經網路的泛化能力處理高維度甚至連續的狀態空間,選項 (C) 正確描述此機制。
【為何其他選項錯了?】
- (A):Q-Learning 與 Deep Q-Learning 皆屬強化學習,依賴環境回饋的獎勵訊號學習,均不需要監督式的標記資料;此敘述混淆了強化學習與監督式學習。
- (B):方向正好相反:傳統 Q-Learning 受限於 Q 表規模,難以處理高維狀態空間;DQN 正是為了解決此限制而以神經網路取代表格。
- (D):經驗回放(Experience Replay)是儲存過往經驗並隨機抽樣訓練的技術,常與 DQN 搭配以打破樣本間的相關性,但概念上傳統 Q-Learning 亦可搭配使用,「無法搭配」的說法錯誤。
提示:DQN=Q-Learning+神經網路近似 Q 函數;表格存不下高維狀態,改由神經網路以泛化能力估計。