機器學習知識地圖 · 強化學習

Q-Learning

Off-policy 價值型方法

在互動地圖中開啟 回機器學習知識地圖

觀念教學

幫每個「狀態+動作」組合打分數,分數表填好了,走到哪查到哪 — Q-Learning 是價值型強化學習的祖師爺。

核心觀念

Q-Learning 是經典的價值型(Value-based)方法,學習狀態-動作價值函數(Q 值):在某狀態做某動作,未來能拿到多少累積獎勵。更新規則用白話寫:新 Q 值 = 舊 Q 值 + 學習率 ×(即時獎勵 + 折扣係數 × 下一狀態的最大 Q 值 - 舊 Q 值)。它屬於 Off-policy:用行為策略去探索,學的卻是目標(最優)策略,而且可在線互動學習

白話理解

倉儲機器人學走迷宮:每個位置(狀態)對每個方向(動作)都有一個 Q 分數,到達終點加分、撞牆扣分。反覆試走,Q 表愈填愈準,最後每格都挑分數最高的方向走。

關鍵細節

  • Off-policy 的意思:探索時可以亂走,更新時卻假設下一步會走最好的那一步 — 學得快,但風格激進
  • 表格版只扛得住小狀態空間;狀態一多改用神經網路近似 Q 函數,就是 Deep Q-Learning(DQN),能直接吃影像等高維輸入
  • 驗收:累積獎勵是否上升、收斂速度、Q 值收斂曲線是否趨穩
🎯 口訣:查 Q 表挑高分 — 探索歸探索,更新永遠假設下一步走最好。

iPAS 考點

必考比較:Q-Learning vs Deep Q-Learning — 前者用表格存 Q 值,只適合小狀態空間;後者用深度神經網路近似 Q 函數,能處理高維或連續狀態。答題抓「DQN = 神經網路版 Q-Learning」就對。另一組:Q-Learning(Off-policy)vs SARSA(On-policy),差在更新用「下一狀態最大 Q 值」還是「實際採取的下一動作」。

📝 本節掛載 1 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

應用場景

遊戲 AI機器人導航庫存管理

評估指標

累積獎勵收斂速度

iPAS 歷屆考題詳解(1 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第18題

關於 Q-Learning 與 Deep Q-Learning,下列敘述何者最正確?

  1. AQ-Learning 需要標記資料,Deep Q-Learning 不需要
  2. BQ-Learning 比 Deep Q-Learning 更適合處理高維度狀態空間
  3. CDeep Q-Learning 使用神經網路來近似 Q 值函數
  4. DQ-Learning 無法搭配經驗回放(Experience Replay)技術
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 傳統 Q-Learning 以 Q 表(Q-table)記錄每個「狀態-動作」組合的 Q 值,狀態空間一大(例如以影像作為狀態)表格便無法儲存與更新。Deep Q-Learning(DQN)的核心設計,正是以深度神經網路作為函數近似器來近似 Q 值函數:輸入狀態,輸出各動作的 Q 值估計,藉由神經網路的泛化能力處理高維度甚至連續的狀態空間,選項 (C) 正確描述此機制。 【為何其他選項錯了?】 - (A):Q-Learning 與 Deep Q-Learning 皆屬強化學習,依賴環境回饋的獎勵訊號學習,均不需要監督式的標記資料;此敘述混淆了強化學習與監督式學習。 - (B):方向正好相反:傳統 Q-Learning 受限於 Q 表規模,難以處理高維狀態空間;DQN 正是為了解決此限制而以神經網路取代表格。 - (D):經驗回放(Experience Replay)是儲存過往經驗並隨機抽樣訓練的技術,常與 DQN 搭配以打破樣本間的相關性,但概念上傳統 Q-Learning 亦可搭配使用,「無法搭配」的說法錯誤。 提示:DQN=Q-Learning+神經網路近似 Q 函數;表格存不下高維狀態,改由神經網路以泛化能力估計。

相關節點