深度學習知識地圖 · 深度強化學習
Deep Q-Learning
Deep Q-Network
觀念教學
DQN 用深度神經網路逼近 Q 函數,是深度強化學習的里程碑。
白話說明
強化學習的 Q-Table 記錄「在某狀態做某動作能拿多少分」,但狀態太多時表格裝不下(像圍棋有 10^170 種狀態)。DQN 用神經網路取代表格,直接「猜」每個動作的分數。2015 年 DeepMind 用 DQN 打贏 Atari 遊戲,震驚世界。
使用場景
Atari 遊戲、簡單的機器人控制、推薦系統。
優點
能處理高維度狀態空間(如影像輸入)、開啟了深度強化學習時代。
缺點
只能處理離散動作(不能用在連續控制)、訓練不穩定(需要 Experience Replay 和 Target Network 來穩定)。
應用場景
評估指標
iPAS 歷屆考題詳解(2 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
關於 Q-Learning 與 Deep Q-Learning,下列敘述何者最正確?
- AQ-Learning 需要標記資料,Deep Q-Learning 不需要
- BQ-Learning 比 Deep Q-Learning 更適合處理高維度狀態空間
- CDeep Q-Learning 使用神經網路來近似 Q 值函數
- DQ-Learning 無法搭配經驗回放(Experience Replay)技術
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
Q-Learning 與 Deep Q-Learning(DQN)皆屬強化學習。傳統 Q-Learning 以 Q 表格(Q-table)儲存每個狀態-動作對的 Q 值,狀態空間一大即無法儲存與泛化。Deep Q-Learning 的核心改進正是以深度神經網路作為函數近似器,輸入狀態、輸出各動作的 Q 值,取代表格儲存,因此能處理影像輸入等高維度狀態空間,DeepMind 的 DQN 在 Atari 遊戲上的成果即為代表,選項 (C) 為正確敘述。
【為何其他選項錯了?】
- (A):兩者皆為強化學習,依靠環境回饋的獎勵訊號進行試錯學習,均不需要監督式學習所用的標記資料,此選項混淆了學習典範。
- (B):敘述顛倒;Q-table 在高維度狀態空間會急遽膨脹而不可行,DQN 以神經網路近似 Q 值正是為了解決此問題。
- (D):經驗回放(Experience Replay)是儲存過往經驗並隨機抽樣訓練以打破資料相關性的技術,雖以 DQN 聞名,但概念上並非神經網路專屬,傳統 Q-Learning 亦可搭配使用,「無法搭配」的說法不成立。
提示:DQN 的關鍵字是「神經網路近似 Q 值函數」;標記資料屬監督式學習,與強化學習無關。
某時尚品牌導入生成式 AI (Generative AI)技術,建立服裝設計輔助系統。系統 需根據設計師輸入的風格條件,自動產生具有高度視覺品質、細節穩定且風格變 化自然的服裝草圖。團隊特別重視生成結果的穩定性與多樣性控制能力。在此需 求下,下列哪一種模型技術或方法較為適合?
- A支援向量機(Support Vector Machine, SVM)
- B生成對抗網路(Generative Adversarial Network, GAN)
- C決策樹(Decision Tree)
- D擴散模型(Diffusion Model)
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
題目要求生成高視覺品質、細節穩定且風格變化自然的服裝草圖,並特別重視生成結果的穩定性與多樣性控制。擴散模型(Diffusion Model)透過逐步去噪的生成過程,能產出細節精緻、逼真且多樣的圖像;相較早期的 GAN,其訓練過程更穩定,對生成品質與多樣性的控制能力更強,也是 Midjourney、Stable Diffusion 等文生圖工具的核心技術,最符合題幹需求。
【名詞白話語典】
- 擴散模型(Diffusion Model):先對圖片逐步加入雜訊直到成為純雜訊,再訓練模型學習反向的去噪過程,從而能由雜訊生成新圖片的生成模型。
- 生成對抗網路(GAN):以生成器與判別器相互博弈的方式學習生成資料,影像品質可以很高,但訓練過程不穩定,容易發生模式崩潰(輸出集中於少數樣態)。
【為何其他選項錯了?】
- (A):支援向量機是鑑別式模型,用於分類與迴歸,不具備生成圖像的能力。
- (B):GAN 雖能生成高品質圖像,但訓練穩定性與多樣性控制正是其相對弱項,與題幹特別強調的兩項要求不合。
- (C):決策樹同屬鑑別式模型,用於分類與預測,無法生成圖像。
提示:題幹同時強調「穩定性」與「多樣性控制」時,擴散模型優於 GAN;鑑別式模型直接排除。