深度學習知識地圖 · 生成式 AI
GAN
生成對抗網路
觀念教學
一場左右互搏的軍備競賽:讓兩個網路互相對抗,「騙」出逼真到人眼難辨的影像 — 這就是生成對抗網路(GAN, Generative Adversarial Network)。
核心觀念
生成器(Generator)從隨機雜訊生出假樣本,判別器(Discriminator)判斷樣本是真是假。兩者輪流訓練、互相進逼:生成器想騙過判別器,判別器想抓出假貨。理想終點是判別器再也分不出真假,代表生成器已學會真實資料的分佈。
白話理解
生成器是偽鈔製造者,判別器是驗鈔機。製造者不斷改良偽鈔,驗鈔機不斷升級辨識能力;競爭到最後,偽鈔逼真到驗鈔機也分不出來。
用途、罩門與評估
- 用途:圖像生成(人臉、風景)、風格轉換、超解析度,以及替稀少類別做資料增強
- 優點:影像銳利逼真,明顯比 VAE 清晰
- 罩門一:訓練不穩定,兩個網路的強弱平衡很難拿捏
- 罩門二:模式崩潰(Mode Collapse) — 生成器偷懶,只生成少數幾種圖,多樣性歸零
- 難以精準控制生成內容;主流地位目前逐漸被 Diffusion 模型取代
- 評估看 FID(與真實影像的特徵分佈距離,越低越好)和 IS(品質加多樣性,越高越好)
🎯 口訣:偽鈔犯對決驗鈔機,道高一尺魔高一丈。
iPAS 考點
考組成配對:生成器加判別器,關鍵字是對抗訓練。生成式三兄弟一句話分清:VAE 靠重建,影像偏糊;GAN 靠對抗,銳利但會模式崩潰;Diffusion 靠逐步去噪,品質穩定是現任主流。題目描述「兩個網路互相競爭」就是 GAN;看到「先編碼再解碼」別誤跟去 VAE。
應用場景
評估指標
iPAS 歷屆考題詳解(1 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
在使用生成對抗網路(GAN)進行人臉影像生成時,若出現「模式崩潰」(Mode Collapse)現象,下列哪一種方法最常被用來有效解決此問題?
- A在鑑別器中加入梯度懲罰(Gradient Penalty)以穩定訓練過程
- B採用 Wasserstein 距離(WGAN 損失)替代原始的 GAN 損失函數
- C對生成器輸入的潛在向量加入隨機擾動
- D使用多尺度鑑別器架構以提高對多樣性的判別能力
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
模式崩潰(Mode Collapse)指生成器只學會產生少數幾種樣本、輸出多樣性喪失的現象。其根源之一是原始 GAN 的損失函數對應 JS 散度,當生成分佈與真實分佈幾乎不重疊時梯度趨近消失,生成器得不到有效的更新訊號。WGAN 改以 Wasserstein 距離作為損失函數,即使兩分佈不重疊仍能提供平滑且有意義的梯度,使訓練更穩定、生成器能覆蓋更多資料模式,是文獻中對抗模式崩潰最具代表性的解法。
【為何其他選項錯了?】
- (A):梯度懲罰(Gradient Penalty)是 WGAN-GP 為滿足 Lipschitz 條件而設計的配套技巧,屬於穩定訓練的輔助手段,核心仍是 Wasserstein 損失本身。
- (C):對潛在向量加入隨機擾動僅增加輸入雜訊,生成器仍可能把不同輸入映射到相同的少數輸出,無法解決崩潰問題。
- (D):多尺度鑑別器主要用於提升高解析度影像的細節品質,並非解決模式崩潰的代表性方法。
提示:模式崩潰的教科書解法是 WGAN:以 Wasserstein 距離取代原始損失,維持有效梯度。