深度學習知識地圖 · 生成式 AI

GAN

生成對抗網路

在互動地圖中開啟 回深度學習知識地圖

觀念教學

一場左右互搏的軍備競賽:讓兩個網路互相對抗,「騙」出逼真到人眼難辨的影像 — 這就是生成對抗網路(GAN, Generative Adversarial Network)

核心觀念

生成器(Generator)從隨機雜訊生出假樣本,判別器(Discriminator)判斷樣本是真是假。兩者輪流訓練、互相進逼:生成器想騙過判別器,判別器想抓出假貨。理想終點是判別器再也分不出真假,代表生成器已學會真實資料的分佈。

白話理解

生成器是偽鈔製造者,判別器是驗鈔機。製造者不斷改良偽鈔,驗鈔機不斷升級辨識能力;競爭到最後,偽鈔逼真到驗鈔機也分不出來。

用途、罩門與評估

  • 用途:圖像生成(人臉、風景)、風格轉換、超解析度,以及替稀少類別做資料增強
  • 優點:影像銳利逼真,明顯比 VAE 清晰
  • 罩門一:訓練不穩定,兩個網路的強弱平衡很難拿捏
  • 罩門二:模式崩潰(Mode Collapse) — 生成器偷懶,只生成少數幾種圖,多樣性歸零
  • 難以精準控制生成內容;主流地位目前逐漸被 Diffusion 模型取代
  • 評估看 FID(與真實影像的特徵分佈距離,越低越好)和 IS(品質加多樣性,越高越好)
🎯 口訣:偽鈔犯對決驗鈔機,道高一尺魔高一丈。

iPAS 考點

考組成配對:生成器加判別器,關鍵字是對抗訓練。生成式三兄弟一句話分清:VAE 靠重建,影像偏糊;GAN 靠對抗,銳利但會模式崩潰;Diffusion 靠逐步去噪,品質穩定是現任主流。題目描述「兩個網路互相競爭」就是 GAN;看到「先編碼再解碼」別誤跟去 VAE。

應用場景

圖像生成風格轉換超解析度資料增強

評估指標

FIDIS

iPAS 歷屆考題詳解(1 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第20題

在使用生成對抗網路(GAN)進行人臉影像生成時,若出現「模式崩潰」(Mode Collapse)現象,下列哪一種方法最常被用來有效解決此問題?

  1. A在鑑別器中加入梯度懲罰(Gradient Penalty)以穩定訓練過程
  2. B採用 Wasserstein 距離(WGAN 損失)替代原始的 GAN 損失函數
  3. C對生成器輸入的潛在向量加入隨機擾動
  4. D使用多尺度鑑別器架構以提高對多樣性的判別能力
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 模式崩潰(Mode Collapse)指生成器只學會產生少數幾種樣本、輸出多樣性喪失的現象。其根源之一是原始 GAN 的損失函數對應 JS 散度,當生成分佈與真實分佈幾乎不重疊時梯度趨近消失,生成器得不到有效的更新訊號。WGAN 改以 Wasserstein 距離作為損失函數,即使兩分佈不重疊仍能提供平滑且有意義的梯度,使訓練更穩定、生成器能覆蓋更多資料模式,是文獻中對抗模式崩潰最具代表性的解法。 【為何其他選項錯了?】 - (A):梯度懲罰(Gradient Penalty)是 WGAN-GP 為滿足 Lipschitz 條件而設計的配套技巧,屬於穩定訓練的輔助手段,核心仍是 Wasserstein 損失本身。 - (C):對潛在向量加入隨機擾動僅增加輸入雜訊,生成器仍可能把不同輸入映射到相同的少數輸出,無法解決崩潰問題。 - (D):多尺度鑑別器主要用於提升高解析度影像的細節品質,並非解決模式崩潰的代表性方法。 提示:模式崩潰的教科書解法是 WGAN:以 Wasserstein 距離取代原始損失,維持有效梯度。

相關節點