深度學習知識地圖 · 生成式 AI

生成式 AI

VAE, GAN, Diffusion

在互動地圖中開啟 回深度學習知識地圖

觀念教學

傳統 AI 負責「分析」:這張圖是貓還是狗?生成式 AI(Generative AI)負責「創造」:幫我畫一隻穿太空裝的貓。它學會資料的分佈規律,再從中取樣,生成全新的內容。

核心觀念

生成式模型學的不是分類邊界,而是資料分佈(Data Distribution);學會之後從分佈中取樣(Sampling),就能產生從未見過的圖像、文字、音樂、影片與 3D 模型。對照組是鑑別式 AI(Discriminative AI):只判斷輸入屬於哪一類,不會無中生有。

白話理解

音樂串流平台想讓 AI 依既有歌曲,自動生成風格多變的新旋律 — 重點是系統不能只是播放或拼接既有片段,也不能僅做資料重建,而是學會「歌的分佈」之後創作新歌。同一套邏輯撐起 AI 繪圖(Midjourney)、文字生成(ChatGPT)、影片生成(Sora)與音樂生成。

三大技術演進與評估

  • VAE(2013):壓縮再重建,以重建誤差加 KL 散度(合稱 ELBO)為訓練目標;能生成,但影像較模糊
  • GAN(2014):生成器與判別器對抗訓練,影像銳利,但訓練不穩定
  • Diffusion(2020):逐步去噪,品質最高、最穩定,目前主流
  • 影像品質評估:FID 量生成與真實影像的特徵分佈距離,越低越好;IS 同時看品質與多樣性,越高越好
  • 進階評估:LPIPS 量人眼感知的相似度;文生圖用 CLIP Score 檢查圖文對齊程度
🎯 口訣:鑑別式畫界線,生成式學分佈再取樣。

iPAS 考點

兩個真實考向。一、情境題強調「不能只是拼接既有內容、也不能僅進行資料重建,要生成具風格變化的新內容」→ 答生成式 AI,判斷關鍵字是學習資料分佈、生成新樣本。二、生成式與鑑別式的合作:以生成式 AI 模擬新型攻擊流量、納入防禦模型訓練,主要助益是擴充訓練資料的多樣性,提升鑑別式模型對未知變種攻擊的泛化能力,不是取代鑑別式模型。

📝 本節掛載 2 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

應用場景

降維/特徵學習異常檢測圖像生成風格轉換超解析度資料增強AI 繪圖圖像編輯影片生成

評估指標

重建誤差KL 散度ELBOFIDISLPIPSCLIP Score

iPAS 歷屆考題詳解(5 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

115年第二次初級AI應用規劃師第一科人工智慧基礎概論 第40題

某音樂串流平台希望開發一套AI 系統,能根據平台上累積的大量歌曲資料,自動生成具有不同風格變化的全新旋律,供創作者作為靈感參考。平台技術長在評估方案時強調,系統不能只是播放或拼接既有歌曲片段,也不能僅進行資料的重建,而是要真正學習音樂的結構與風格,並創作出從未出現過的新旋律。 請問下列哪一種模型技術最符合此需求?

  1. AK-近鄰演算法(K-Nearest Neighbors, KNN);
  2. B自編碼器(Autoencoder);
  3. C生成對抗網路(GAN);
  4. D隨機森林(Random Forest)
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 題幹要求系統真正學習音樂的結構與風格,並創作從未出現過的新旋律,而非播放、拼接既有片段或僅進行資料重建,這是生成式模型的任務。生成對抗網路(GAN)由生成器與鑑別器對抗訓練:生成器學習訓練資料的分佈以產生新樣本,鑑別器判斷樣本真偽,兩者相互提升,最終使生成器能產出符合訓練資料風格卻全新的內容,符合「學習分佈、生成新樣本」的需求,是選項中唯一的生成式模型。 【為何其他選項錯了?】 - (A):KNN 依據鄰近樣本進行分類或迴歸,本質是比對既有資料,不具備生成新內容的能力。 - (B):自編碼器的訓練目標是壓縮後重建輸入,題幹已明確排除「僅進行資料的重建」;基本自編碼器並非以生成新樣本為目的。 - (D):隨機森林是監督式的分類與迴歸模型,屬鑑別式方法,無法生成新旋律。 提示:「創作從未出現過的新內容」對應生成式模型;KNN 與隨機森林屬鑑別式,自編碼器重在重建。
115年第二次初級AI應用規劃師第一科人工智慧基礎概論 第49題

某資安公司目前以鑑別式AI 偵測已知網路攻擊。為因應新型變種攻擊,研究人員計劃利用生成式AI 模擬可能的攻擊流量,並納入防禦模型訓練。下列何者最能說明此做法對鑑別式AI 防禦模型的主要助益?

  1. A生成式AI 可取代真實攻擊資料,降低蒐集成本;
  2. B生成式AI 可直接負責防禦決策,取代原有模型;
  3. C模擬攻擊資料可使模型自動轉為生成式架構;
  4. D將模擬攻擊納入訓練,可提升模型對未知攻擊的辨識能力
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 鑑別式模型的辨識能力受限於訓練資料的涵蓋範圍,對未見過的新型變種攻擊容易漏判。生成式 AI 可模擬可能的攻擊流量,產生多樣化的變種樣本;把這些模擬攻擊納入防禦模型的訓練資料,等於擴充訓練資料的多樣性,讓鑑別式模型在訓練階段先接觸各種攻擊變化,從而提升對未知或變種攻擊的辨識能力,這正是題幹做法對防禦模型的主要助益。 【為何其他選項錯了?】 - (A):模擬資料可補充訓練樣本,但其分佈源自模型已學到的內容,無法完全取代真實攻擊資料的蒐集與驗證;降低成本也非題幹強調的主要助益。 - (B):此情境中生成式 AI 的角色是產生訓練樣本,防禦決策仍由鑑別式模型負責,兩者分工不同,不存在取代關係。 - (C):在訓練資料中加入模擬攻擊不會改變模型架構,鑑別式模型仍是鑑別式,不會自動轉為生成式架構。 提示:生成式 AI 在此扮演資料擴增角色,為鑑別式防禦模型製造更多變種訓練情境。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第40題

下列哪一項最正確地描述了 VAE(Variational Autoencoder)、GAN(Generative Adversarial Network)與擴散模型(Diffusion Model)在多模態潛在空間對齊(Latent Alignment)與生成策略上的根本差異?

  1. AVAE透過顯式潛在變數建模實現跨模態對齊,適合捕捉整體語意結構但生成解析度有限;GAN透過對抗損失(Adversarial Loss)在不同模態間學習分佈映射,生成品質高但穩定性差;擴散模型則以條件化噪聲反推(Conditional Denoising)方式實現高保真跨模態生成,兼具穩定性與多樣性
  2. BVAE與Diffusion Model均屬隱式生成架構,主要依賴對抗式訓練實現跨模態對齊;GAN則以顯式後驗估計方式提升樣本一致性
  3. CVAE與GAN 均使用馬爾可夫鏈(Markov Chain)進行跨模態轉換;Diffusion Model 則透過 KL散度最小化學習語意對應。
  4. D三者在多模態應用中皆依賴同一潛在表徵空間(Shared Latent Space),僅在解碼器結構不同而已
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 選項 (A) 正確刻劃三者本質:VAE 以顯式潛在變數(Explicit Latent Variable)與變分推斷建模,潛在空間結構清晰,利於跨模態語意對齊,但生成影像偏模糊、解析度有限;GAN 以對抗損失(Adversarial Loss)隱式學習分佈之間的映射,樣本銳利、品質高,但訓練不穩定、易發生模式崩潰;擴散模型以條件化去噪(Conditional Denoising)逐步生成,訓練穩定且樣本多樣,是目前高保真跨模態生成的主流路線。 【為何其他選項錯了?】 - (B):VAE 與擴散模型皆不依賴對抗式訓練,對抗訓練是 GAN 的特徵;GAN 也沒有顯式後驗估計,敘述完全顛倒。 - (C):VAE 與 GAN 都不使用馬可夫鏈(Markov Chain),逐步馬可夫過程是擴散模型的特徵;KL 散度最小化屬 VAE 目標函數的成分,整句概念錯置。 - (D):三者的潛在空間設計與訓練目標本質不同,並非共用同一潛在表徵空間、僅解碼器結構相異。 提示:VAE 顯式潛變數、GAN 對抗映射、Diffusion 條件去噪,三條技術路線各有取捨。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第43題

某金融科技公司欲導入 AI模型協助客服郵件自動分類(投訴、詢問、表揚)。團隊同時考慮兩種模型設計:方案 A(生成式路徑):採用 VAE建構潛在語意空間,再結合下游分類器進行標籤預測;方案 B(鑑別式路徑):採用 BERT Classifier 直接根據輸入文本進行監督式分類。現有標註資料約 2,000 筆,資料分佈均勻但擴充成本高。若團隊希望公平比較兩種模型的資料利用效率與泛化能力,下列哪一種實驗設計最能突顯兩者的本質差異?

  1. A在完整資料集上分別訓練兩者,並比較其分類準確率(Accuracy)與推論時間
  2. B在低資源情境(Low-resource Setting)下,逐步減少標註比例(100%、50%、10%),比較其F1-score
  3. C使用GAN 自動生成文本樣本補足資料,觀察兩模型在資料增強後的精確率(Precision)差異
  4. D在相同訓練資料上固定輸入維度,僅調整模型參數量,比較其對過擬合的敏感度
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 生成式路徑(VAE 建構潛在語意空間)的理論優勢是利用資料的潛在結構,對標註量的依賴較低;鑑別式路徑(BERT Classifier)在標註充足時通常準確率較高,但標註減少時表現衰退較明顯。要突顯兩者在資料利用效率與泛化能力上的本質差異,應設計低資源梯度實驗:將標註比例由 100% 逐步降至 50%、10%,比較各階段的 F1-score 衰退曲線,即可清楚觀察何者在資料稀少時仍能維持表現。 【為何其他選項錯了?】 - (A):僅在完整資料集上比較準確率與推論時間,無法呈現標註量變化對兩種路徑的影響,回答不了資料利用效率的問題。 - (C):以 GAN 生成文本補足資料會引入「生成品質」這個混淆變數,實驗結果混雜了資料增強效果,無法歸因於兩種模型路徑的本質差異。 - (D):固定資料僅調整參數量,檢驗的是模型容量與過擬合的關係,與資料利用效率是不同議題。 提示:比較資料利用效率的標準做法,是逐步縮減標註比例並觀察指標衰退曲線。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第44題

某電信公司希望建立一個模型來預測顧客是否即將流失,並進一步模擬不同促銷或服務策略下顧客的行為變化,以生成多樣化的虛擬樣本資料進行A/B 測試與行銷策略評估。若要同時兼顧預測與資料生成的需求,最適合採用下列哪一種方法?

  1. A使用傳統隨機森林(Random Forest)
  2. B使用邏輯迴歸(Logistic Regression)模型
  3. C使用變分自編碼器(Variational Autoencoder, VAE)或生成對抗網路(Generative Adversarial Network, GAN)
  4. D使用強化學習代理(Reinforcement Learning Agent)
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 題目同時提出兩類需求:預測顧客是否流失(判別能力),以及模擬不同策略下的行為變化、生成多樣化虛擬樣本供 A/B 測試(生成能力)。VAE 與 GAN 皆為生成模型,能學習顧客行為資料的分佈並取樣產生逼真的合成資料;VAE 的潛在空間還可進行情境操控,調整潛在向量以模擬不同策略下的行為變化,搭配下游分類器亦可支援流失預測,是唯一能同時兼顧預測與資料生成的選項。 【為何其他選項錯了?】 - (A):隨機森林是判別式模型,適合流失預測,但不具備學習資料分佈並生成新樣本的能力,無法滿足模擬資料的需求。 - (B):邏輯迴歸同屬判別式模型,只能輸出流失機率,無法生成虛擬顧客行為資料。 - (D):強化學習代理處理的是序列決策優化,例如學習最佳促銷策略本身,並非用於行為資料的生成與流失預測。 提示:題幹同時要求「預測」與「生成資料」時,指向 VAE、GAN 等生成模型;判別式模型只能輸出預測結果。

相關節點