深度學習知識地圖 · 生成式 AI
生成式 AI
VAE, GAN, Diffusion
觀念教學
傳統 AI 負責「分析」:這張圖是貓還是狗?生成式 AI(Generative AI)負責「創造」:幫我畫一隻穿太空裝的貓。它學會資料的分佈規律,再從中取樣,生成全新的內容。
核心觀念
生成式模型學的不是分類邊界,而是資料分佈(Data Distribution);學會之後從分佈中取樣(Sampling),就能產生從未見過的圖像、文字、音樂、影片與 3D 模型。對照組是鑑別式 AI(Discriminative AI):只判斷輸入屬於哪一類,不會無中生有。
白話理解
音樂串流平台想讓 AI 依既有歌曲,自動生成風格多變的新旋律 — 重點是系統不能只是播放或拼接既有片段,也不能僅做資料重建,而是學會「歌的分佈」之後創作新歌。同一套邏輯撐起 AI 繪圖(Midjourney)、文字生成(ChatGPT)、影片生成(Sora)與音樂生成。
三大技術演進與評估
- VAE(2013):壓縮再重建,以重建誤差加 KL 散度(合稱 ELBO)為訓練目標;能生成,但影像較模糊
- GAN(2014):生成器與判別器對抗訓練,影像銳利,但訓練不穩定
- Diffusion(2020):逐步去噪,品質最高、最穩定,目前主流
- 影像品質評估:FID 量生成與真實影像的特徵分佈距離,越低越好;IS 同時看品質與多樣性,越高越好
- 進階評估:LPIPS 量人眼感知的相似度;文生圖用 CLIP Score 檢查圖文對齊程度
🎯 口訣:鑑別式畫界線,生成式學分佈再取樣。
iPAS 考點
兩個真實考向。一、情境題強調「不能只是拼接既有內容、也不能僅進行資料重建,要生成具風格變化的新內容」→ 答生成式 AI,判斷關鍵字是學習資料分佈、生成新樣本。二、生成式與鑑別式的合作:以生成式 AI 模擬新型攻擊流量、納入防禦模型訓練,主要助益是擴充訓練資料的多樣性,提升鑑別式模型對未知變種攻擊的泛化能力,不是取代鑑別式模型。
📝 本節掛載 2 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。
應用場景
評估指標
iPAS 歷屆考題詳解(5 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某音樂串流平台希望開發一套AI 系統,能根據平台上累積的大量歌曲資料,自動生成具有不同風格變化的全新旋律,供創作者作為靈感參考。平台技術長在評估方案時強調,系統不能只是播放或拼接既有歌曲片段,也不能僅進行資料的重建,而是要真正學習音樂的結構與風格,並創作出從未出現過的新旋律。 請問下列哪一種模型技術最符合此需求?
- AK-近鄰演算法(K-Nearest Neighbors, KNN);
- B自編碼器(Autoencoder);
- C生成對抗網路(GAN);
- D隨機森林(Random Forest)
看正解與逐選項詳解
正解:C
某資安公司目前以鑑別式AI 偵測已知網路攻擊。為因應新型變種攻擊,研究人員計劃利用生成式AI 模擬可能的攻擊流量,並納入防禦模型訓練。下列何者最能說明此做法對鑑別式AI 防禦模型的主要助益?
- A生成式AI 可取代真實攻擊資料,降低蒐集成本;
- B生成式AI 可直接負責防禦決策,取代原有模型;
- C模擬攻擊資料可使模型自動轉為生成式架構;
- D將模擬攻擊納入訓練,可提升模型對未知攻擊的辨識能力
看正解與逐選項詳解
正解:D
下列哪一項最正確地描述了 VAE(Variational Autoencoder)、GAN(Generative Adversarial Network)與擴散模型(Diffusion Model)在多模態潛在空間對齊(Latent Alignment)與生成策略上的根本差異?
- AVAE透過顯式潛在變數建模實現跨模態對齊,適合捕捉整體語意結構但生成解析度有限;GAN透過對抗損失(Adversarial Loss)在不同模態間學習分佈映射,生成品質高但穩定性差;擴散模型則以條件化噪聲反推(Conditional Denoising)方式實現高保真跨模態生成,兼具穩定性與多樣性
- BVAE與Diffusion Model均屬隱式生成架構,主要依賴對抗式訓練實現跨模態對齊;GAN則以顯式後驗估計方式提升樣本一致性
- CVAE與GAN 均使用馬爾可夫鏈(Markov Chain)進行跨模態轉換;Diffusion Model 則透過 KL散度最小化學習語意對應。
- D三者在多模態應用中皆依賴同一潛在表徵空間(Shared Latent Space),僅在解碼器結構不同而已
看正解與逐選項詳解
正解:A
某金融科技公司欲導入 AI模型協助客服郵件自動分類(投訴、詢問、表揚)。團隊同時考慮兩種模型設計:方案 A(生成式路徑):採用 VAE建構潛在語意空間,再結合下游分類器進行標籤預測;方案 B(鑑別式路徑):採用 BERT Classifier 直接根據輸入文本進行監督式分類。現有標註資料約 2,000 筆,資料分佈均勻但擴充成本高。若團隊希望公平比較兩種模型的資料利用效率與泛化能力,下列哪一種實驗設計最能突顯兩者的本質差異?
- A在完整資料集上分別訓練兩者,並比較其分類準確率(Accuracy)與推論時間
- B在低資源情境(Low-resource Setting)下,逐步減少標註比例(100%、50%、10%),比較其F1-score
- C使用GAN 自動生成文本樣本補足資料,觀察兩模型在資料增強後的精確率(Precision)差異
- D在相同訓練資料上固定輸入維度,僅調整模型參數量,比較其對過擬合的敏感度
看正解與逐選項詳解
正解:B
某電信公司希望建立一個模型來預測顧客是否即將流失,並進一步模擬不同促銷或服務策略下顧客的行為變化,以生成多樣化的虛擬樣本資料進行A/B 測試與行銷策略評估。若要同時兼顧預測與資料生成的需求,最適合採用下列哪一種方法?
- A使用傳統隨機森林(Random Forest)
- B使用邏輯迴歸(Logistic Regression)模型
- C使用變分自編碼器(Variational Autoencoder, VAE)或生成對抗網路(Generative Adversarial Network, GAN)
- D使用強化學習代理(Reinforcement Learning Agent)
看正解與逐選項詳解
正解:C