深度學習知識地圖 · 生成式 AI

VAE

自編碼器

在互動地圖中開啟 回深度學習知識地圖

觀念教學

自編碼器(Autoencoder)做一件看似無聊的事:把輸入壓縮,再想辦法還原回來。但正是「壓縮」逼它抓住資料精華,一整排實用功能從這裡長出來。

核心觀念

編碼器(Encoder)把輸入壓成低維的潛在向量(Latent Vector),解碼器(Decoder)再從向量重建輸入,訓練目標是讓重建誤差(Reconstruction Error)越小越好。VAE(Variational Autoencoder,變分自編碼器)更進一步:編碼器輸出的不是單一固定向量,而是一組機率分佈(平均值與變異數),先從分佈取樣、再交給解碼器重建。損失因此多了 KL 散度這一項,把潛在空間整理成連續、平滑的分佈 — 這樣才能「取樣」生成全新樣本。

白話理解

像把整張圖濃縮成一張小抄,再憑小抄重畫。台灣製造業的經典用法:只拿設備「正常運轉」的感測資料(溫度、震動、壓力)訓練自編碼器;模型只會重建正常型態,一遇到異常狀態,重建誤差立刻飆高,系統就發出預警 — 全程不需要異常標註。

用途與限制

  • 異常偵測:重建誤差大=異常;最適合異常事件極少、樣本高度不平衡、缺乏完整標註的情境,如設備預測性維護(Predictive Maintenance)
  • 降維與特徵學習:潛在向量就是有意義的濃縮特徵
  • 資料去噪:輸入帶雜訊的資料,輸出乾淨版本
  • 圖像生成(VAE):從潛在分佈取樣生成新圖,多樣性佳
  • 弱點:生成影像比 GAN 模糊;訓練要平衡「重建品質」與「分佈正則化」兩股拉力
🎯 口訣:壓縮再重建;重建誤差一飆高,就是抓到鬼。

iPAS 考點

兩大高頻考向。一、VAE 流程題:正確敘述是「編碼成機率分佈 → 取樣 → 解碼重建,以重建誤差加 KL 散度為訓練目標」;陷阱選項會寫成「編碼成單一固定向量」,那是普通自編碼器。二、情境選型題:看到感測器時間序列、異常事件極少、樣本不平衡、缺乏異常標註、要辨識偏離正常型態,就選自編碼器;設計公司「依既有圖像生成風格一致的新圖」則指向 VAE 這類生成模型。反向陷阱:有標註的影像瑕疵分類、客服對話情緒判斷,是監督式模型的地盤,別選自編碼器。

📝 本節掛載 5 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

應用場景

降維/特徵學習異常檢測圖像生成 (VAE)

評估指標

重建誤差KL 散度

iPAS 歷屆考題詳解(6 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第22題

關於變分自編碼器(Variational Autoencoder, VAE)的運作流程,下列何者敘述最為正確?

  1. A解碼器的任務是將低維壓縮向量分類為不同類別
  2. B編碼器將輸入資料轉換為可視化圖像以利模型學習
  3. C編碼器將資料轉換為潛在空間表示,解碼器再重建資料
  4. D編碼器利用最大邊際機率對資料進行異常點偵測
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 變分自編碼器(VAE)的標準流程分為兩段:編碼器(Encoder)將輸入資料映射到潛在空間(Latent Space),輸出潛在分佈的均值與變異數,再由此分佈抽樣得到潛在向量;解碼器(Decoder)接著把潛在向量還原為與原輸入相近的資料,即重建(Reconstruction)。「編碼器壓縮至潛在空間表示、解碼器重建資料」正是選項 (C) 的敘述;變分機率設計使潛在空間連續平滑,VAE 因此能進一步作為生成模型使用。 【為何其他選項錯了?】 - (A):解碼器的任務是由潛在向量重建資料,不是對壓縮向量進行類別判斷;分類是判別式模型的工作。 - (B):編碼器輸出的是潛在空間中的分佈參數,並非可視化圖像;「轉換為圖像以利學習」不是 VAE 的機制。 - (D):最大邊際(Margin)概念屬於 SVM;VAE 的編碼器採用變分推斷估計潛在分佈。VAE 雖可透過重建誤差延伸應用於異常偵測,但那並非編碼器的運作原理。 提示:VAE 流程記兩段:編碼器壓縮至潛在分佈並抽樣,解碼器重建資料。
第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第33題

在工業物聯網架構中,進行設備預測性維護(Predictive Maintenance)時,若面對異常事件發生頻率極低、樣本高度不平衡的時間序列資料,下列哪一種方法最能兼顧模型穩定性與異常偵測效能?

  1. A將每筆異常事件資料複製多次以提升模型對異常的辨識敏感度,搭配全序列訓練模型(如 LSTM)
  2. B對時間序列進行差分與標準化後,使用傳統監督式學習模型(如 SVM)進行分類訓練
  3. C使用經過時間序列特化的 SMOTE 技術生成異常樣本,以平衡異常與正常資料比例
  4. D採用基於重建誤差的自編碼器模型(Sequence to Sequence Autoencoder)進行異常偵測,並僅使用正常資料進行訓練
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 題幹條件是異常事件發生頻率極低、樣本高度不平衡的時間序列。此時最穩健的做法是不依賴異常標註,改用僅以正常資料訓練的 Sequence-to-Sequence Autoencoder:模型學會重建正常運作模式,推論時若輸入偏離正常型態,重建誤差會顯著升高,即可據此偵測異常並發出預警。由於訓練完全不使用稀少的異常樣本,避免了對少數樣本過擬合的風險,兼顧模型穩定性與偵測效能,是工業預測性維護的常用架構。 【為何其他選項錯了?】 - (A):直接複製異常樣本屬過取樣,重複樣本會使 LSTM 過擬合特定異常型態,對未見過的新異常泛化能力差,穩定性反而下降。 - (B):SVM 等傳統監督式模型不擅長建模時間序列的順序依賴,且在高度不平衡資料下容易偏向多數類,將稀少異常視為雜訊而忽略。 - (C):SMOTE 以內插方式合成少數類樣本,但異常極稀少且具複雜時間依賴時,合成樣本難以正確反映真實異常結構,模型可能學到失真的模式。 提示:異常標註稀少的時間序列偵測,首選只以正常資料訓練、以重建誤差判定異常的自編碼器方法。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第10題

某設計公司導入生成式 AI (Generative AI)工具,用於自動產生產品概念圖與風 格草圖。為了讓系統能依據既有圖像資料產生具有變化且風格一致的新圖像,模 型必須具備學習資料特性並生成新樣本的能力。下列哪一種模型技術或方法最符 合上述需求?

  1. A隱變量自編碼器(Variational Autoencoder, VAE)
  2. B隨機森林(Random Forest)
  3. CK-近鄰演算法(K-Nearest Neighbors, KNN)
  4. D貝氏網路(Bayesian Network)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 題目的核心需求是「學習資料特性」並「生成新樣本」,屬於生成式模型的任務。VAE(Variational Autoencoder)是經典的生成模型:編碼器把輸入圖像壓縮為潛在空間中的分佈(學習資料特性),再從潛在空間抽樣並由解碼器還原,生成與訓練資料風格一致但內容有所變化的新圖像。潛在空間的連續性使取樣結果能呈現自然的風格變化,符合「具有變化且風格一致」的設計需求。 【名詞白話語典】 - 生成式 AI(Generative AI):能創造全新原創內容的 AI,例如產生圖像、文字或音樂。 - VAE(Variational Autoencoder):一種生成模型,透過編碼與解碼的過程學習資料分佈,並可從潛在空間取樣生成新資料。 【為何其他選項錯了?】 - (B):隨機森林是鑑別式模型,用於分類或迴歸,例如判斷圖像的類別,不具生成圖像的能力。 - (C):KNN 依鄰近樣本做分類或迴歸,本質是既有資料的比對,無法生成新樣本。 - (D):貝氏網路是機率圖模型,用於變數間依賴關係的推理與決策,並非圖像生成技術。 提示:「學習資料特性並生成新樣本」是生成模型的定義;選項中僅 VAE 屬生成式架構。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第22題

某製造業工廠規劃導入 AI 監控系統,持續分析設備感測數據(如溫度、震動與壓 力)。系統需能在缺乏完整異常標註資料的情況下,辨識與一般運作型態顯著不同 的狀態,並發出預警。在此需求下,下列何種技術較為適合?

  1. A使用支援向量機(Support Vector Machine, SVM) 建立異常分類模型
  2. B以決策樹(Decision Tree)學習異常類型的判斷規貝
  3. C採用變分自編碼器(Variational Autoencoder, VAE)學習正常資料分佈
  4. D使用生成對抗網路(Generative Adversarial Network, GAN)直接預測異常標籤
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 題幹的關鍵條件是「缺乏完整異常標註資料」,且要辨識「與一般運作型態顯著不同的狀態」,屬於無監督的異常偵測(Anomaly Detection)問題。VAE 適合此情境:僅以正常的感測數據訓練,模型學會重建正常型態的資料分佈;推論時若輸入為異常狀態,模型難以準確重建,重建誤差明顯升高,設定閾值即可在誤差超標時發出預警。整個流程不需要異常標註,完全符合題目條件。 【為何其他選項錯了?】 - (A):以 SVM 建立異常分類模型屬監督式做法,需要正常與異常兩類標註資料,不符「缺乏異常標註」的前提。 - (B):決策樹學習異常類型的判斷規則同樣仰賴標註樣本,異常標註不足時無從訓練。 - (D):GAN 雖有 AnoGAN 等異常偵測變體,但其邏輯仍是學習正常分佈再比對差異;「直接預測異常標籤」需要監督式訓練,與題幹條件矛盾。 提示:「缺標註、找偏離正常的狀態」即無監督異常偵測,以重建誤差為警報的自編碼器類方法最典型。
115年第二次初級AI應用規劃師第一科人工智慧基礎概論 第27題

某製造業評估在不同場景導入AI,包含: (甲)依據設備感測器數值判斷是否出現異常; (乙)依據客服對話內容判斷客戶情緒; (丙)依據產品影像輪廓直接進行瑕疵分類。 下列哪一種情境最適合以自編碼器(Autoencoder)作為主要模型架構?

  1. A甲;
  2. B乙;
  3. C丙;
  4. D甲與丙
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 自編碼器的典型應用是異常偵測:以正常運作的資料訓練模型學習壓縮與重建,推論時重建誤差顯著偏高的輸入即可能為異常。情境甲依設備感測器數值判斷是否異常,實務上常缺乏充足的異常標註,以重建誤差為指標的自編碼器正是主流做法,故甲最適合以自編碼器作為主要模型架構。 【為何其他選項錯了?】 - (B):客服對話的情緒判斷屬自然語言分類任務,主流做法是監督式文字分類模型,自編碼器並非典型的主要架構。 - (C):產品影像的瑕疵分類是監督式影像分類任務,常以 CNN 等模型直接學習類別邊界;題目指明「直接進行瑕疵分類」,自編碼器不是主要架構。 - (D):甲適合,但丙屬直接分類任務,不宜與甲並列為自編碼器的典型場景,故「甲與丙」不正確。 提示:自編碼器的代表性用法是學習正常模式、以重建誤差偵測異常;有明確標籤的分類任務交給監督式模型。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第42題

若部署一個深度學習模型至金融風控系統,該模型採用鑑別式架構(如Transformer Classifier)。然而上線後,模型對新樣本的分類錯誤率顯著上升,經檢查發現,輸入資料分佈已與原訓練集明顯不同。針對此情形,下列哪一種應對策略最為適合?

  1. A改用生成對抗網路(GAN)生成新樣本並混入訓練集
  2. B改用邏輯迴歸模型(Logistic Regression)以提升穩定性
  3. C增加模型容量(Model Capacity),以學習更多樣本差異
  4. D使用變分自編碼器(VAE)監控潛在空間分佈,偵測輸入資料偏移
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 題目情境是輸入資料分佈已與訓練集明顯不同,即資料偏移(Data Drift),當務之急是建立偵測機制。變分自編碼器(VAE)可在訓練資料上學習輸入的潛在分佈;上線後持續將新樣本編碼,監控其潛在空間分佈與重建誤差,一旦輸入偏離訓練分佈,潛在表徵與重建誤差會出現明顯異常,即可及時偵測偏移、觸發告警與重訓流程。這是針對「發現並確認分佈偏移」最合適的策略。 【為何其他選項錯了?】 - (A):GAN 生成的樣本仍源自模型已學到的舊分佈,無法保證貼近新的真實分佈,以生成資料混入訓練集並不能解決分佈偏移問題。 - (B):換用邏輯迴歸只是簡化模型;輸入分佈改變時,簡單模型同樣失準,穩定性不會因此提升。 - (C):增加模型容量處理的是模型學習能力不足的問題;目前的問題是資料分佈改變,容量再大也無法涵蓋訓練時未出現的新分佈。 提示:面對分佈偏移,第一步是建立偵測機制;VAE 的重建誤差與潛在分佈是常用的漂移監控指標。

相關節點