機器學習知識地圖 · 非監督式學習
降維
前處理/表徵學習
觀念教學
一百個欄位裡一堆重複資訊,模型跑得慢、人也看不懂 — 降維幫資料瘦身:留住重點,丟掉冗餘。
核心觀念
降維(Dimensionality Reduction)把高維度資料轉換為低維度表示,同時盡量保留重要資訊。定位要抓準:降維多半是前處理/表徵學習方法,常搭配監督式、非監督式或強化學習使用,不是直接拿來預測的模型。這裡的 PCA、t-SNE、UMAP 屬非監督式降維(不需標籤);監督式降維如 LDA(靠標籤、為分類服務)歸在監督式學習區。
白話理解
高維資料有維度災難(Curse of Dimensionality):欄位一多,樣本彼此都顯得很遠,模型難學、計算爆炸。健保醫療資料上千個欄位,先降到幾十維再建模 — 訓練快、雜訊少,還能壓成 2D 圖給醫師看。
兩種用途、兩套驗收
- 壓縮與前處理:看解釋變異比例(留下多少資訊)與重建誤差(還原得多好)
- 視覺化:看 Trustworthiness 與 Continuity(鄰居關係守不守得住)、kNN 保留率、距離相關性、群組分離穩定性
- 路線選擇:線性用 PCA;非線性視覺化用 t-SNE 或 UMAP
- 代價:新的維度不再是原始欄位,可解釋性會下降
🎯 口訣:降維是前菜不是主菜 — 瘦身給模型吃,順便畫圖給人看。
iPAS 考點
分類題:「PCA/t-SNE/UMAP 屬哪類」→ 非監督式,不需標籤;對照組 LDA 是監督式降維,最愛考這組對比。陷阱選項:「降維是一種預測模型」— 錯,它是前處理/表徵學習。判斷關鍵字:減少特徵維度、保留主要資訊、高維資料視覺化。
應用場景
評估指標
iPAS 歷屆考題詳解(2 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
進行影像分類任務時,研究團隊嘗試利用主成分分析(Principal Component Analysis, PCA)將輸入特徵從 1024維降至100維,並將降維後的資料輸入支持向量機(Support Vector Machine, SVM)模型進行訓練。關於此作法,下列哪一項描述最為合理?
- APCA保留的主成分必然能提升 SVM 的分類準確率
- B使用原始高維資料通常更能保留資訊,因此 PCA沒有實際意義
- CPCA可讓 SVM自動適用於非線性(Nonlinear)資料集
- D降維後可降低訓練時間並減少過擬合(Overfitting)風險
看正解與逐選項詳解
正解:D
某工程師在建立推薦系統時,評估使用奇異值分解(Singular Value Decomposition, SVD)對使用者-商品評分矩陣進行潛在語意分析(Latent Semantic Analysis, LSA)。關於SVD的數學性質,下列何者不正確?
- ASVD只能分解方陣(Square Matrix),無法應用於行列數不相等的長方形矩陣
- BSVD常用於降維(Dimensionality Reduction),透過保留最大的 k個奇異值來近似原始矩陣(截斷 SVD)
- CSVD比PCA更一般化,因為PCA可視為對資料的共變異數矩陣(Covariance Matrix)進行的特殊 SVD運算
- DLSA 是 SVD 在文字-文件矩陣上的應用,透過截斷 SVD 捕捉詞語與文件的潛在語意關係
看正解與逐選項詳解
正解:A