機器學習知識地圖 · 非監督式學習

非監督式學習

Unsupervised Learning

在互動地圖中開啟 回機器學習知識地圖

觀念教學

沒有人給答案,模型自己在資料裡找規律 — 非監督式學習,機器學習家族裡「無師自通」的那一支。

核心觀念

非監督式學習(Unsupervised Learning)使用沒有標籤的資料,演算法自行找出隱藏的結構、模式或群組。主要分兩大類:分群(Clustering)把相似樣本歸堆,降維(Dimensionality Reduction)把高維資料壓成低維表示。異常檢測(Anomaly Detection)也常掛在這面大旗下:先學會「正常長什麼樣」,偏離常態的就是異常。

白話理解

電商平台要抓異常評論(機器人洗版、大量重複貼文)。這類異常樣本難以事先完整標記,系統改從大量正常評論的分布學出常態,再把「偏離分布」的行為挑出來 — 不靠標籤、靠分布,正是非監督式思維。

怎麼評估(沒標籤也要驗收)

  • 分群看輪廓係數SSEDBCV群集穩定度雜訊點比例;階層式另有共表型相關係數
  • 降維看解釋變異比例重建誤差;視覺化類再看 TrustworthinessContinuitykNN 保留率距離相關性群組分離穩定性
  • 共通精神:沒有標準答案,就檢查「結構合不合理、結果穩不穩定」
🎯 口訣:無標籤找結構 — 分群歸堆、降維瘦身、異常抓偏離。

iPAS 考點

兩類必考。分類題:「客戶分群、主題探索、異常偵測」選非監督式;情境題:給「異常樣本難以事先標記、依正常資料分布識別偏離行為」,答非監督式(異常檢測)框架。異常檢測的主要應用目標:找出偏離正常模式的少數樣本(設備故障、詐欺、異常評論)。陷阱:看到「資料量大」就選非監督 — 錯,關鍵是有沒有標籤;「少量標籤+大量無標籤」是半監督,「靠獎勵試錯」是強化學習。

📝 本節掛載 2 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

應用場景

客戶分群影像壓縮市場區隔基因分析社群網路分析文件分類生物分類學異常檢測地理資料分群影像分割資料視覺化特徵提取雜訊過濾人臉辨識高維資料視覺化群組結構探索單細胞分析文字嵌入視覺化大規模資料視覺化單細胞 RNA 分析影像特徵視覺化推薦系統

評估指標

輪廓係數SSE共表型相關係數DBCV群集穩定度雜訊點比例解釋變異比例重建誤差TrustworthinessContinuitykNN 保留率距離相關性群組分離穩定性

iPAS 歷屆考題詳解(3 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

115年第二次初級AI應用規劃師第一科人工智慧基礎概論 第16題

某企業集團在多個領域導入AI 技術,應用於不同業務場景。請問下列哪一項最符合異常檢測(Anomaly Detection)的主要應用目標?

  1. A分析客戶的消費行為資料,將客群依偏好進行分群,以制定差異化行銷策略;
  2. B根據歷史交易與客戶資料,建立模型預測未來可能發生違約的客戶;
  3. C彙整企業各部門的營運數據,建立儀表板供管理層追蹤關鍵績效指標 (KPI)的變化;
  4. D從設備感測資料中,即時偵測出與正常運作模式顯著偏離的訊號,以預警可能發生的故障
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 異常檢測(Anomaly Detection)的目標,是在大量正常行為中找出與正常模式顯著偏離的樣本。選項 (D) 從設備感測資料中即時偵測偏離正常運作模式的訊號並預警故障,正是異常檢測在預測性維護場景的典型應用:以正常運轉資料建立基準模式,再監控新訊號與基準的偏離程度。 【為何其他選項錯了?】 - (A):依消費偏好將客群分組屬於分群(Clustering)應用,目的是找出群體結構,不是偵測偏離正常模式的個體。 - (B):以歷史交易與客戶資料預測違約,是監督式學習的風險預測任務,依賴已標註的違約標籤,與異常檢測的目標不同。 - (C):彙整營運數據建立 KPI 儀表板屬於資料視覺化與監控報表範疇,不涉及自動辨識異常模式的模型。 提示:題幹出現「偵測與正常模式顯著偏離」即對應異常檢測;分群找結構、監督式做預測、儀表板做監控。
115年第二次初級AI應用規劃師第一科人工智慧基礎概論 第38題

某電商平台希望偵測異常評論行為,例如大量重複貼文或疑似機器人生成的評論。由於此類異常樣本難以事先完整標記,系統主要依據大量正常評論的分布來識別偏離行為。下列哪一種機器學習框架最能滿足此系統的設計需求?

  1. A非監督式學習(Unsupervised Learning)的關聯規則挖掘,從評論中找出常見字詞組合;
  2. B監督式學習(Supervised Learning)的二元分類,從已標記資料學習分類模型;
  3. C半監督式學習(Semi-supervised Learning)的異常偵測,辨識偏離正常分布的評論行為;
  4. D強化學習(Reinforcement Learning),透過回饋機制優化評論判斷策略
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 題幹的關鍵條件有二:異常樣本難以事先完整標記、系統主要依據大量正常評論的分布來識別偏離行為。這正是半監督式異常偵測的設定:以大量正常(或僅少量標註)資料建立正常行為模式,再將顯著偏離此分布的評論判定為異常。選項 (C) 完整對應此需求。 【為何其他選項錯了?】 - (A):關聯規則挖掘用於找出項目間的共現關係(如常見字詞組合),目的在發掘頻繁模式,不是辨識偏離正常分布的行為。 - (B):監督式二元分類需要足量的正常與異常兩類標註資料;題幹已說明異常樣本難以完整標記,前提不成立。 - (D):強化學習適用於序列決策與回饋優化情境,需要環境互動與獎勵訊號,與依據資料分布偵測異常評論的需求不符。 提示:「大量正常資料、異常標籤不足」是異常偵測的典型設定;有完整雙類標籤才考慮監督式分類。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第29題

某工廠設備監測系統需偵測馬達軸承的異常振動,但過去僅記錄了大量正常運作的振動時序資料,缺乏任何已確認故障的標註樣本。請問下列何種任務範疇最符合此情境下的異常偵測需求?

  1. A監督式二元分類(Supervised Binary Classification)
  2. B非監督或半監督異常偵測(Unsupervised / Semi-supervised Anomaly Detection)
  3. C強化學習(Reinforcement Learning)
  4. D自監督學習(Self-supervised Learning)
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 題幹條件是只有大量正常運作的振動時序資料,沒有任何已確認故障的標註樣本,因此無法訓練需要兩類標籤的監督式分類器。正確的任務範疇是異常偵測:以正常資料學習「正常模式的樣貌」,例如 One-Class SVM、Isolation Forest,或以 AutoEncoder 重建誤差判定,偏離正常分布者即視為異常。僅以正常樣本訓練屬於半監督式異常偵測,完全不使用標籤則屬非監督式,選項 (B) 涵蓋此情境的完整路線。 【為何其他選項錯了?】 - (A):監督式二元分類需要正常與故障兩類標註資料;題幹明言缺乏故障標註樣本,無法建立此類模型。 - (C):強化學習需要代理人與環境互動並取得獎勵訊號,與離線振動資料的異常偵測情境不符。 - (D):自監督學習是從無標籤資料自行建構前置任務(Pretext Task)以學習表徵,可作為特徵學習的前置技巧,但並非此需求對應的任務範疇本身。 提示:只有正常資料時走異常偵測(One-Class 思路);監督式分類必須先備齊兩類標籤。

相關節點