機器學習知識地圖 · 非監督式學習
分群/類聚/叢集(Clustering)
Clustering - 將資料分組
觀念教學
把一袋混在一起的樂高按形狀顏色自動歸堆 — 事先沒人告訴你有幾種、每種叫什麼。這就是分群。
核心觀念
分群(Clustering,又稱叢集、類聚)把相似的資料點歸為同一群組,原則一句話:群內相似度高、群間差異大。它是非監督式學習的招牌任務:資料沒有標籤,群組是演算法自己發現的,連每群的意義都要人事後解讀命名。
白話理解
零售會員五十萬人,沒有人先貼好「VIP/小資/流失風險」標籤。分群演算法依消費頻率、客單價、品類偏好自動歸出幾群,行銷再看各群輪廓命名、下差異化活動 — 客戶分群、市場區隔是考題最愛的標準情境。
常用演算法與驗收
- K-Means:先指定 K,快而簡單,適合球形群
- 階層式分群:長出樹狀圖再切一刀,不用預設 K
- DBSCAN/HDBSCAN:看密度,能抓任意形狀,順便標出離群點
- 評估看輪廓係數(群內緊、群間開,越接近 1 越好)、SSE、DBCV、共表型相關係數、群集穩定度與雜訊點比例
🎯 口訣:物以類聚 — 沒標籤自己歸堆,群內像、群間不像。
iPAS 考點
最典型考法:「叢集(Clustering)最典型的應用情境」→ 客戶/市場區隔、文件主題歸類;「哪類問題適合非監督式學習」→ 無標籤、要找隱藏群組的。反向題「何者不符合非監督式特徵」:選項出現已標記答案、預測明確目標值就不是。情境搭配題:「依購買行為把客戶自動分組」配非監督式分群;分群(無標籤)vs 分類(有標籤)一字之差,看資料有沒有標準答案欄位。
📝 本節掛載 4 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。
應用場景
評估指標
iPAS 歷屆考題詳解(4 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
下列哪一類問題最適合使用非監督式學習(Unsupervised Learning)來處理?
- A根據已標記的醫療影像訓練模型診斷疾病
- B根據使用者行為將用戶分群,以優化行銷策略
- C透過已知交通事故記錄預測未來事故發生機率
- D根據歷史股價預測未來股市的走勢
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
非監督式學習(Unsupervised Learning)處理沒有標籤的資料,由演算法自行發掘資料中的結構與模式,典型任務包括分群(Clustering)與降維。選項 (B) 的使用者行為資料通常沒有預先定義的類別標籤,以 K-means、DBSCAN 等分群演算法依行為相似性自動將用戶分組,再據以制定差異化行銷策略,正是非監督式學習的經典應用。
【為何其他選項錯了?】
- (A):「已標記的醫療影像」明確提供了標籤,以標籤訓練診斷模型屬於監督式學習的分類任務。
- (C):已知交通事故記錄提供了「發生與否」的結果標籤,據以預測未來事故機率是監督式學習的預測任務。
- (D):以歷史股價預測未來走勢屬於時間序列預測,以過去數值作為監督訊號訓練模型(如迴歸、LSTM),屬監督式學習範疇;非監督式方法無法直接輸出走勢預測。
提示:判斷關鍵在有無標籤:「已標記、預測目標明確」屬監督式;「無標籤、找結構、分群」屬非監督式。
在機器學習中,「叢集 (Clustering)」方法最典型的應用情境是下列何者?
- A根據歷史交易紀錄與已標註的詐欺案例,訓練模型來偵測未來的詐欺交易
- B使用醫療數據與病患的診斷標籤,建立模型以預測病人是否罹患特定疾病
- C根據顧客的消費行為與特徵,將顧客自動劃分為數個群組,以便進行差異化行銷
- D透過大量已標註影像,訓練深度學習模型來辨識照片中的物件種類
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
叢集(Clustering,亦譯分群)是非監督式學習的代表性方法:在沒有類別標籤的情況下,依樣本間的相似性自動將資料劃分為數個群組。選項 (C) 依顧客的消費行為與特徵自動劃分客群,再進行差異化行銷,資料無需事先標註、群組由演算法自行形成,正是叢集最典型的應用情境,實務上常以 K-means、DBSCAN 或階層式分群實作。
【為何其他選項錯了?】
- (A):已標註的詐欺案例提供了明確標籤,以此訓練模型偵測未來詐欺交易是監督式學習的分類任務,不是叢集。
- (B):使用病患的診斷標籤建立疾病預測模型,同樣是監督式分類;叢集不使用標籤,也無法直接輸出「是否罹病」的預測。
- (D):以大量已標註影像訓練深度學習模型辨識物件,是監督式學習的影像分類任務,依賴人工標註而非自動分組。
提示:選項中出現「已標註、標籤」即為監督式;「自動劃分群組、無標籤」才是叢集的應用場景。
下列何者不符合非監督式學習(Unsupervised Learning)的典型特徵?
- A模型可依據資料中的特徵相似性進行自動分群
- B訓練過程中不需仰賴事先定義的標籤資料
- C常用於探索資料的潛在結構或隱含模式
- D模型主要學習輸入特徵與既定目標標記之間的對應關係
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
非監督式學習(Unsupervised Learning)的定義特徵,是訓練過程沒有標準答案(標籤),演算法必須自行從資料中發掘規律或結構,典型應用是把相似的資料自動分為一群。選項 (D) 描述「學習輸入特徵與既定目標標記之間的對應關係」,存在明確的目標標籤,這正是監督式學習(Supervised Learning)的定義,與非監督式學習的特徵相反,故為本題答案。
【名詞白話語典】
- 非監督式學習(Unsupervised Learning):一種機器學習方法,訓練資料完全沒有經過人工標記,演算法的任務是自行從資料中發現隱藏的結構、模式或關係。
- 監督式學習(Supervised Learning):另一種方法,訓練資料都有明確的「答案」(標籤),演算法的任務是學習如何從輸入預測出正確的輸出。
【為何其他選項錯了?】
- (A):此為非監督式學習的典型特徵,依特徵相似性自動分群是其代表性應用,故非本題答案。
- (B):不需仰賴事先定義的標籤資料,正是非監督式學習的基本前提,故非本題答案。
- (C):探索資料的潛在結構或隱含模式,是非監督式學習的主要目的,故非本題答案。
提示:題目問「不符合」;敘述中出現「目標標記、對應關係」即為監督式學習的特徵。
某企業評估於不同業務場景導入機器學習技術。下列哪一項應用情境與機器學習 類型的搭配最為適當?
- A在醫療影像分析中,同時運用少量已標註資料與大量未標註影像進行模型訓練 —監督式學習(Supervised Learning)
- B在智慧推薦系統中,利用顧客是否點擊的歷史標籤資料預測未來偏好——非監督 式學習(Unsupervised Learning)
- C在詐欺交易分析中,模型透過錯誤判斷所產生的損失作為回饋訊號,持續調整 策略—監督式學習(Supervised Learning)
- D在股價資料分析中,將歷史價格變動模式劃分為若干趨勢型態,且未使用人工 標註——非監督式學習(Unsupervised Learning)
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
選項 (D) 將歷史股價變動模式劃分為若干趨勢型態,且未使用人工標註:演算法自行從數據中歸納出「上升、盤整、下跌」等型態,不需要事先標記每一段走勢屬於哪一類,這正是非監督式學習(特別是分群演算法)的典型應用,情境與學習類型的搭配正確。
【為何其他選項錯了?】
- (A):「少量已標註資料搭配大量未標註資料」的組合對應的是半監督式學習(Semi-supervised Learning),而非單純的監督式學習,搭配錯誤。
- (B):「顧客是否點擊」本身就是明確的標籤(點擊 = 1、未點擊 = 0),利用歷史標籤資料預測未來偏好是典型的監督式學習,選項卻標示為非監督式,搭配錯誤。
- (C):以「錯誤判斷所產生的損失」作為回饋訊號持續調整策略,是強化學習(Reinforcement Learning)的運作模式,選項卻標示為監督式學習,搭配錯誤。
提示:半監督=少量標註加大量未標註;有標籤做預測=監督式;回饋訊號調整策略=強化學習;無標註找型態=非監督式。