機器學習知識地圖 · 非監督式學習
DBSCAN / HDBSCAN
密度分群,可找異常點
觀念教學
不數群數、不管形狀,哪裡密哪裡就是一群;落單的直接標成異常 — 這就是密度分群。
核心觀念
DBSCAN 是基於密度(Density-based)的分群演算法:不需要事先指定群數,密度夠高的區域自然連成一群,還能自動識別雜訊點(離群值)。兩個關鍵參數:eps(鄰域半徑)與 minPts(最少點數) — 半徑內鄰居夠多才算密。HDBSCAN 是改進版本,可處理不同密度的群組。
白話理解
在廣場人群中找「一群一群聚在一起的人」:站得密的就是一群,落單站在旁邊的就是雜訊(異常值)。信用卡詐欺偵測正是這樣用:正常消費密集成群,詐欺交易孤零零地飄在群外。
優缺點與應用
- 應用:異常檢測(信用卡詐欺)、地理資料分群(熱點分析)、不規則形狀的群組
- 優點:不用指定 K、能找任意形狀的群組、自動標記離群值
- 缺點:對 eps 與 minPts 兩個參數敏感,調不好整組走樣
- 缺點:不同密度的群組處理不好(HDBSCAN 改善了這點)
- 驗收:DBCV(密度分群專用指標)、群集穩定度、雜訊點比例
🎯 口訣:人多就成群,落單即雜訊 — 不用數 K、形狀隨意,就怕參數調不好。
iPAS 考點
判斷關鍵字:密度、任意形狀、自動找離群值、不需預設群數。經典比較:K-Means(要 K、圓形、怕離群值)vs DBSCAN(不用 K、任意形狀、離群值直接標出來)。情境題:「分群順便抓異常點」→ DBSCAN;「各群密度差很大」→ HDBSCAN。
應用場景
評估指標
iPAS 歷屆考題詳解(5 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
企業資料分析團隊使用 DBSCAN(Density-Based Spatial Clustering of Applications with Noise)演算法進行顧客行為分群,並希望模型能自動區分主要群集與雜訊資料。在此演算法中,決定聚類結果的兩個主要超參數為下列何者?
- A特徵數與學習率
- BK 值與距離閾值
- C鄰域半徑(Epsilon ε)與最小點數(MinPts)
- D交叉熵(Cross Entropy)與權重初始化
看正解與逐選項詳解
正解:C
某數據工程師使用 DBSCAN演算法對一份數百萬筆的高維顧客資料進行聚類分析,但發現程式執行速度極慢,甚至出現記憶體不足的情況。若要在不改變演算法核心邏輯的前提下,最有效提升其運算效率的作法為何?
- A改用以平均連結(Average Linkage)為基礎的階層式群集法(Hierarchical Clustering)
- B採用高效率的距離索引結構(Distance Index Structure),例如KD-Tree 或 Ball Tree
- C將 ε(Epsilon)參數調得極小,以減少鄰近點的數量
- D在資料前處理時增加標準化後的特徵維度數
看正解與逐選項詳解
正解:B
若在高維度(>500 維)的資料上應用DBSCAN(Density-Based Spatial Clustering of Applications with Noise)演算法,卻發現所有資料點皆被判定為雜訊(Noise),下列何者為最有可能的原因?
- A高維下距離變化趨同,導致 ε(Epsilon)閾值選擇失效
- B使用錯誤的距離函數(Distance Function)
- CMinPts參數設得太小
- D資料過度標準化導致特徵消失
看正解與逐選項詳解
正解:A
在執行 DBSCAN(Density-Based Spatial Clustering of Applications with Noise)群集分析時,若某資料點鄰域內的樣本數不足以形成核心點(Core Point),且該點未被任何核心點的鄰域所包含,也未與其他群集形成密度可達關係(Density Reachability),此資料點最終將被歸類為哪一種類型?
- A鄰近點(Neighbor Point)
- B雜訊點(Noise Point)
- C邊界點(Border Point)
- D潛在點(Potential Point)
看正解與逐選項詳解
正解:B
某資料工程師嘗試對包含 300 個特徵的使用者行為資料集使用 DBSCAN 進行群集分析,但發現幾乎所有資料點都被判定為雜訊點(Noise Points),難以形成有意義的群集,即使不斷調整ε(Epsilon)與 MinPts 參數也無濟於事。請問下列何者為此問題最可能的根本原因?
- A在高維空間中,維度詛咒(Curse of Dimensionality)使得資料點之間的距離趨於相近,導致 DBSCAN的密度估計失效
- BDBSCAN 演算法僅適用於低維資料,無法處理高維資料
- C300個特徵的資料必然不具備群集結構,因此無法進行有效的分群
- D高維空間中核心點的數量會受到數學限制,導致無法形成群集
看正解與逐選項詳解
正解:A