機器學習知識地圖 · 非監督式學習

DBSCAN / HDBSCAN

密度分群,可找異常點

在互動地圖中開啟 回機器學習知識地圖

觀念教學

不數群數、不管形狀,哪裡密哪裡就是一群;落單的直接標成異常 — 這就是密度分群。

核心觀念

DBSCAN基於密度(Density-based)的分群演算法:不需要事先指定群數,密度夠高的區域自然連成一群,還能自動識別雜訊點(離群值)。兩個關鍵參數:eps(鄰域半徑)minPts(最少點數) — 半徑內鄰居夠多才算密。HDBSCAN 是改進版本,可處理不同密度的群組

白話理解

在廣場人群中找「一群一群聚在一起的人」:站得密的就是一群,落單站在旁邊的就是雜訊(異常值)。信用卡詐欺偵測正是這樣用:正常消費密集成群,詐欺交易孤零零地飄在群外。

優缺點與應用

  • 應用:異常檢測(信用卡詐欺)、地理資料分群(熱點分析)、不規則形狀的群組
  • 優點:不用指定 K、能找任意形狀的群組、自動標記離群值
  • 缺點:對 eps 與 minPts 兩個參數敏感,調不好整組走樣
  • 缺點:不同密度的群組處理不好(HDBSCAN 改善了這點)
  • 驗收:DBCV(密度分群專用指標)、群集穩定度雜訊點比例
🎯 口訣:人多就成群,落單即雜訊 — 不用數 K、形狀隨意,就怕參數調不好。

iPAS 考點

判斷關鍵字:密度、任意形狀、自動找離群值、不需預設群數。經典比較:K-Means(要 K、圓形、怕離群值)vs DBSCAN(不用 K、任意形狀、離群值直接標出來)。情境題:「分群順便抓異常點」→ DBSCAN;「各群密度差很大」→ HDBSCAN。

應用場景

異常檢測地理資料分群影像分割社群網路分析

評估指標

DBCV群集穩定度雜訊點比例

iPAS 歷屆考題詳解(5 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第11題

企業資料分析團隊使用 DBSCAN(Density-Based Spatial Clustering of Applications with Noise)演算法進行顧客行為分群,並希望模型能自動區分主要群集與雜訊資料。在此演算法中,決定聚類結果的兩個主要超參數為下列何者?

  1. A特徵數與學習率
  2. BK 值與距離閾值
  3. C鄰域半徑(Epsilon ε)與最小點數(MinPts)
  4. D交叉熵(Cross Entropy)與權重初始化
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 DBSCAN 是密度式分群演算法,核心邏輯為:以每個點為圓心、半徑 ε(Epsilon)界定鄰域,鄰域內點數達到最小點數(MinPts)者成為核心點,再由核心點的密度可達性擴張成群;無法歸入任何群的點則標記為雜訊(Noise)。因此 ε 與 MinPts 這兩個超參數直接決定群集的形狀、數量與雜訊判定,是 DBSCAN 最主要的超參數。 【為何其他選項錯了?】 - (A):特徵數是資料本身的屬性而非超參數;學習率屬於梯度下降類演算法的設定,DBSCAN 不使用梯度最佳化。 - (B):K 值是 K-means 或 KNN 的參數,DBSCAN 的特點之一正是不需預先指定群數;「距離閾值」僅對應 ε,缺少密度條件 MinPts,敘述不完整。 - (D):交叉熵是分類任務的損失函數,權重初始化屬於神經網路訓練;DBSCAN 沒有損失函數與權重的概念。 提示:DBSCAN 記兩個超參數:ε 界定鄰域範圍,MinPts 定義密度門檻,密度足夠才成群。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第48題

某數據工程師使用 DBSCAN演算法對一份數百萬筆的高維顧客資料進行聚類分析,但發現程式執行速度極慢,甚至出現記憶體不足的情況。若要在不改變演算法核心邏輯的前提下,最有效提升其運算效率的作法為何?

  1. A改用以平均連結(Average Linkage)為基礎的階層式群集法(Hierarchical Clustering)
  2. B採用高效率的距離索引結構(Distance Index Structure),例如KD-Tree 或 Ball Tree
  3. C將 ε(Epsilon)參數調得極小,以減少鄰近點的數量
  4. D在資料前處理時增加標準化後的特徵維度數
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 DBSCAN 的效能瓶頸在鄰域查詢:樸素實作需對每個點進行全對全的距離計算,時間複雜度為 O(n²),數百萬筆資料自然執行緩慢且消耗大量記憶體。導入 KD-Tree、Ball Tree 等高效率的距離索引結構(Distance Index Structure),可將單次鄰域查詢降至近似對數時間,大幅提升整體效率,且不改變 DBSCAN 的核心邏輯與聚類結果,正符合題目「不改演算法邏輯、只提升效率」的要求。 【為何其他選項錯了?】 - (A):改用平均連結的階層式群集法等於更換演算法,違反「不改變核心邏輯」的前提;且階層式分群的計算複雜度更高,無助於效率。 - (C):將 ε 調到極小雖會減少鄰近點數量,但聚類結果將徹底改變,幾乎所有點會被判為雜訊;這是改變了分析結果,而非提升運算效率。 - (D):增加特徵維度只會加重距離計算負擔並加劇維度災難,與提升效率的目標背道而馳。 提示:DBSCAN 執行過慢時優先導入空間索引(KD-Tree/Ball Tree),邏輯與結果不變、查詢加速。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第28題

若在高維度(>500 維)的資料上應用DBSCAN(Density-Based Spatial Clustering of Applications with Noise)演算法,卻發現所有資料點皆被判定為雜訊(Noise),下列何者為最有可能的原因?

  1. A高維下距離變化趨同,導致 ε(Epsilon)閾值選擇失效
  2. B使用錯誤的距離函數(Distance Function)
  3. CMinPts參數設得太小
  4. D資料過度標準化導致特徵消失
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 這是維度詛咒(Curse of Dimensionality)的典型症狀:維度極高時,任意兩點間的距離趨於相近(距離集中現象),「近鄰」與「遠點」的差異被抹平。DBSCAN 依賴「ε 半徑內至少有 MinPts 個鄰居」定義核心點,當所有點之間的距離都相差無幾時,任何 ε 都難以圈出足夠鄰居,結果沒有點能成為核心點,全部被判為雜訊。 【為何其他選項錯了?】 - (B):距離函數選擇不當會使結果變差,但不會系統性地讓「全部」點變成雜訊;且高維之下即使更換距離函數,距離集中的本質問題依然存在。 - (C):MinPts 設得太小反而使核心點更容易成立,應會產生更多群集而非全數雜訊,與題目現象的方向相反。 - (D):標準化只是將各維度尺度拉齊,不會使特徵消失,也不是高維情境下 DBSCAN 失效的主因。 提示:高維資料搭配距離型演算法會遭遇距離集中問題;先降維(PCA、UMAP)再進行密度分群。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第4題

在執行 DBSCAN(Density-Based Spatial Clustering of Applications with Noise)群集分析時,若某資料點鄰域內的樣本數不足以形成核心點(Core Point),且該點未被任何核心點的鄰域所包含,也未與其他群集形成密度可達關係(Density Reachability),此資料點最終將被歸類為哪一種類型?

  1. A鄰近點(Neighbor Point)
  2. B雜訊點(Noise Point)
  3. C邊界點(Border Point)
  4. D潛在點(Potential Point)
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 DBSCAN 將資料點分為三類:核心點(鄰域半徑 ε 內樣本數達 MinPts)、邊界點(本身不是核心點,但落在某核心點的鄰域內)、雜訊點(兩者皆非)。題目描述的點:鄰域樣本數不足以成為核心點、未被任何核心點鄰域包含、也不與任何群集存在密度可達關係,三個條件皆不符合核心點與邊界點的定義,依演算法將被標記為雜訊點(Noise Point),不屬於任何群集。能在分群的同時辨識離群雜訊,正是 DBSCAN 的一大優點。 【為何其他選項錯了?】 - (A):「鄰近點」不是 DBSCAN 的標準術語;其正式分類只有核心點、邊界點、雜訊點三種。 - (C):邊界點的定義是「落在某個核心點的鄰域內」;題目明言該點未被任何核心點鄰域包含,不符合邊界點的資格。 - (D):「潛在點」同樣不存在於 DBSCAN 的定義之中,屬於干擾選項。 提示:DBSCAN 三分法:密度達標者為核心點,依附核心者為邊界點,兩者皆非即為雜訊點。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第31題

某資料工程師嘗試對包含 300 個特徵的使用者行為資料集使用 DBSCAN 進行群集分析,但發現幾乎所有資料點都被判定為雜訊點(Noise Points),難以形成有意義的群集,即使不斷調整ε(Epsilon)與 MinPts 參數也無濟於事。請問下列何者為此問題最可能的根本原因?

  1. A在高維空間中,維度詛咒(Curse of Dimensionality)使得資料點之間的距離趨於相近,導致 DBSCAN的密度估計失效
  2. BDBSCAN 演算法僅適用於低維資料,無法處理高維資料
  3. C300個特徵的資料必然不具備群集結構,因此無法進行有效的分群
  4. D高維空間中核心點的數量會受到數學限制,導致無法形成群集
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 這是維度詛咒(Curse of Dimensionality)的典型症狀:在 300 維空間中,距離集中效應使任兩點的距離趨於相近,「最近鄰」與「最遠鄰」的差距被壓縮,密度概念失去鑑別力。DBSCAN 以「ε 鄰域內至少有 MinPts 個點」定義核心點,當所有點的距離都相差無幾時,ε 略小則幾乎所有點成為雜訊、ε 略大則全部併成一團,調整參數也找不到合適的設定。務實解法是先降維(如 PCA、UMAP)或改用適合高維的資料表示,再進行密度分群。 【為何其他選項錯了?】 - (B):DBSCAN 並無「僅適用低維」的演算法限制;高維失效源自距離度量普遍失去鑑別力,KNN、K-means 等依賴距離的方法同樣受影響,並非 DBSCAN 獨有的缺陷。 - (C):「300 個特徵的資料必然不具群集結構」的說法過於絕對;群集結構可能存在於低維流形上,只是被高維雜訊掩蓋,降維後往往能顯現。 - (D):並不存在「高維空間中核心點數量受數學限制」的定理,此敘述沒有理論依據。 提示:高維空間中距離趨於等距,密度估計失效;先降維,再進行密度分群。

相關節點