機器學習知識地圖 · 非監督式學習

UMAP

快速非線性降維

在互動地圖中開啟 回機器學習知識地圖

觀念教學

t-SNE 的後起之秀:一樣把高維資料畫成漂亮的群島圖,但跑得更快、大局抓得更穩 — 這就是 UMAP

核心觀念

UMAP(Uniform Manifold Approximation and Projection)較新的非線性降維技術,同樣走「保留鄰居關係」路線。相比 t-SNE 有兩大優勢:速度更快,以及保留更多全局結構 — 群與群之間的相對位置更有參考價值。因此特別適合大規模資料集

白話理解

百萬筆電商用戶的行為向量要壓成 2D 看客群樣貌:t-SNE 跑到天荒地老,UMAP 快上一大截,而且「哪些客群彼此比較近」的大局關係保留得更好,行銷看圖就能規劃相鄰客群的遞進活動。

關鍵細節

  • 除了視覺化,也能當一般降維/前處理使用 — t-SNE 幾乎只做視覺化,這是分工差異
  • 驗收:TrustworthinesskNN 保留率看局部鄰居忠實度,距離相關性看全局結構保留程度
  • 對「鄰居數」等參數仍敏感,不同設定畫出的圖會不同,下結論前要做穩定性檢查
  • 屬非監督式方法,不需標籤
🎯 口訣:t-SNE 的快轉加強版 — 快、扛得住大資料、全局更可信。

iPAS 考點

比較題必考:t-SNE vs UMAP — 記住「UMAP 更快、保留更多全局結構、適合大規模資料」一句話答完。判斷關鍵字:大規模資料的非線性降維與視覺化。陷阱:UMAP 常拿來呈現分群結果,但它本身是降維技術,不是分群演算法。

應用場景

大規模資料視覺化單細胞 RNA 分析影像特徵視覺化推薦系統

評估指標

TrustworthinesskNN 保留率距離相關性

相關節點