機器學習知識地圖 · 非監督式學習
UMAP
快速非線性降維
觀念教學
t-SNE 的後起之秀:一樣把高維資料畫成漂亮的群島圖,但跑得更快、大局抓得更穩 — 這就是 UMAP。
核心觀念
UMAP(Uniform Manifold Approximation and Projection)是較新的非線性降維技術,同樣走「保留鄰居關係」路線。相比 t-SNE 有兩大優勢:速度更快,以及保留更多全局結構 — 群與群之間的相對位置更有參考價值。因此特別適合大規模資料集。
白話理解
百萬筆電商用戶的行為向量要壓成 2D 看客群樣貌:t-SNE 跑到天荒地老,UMAP 快上一大截,而且「哪些客群彼此比較近」的大局關係保留得更好,行銷看圖就能規劃相鄰客群的遞進活動。
關鍵細節
- 除了視覺化,也能當一般降維/前處理使用 — t-SNE 幾乎只做視覺化,這是分工差異
- 驗收:Trustworthiness 與 kNN 保留率看局部鄰居忠實度,距離相關性看全局結構保留程度
- 對「鄰居數」等參數仍敏感,不同設定畫出的圖會不同,下結論前要做穩定性檢查
- 屬非監督式方法,不需標籤
🎯 口訣:t-SNE 的快轉加強版 — 快、扛得住大資料、全局更可信。
iPAS 考點
比較題必考:t-SNE vs UMAP — 記住「UMAP 更快、保留更多全局結構、適合大規模資料」一句話答完。判斷關鍵字:大規模資料的非線性降維與視覺化。陷阱:UMAP 常拿來呈現分群結果,但它本身是降維技術,不是分群演算法。