機器學習知識地圖 · 非監督式學習
t-SNE
非線性降維,視覺化
觀念教學
想把上千維的資料畫成人眼看得懂的 2D 散點圖?t-SNE 是視覺化這條路上的老牌明星。
核心觀念
t-SNE(t-分布隨機鄰居嵌入,t-distributed Stochastic Neighbor Embedding)是非線性降維技術,特別適合高維資料的視覺化。原理白話講:高維空間裡誰跟誰是近鄰,壓到低維後盡量維持同樣的鄰居關係。它顧的是局部結構 — 群內關係忠實,群與群之間的距離不可過度解讀。
白話理解
手寫數字影像有數百維像素,t-SNE 壓成 2D 後,同一個數字的樣本自然聚成一團,肉眼直接看出資料型態。半導體廠也用它把上千維感測器讀值壓成 2D,一眼看出瑕疵批次是否自成一群。
使用須知
- 定位是視覺化與資料探索,不是建模前的通用壓縮工具
- 注意:KL 散度是 t-SNE 的訓練目標(損失函數),不適合拿來跨模型比較
- 跨模型比較請用 Trustworthiness、Continuity、kNN 保留率:檢查低維圖上的鄰居是否真是高維裡的鄰居
- 計算量大,大資料集吃力;對 perplexity 等參數敏感,跑兩次圖形可能不同
🎯 口訣:留住鄰居、畫成一團團 — 群內可信,群距別當真。
iPAS 考點
判斷關鍵字:非線性降維、高維視覺化。三方比較:PCA(線性、快、可壓縮)、t-SNE(非線性、慢、視覺化專用)、UMAP(非線性、更快、較顧全局)。陷阱選項:「用 KL 散度比較哪個降維模型比較好」— 錯,那是訓練損失,不是跨模型評估指標。
應用場景
評估指標
iPAS 歷屆考題詳解(1 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某資料科學家欲對 512維詞嵌入向量(共 10萬筆)進行視覺化以探索群集結構,同時另一工程師需將 200 個製程特徵降維後作為 XGBoost 的輸入特徵。關於 t- SNE與 PCA 選型,下列敘述何者最正確?
- At-SNE 保留全局線性結構,適合作為 XGBoost 的降維前處理
- Bt-SNE 保留局部鄰域結構,適合視覺化;但不保留全局結構,不適合作為模型輸入特徵
- CPCA 為非線性降維方法,能保留複雜流形結構
- Dt-SNE 與PCA 皆可直接對新資料進行線性外推
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
t-SNE 透過機率化的鄰域關係將高維資料壓縮至 2 至 3 維,擅長保留局部鄰域結構,適合對 10 萬筆詞嵌入進行群集視覺化探索;但它不保留全局距離與密度資訊,座標軸沒有可解釋意義,且標準 t-SNE 沒有 transform 方法,無法將新資料一致地投影至既有空間,因此不適合作為 XGBoost 等下游模型的輸入特徵。需要降維後輸入模型的場景,應使用 PCA 這類可重複套用於新資料的方法。
【為何其他選項錯了?】
- (A):t-SNE 並不保留全局線性結構,將其作為梯度提升模型的降維前處理是典型誤用。
- (C):PCA 是線性降維方法(尋找變異最大的線性投影方向),無法保留複雜的非線性流形結構;此敘述將它說成非線性方法,正好相反。
- (D):PCA 可對新資料進行線性投影(transform),但 t-SNE 每次需對整批資料重新最佳化,無法對新資料線性外推,「皆可」不成立。
提示:t-SNE 用於視覺化探索,PCA 用於產生模型輸入特徵;要輸入下游模型的降維,選具 transform 能力的方法。