深度學習知識地圖 · NLP 與 LLM

詞嵌入

Word2Vec, GloVe

在互動地圖中開啟 回深度學習知識地圖

觀念教學

詞嵌入將文字轉換為數字向量,讓電腦能理解詞與詞之間的語意關係。

白話說明
電腦不懂文字,只懂數字。詞嵌入把每個詞變成一串數字(向量),而且意思相近的詞,向量也會靠近。經典例子:「國王 - 男 + 女 ≈ 女王」,向量運算居然能算出語意關係。

經典算法

  • Word2Vec:用「周圍的詞猜中間」或「中間猜周圍」來學向量
  • GloVe:用全局共現統計來學向量
  • 現代做法:直接用 BERT/GPT 的 Embedding 層,能根據上下文動態調整

使用場景
所有 NLP 任務的第一步、語意搜尋、推薦系統、RAG 的向量檢索。

優點
把文字變成可計算的數學物件,語意相似度可以直接算。

缺點
Word2Vec/GloVe 是靜態的(一個詞只有一個向量,「蘋果」公司和水果分不開),現代 Contextual Embedding 解決了這問題。

應用場景

詞義相似度計算推薦系統NLP 預訓練

評估指標

Cosine Similarity

iPAS 歷屆考題詳解(5 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

115年第二次初級AI應用規劃師第二科生成式AI應用與規劃 第12題

某電商平台導入CLIP(Contrastive Language-Image Pre-training)模型,讓使用者能直接輸入文字描述來搜尋商品圖片。請問CLIP 模型是透過哪一種方式來衡量文字描述與圖片之間的相符程度?

  1. A餘弦相似度(Cosine Similarity),計算文字與圖片在向量空間中的方向相似程度;
  2. BBLEU 分數,衡量文字描述與圖片標題之間的詞彙重疊程度;
  3. C交叉熵損失(Cross-Entropy Loss),用於衡量模型預測機率與實際標籤之間的差異;
  4. DF1 分數(F1 Score),綜合評估搜尋結果的精確率與召回率
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 CLIP(Contrastive Language-Image Pre-training)以對比學習訓練文字編碼器與影像編碼器,將文字描述與圖片映射到同一個共享向量空間;訓練目標是使配對的圖文向量彼此接近、不配對的彼此遠離。推論時,系統分別計算查詢文字與各商品圖片的嵌入向量,再以餘弦相似度(Cosine Similarity)衡量向量方向的接近程度,相似度越高代表圖文越相符,故 (A) 正確。 【為何其他選項錯了?】 - (B):BLEU 是機器翻譯等文字生成任務中,比較兩段「文字」詞彙重疊程度的評估指標,無法衡量文字與圖片兩種不同模態之間的相符程度。 - (C):交叉熵損失(Cross-Entropy Loss)是訓練階段衡量預測分布與真實標籤差異的損失函數;CLIP 推論比對時使用的是向量相似度,而非損失函數。 - (D):F1 分數是評估檢索或分類結果品質的指標,綜合精確率與召回率,屬於系統評估層面,不是 CLIP 內部計算圖文匹配的機制。 提示:CLIP 的關鍵是圖文共享向量空間,以餘弦相似度比對方向;評估指標(BLEU、F1)與損失函數皆非匹配機制。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第4題

在詞向量(Word Embedding)訓練方法中,GloVe(Global Vectors for Word Representation)與Word2Vec 的主要差異為何?

  1. AWord2Vec 以詞頻權重訓練詞向量,而 GloVe以隨機初始化向量進行學習
  2. BWord2Vec 以全局統計矩陣為基礎,而 GloVe採用神經網路進行上下文預測
  3. CWord2Vec 為基於預測的模型,而 GloVe為基於共現統計的模型
  4. DWord2Vec 僅能用於靜態文本語料,而 GloVe可應用於即時語料更新
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 Word2Vec 是基於預測(Prediction-based)的模型,以滑動視窗搭配 Skip-gram 或 CBOW,用淺層神經網路執行上下文預測任務來學習詞向量;GloVe(Global Vectors)則是基於計數(Count-based)的模型,先統計整個語料的詞共現矩陣(Co-occurrence Matrix),再以加權目標函數分解出詞向量。一者依靠局部視窗的預測,一者依靠全局共現統計,此為兩者最本質的差異。 【為何其他選項錯了?】 - (A):兩者皆以隨機初始化的向量開始迭代學習,「詞頻權重訓練 vs 隨機初始化」並非兩者的分野。 - (B):敘述恰好顛倒:以全局統計矩陣為基礎的是 GloVe,以神經網路進行上下文預測的是 Word2Vec。 - (D):兩者訓練完成後皆為靜態詞向量(一詞對應一向量),皆未特別支援即時語料更新;需要動態語意表徵應採用 ELMo、BERT 等情境化模型。 提示:記住對應關係:Word2Vec=預測式(局部視窗),GloVe=共現統計式(全局矩陣);將兩者對調即是常見陷阱選項。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第33題

企業團隊在使用 Word2Vec模型訓練客服文本語料時,若訓練資料量龐大且希望模型能更有效捕捉罕見詞的語意關聯,下列哪一種訓練策略最為適合?

  1. A採用Skip-gram模型,但以隨機初始化權重加快高頻詞的訓練收斂
  2. B採用CBOW 模型(Continuous Bag of Words Model)並結合 TF- IDF權重以強化低頻詞表示
  3. C採用Skip-gram模型,利用中心詞預測周圍詞語,能更有效學習低頻詞關係
  4. D採用CBOW 模型(Continuous Bag of Words Model),利用周圍詞預測中心詞,能提升罕見詞的語意穩定度
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 Skip-gram 以中心詞預測周圍詞,語料中每個詞(含罕見詞)都會輪流作為中心詞,每次出現可產生多筆(中心詞, 上下文詞)訓練樣本,罕見詞因此獲得較充足的梯度更新,能學到品質較好的向量表示;搭配負採樣(Negative Sampling)亦可在大規模語料上高效訓練。題幹「資料量龐大且重視罕見詞語意」的條件,正對應 Skip-gram 的適用情境。 【為何其他選項錯了?】 - (A):雖然選用 Skip-gram 方向正確,但「以隨機初始化權重加快高頻詞收斂」並無意義,權重本來即為隨機初始化;且題幹重點是罕見詞,而非高頻詞的收斂速度。 - (B):CBOW 以周圍詞的平均預測中心詞,罕見詞的訊號易被平均稀釋,對低頻詞先天不利;結合 TF-IDF 權重亦非 Word2Vec 的標準訓練機制。 - (D):敘述與事實相反:CBOW 訓練速度快、對高頻詞友善,罕見詞的表現不如 Skip-gram,無法提升罕見詞的語意穩定度。 提示:罕見詞表示品質優先選 Skip-gram;CBOW 的上下文平均會稀釋低頻詞訊號,兩者特性勿混淆。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第3題

某工程師在建構搜尋引擎的詞向量模型時,語料庫規模達數十億 token,且包含大量長尾詞彙(Long-tail Terms)。他在Word2Vec的 CBOW與Skip-gram 兩種訓練策略之間進行選擇,需考量訓練效率與低頻詞表示品質之差異。下列何者最能準確地反映兩者在此情境下的取捨?

  1. ACBOW 對長尾詞表現更好,因為它透過多個上下文詞的平均來強化稀疏詞的訓練訊號
  2. BCBOW訓練速度較快、整體語意平滑,但對低頻詞的向量品質較差;Skip-gram以中心詞預測周圍詞,對長尾詞累積更多訓練樣本,向量品質較優
  3. CSkip-gram 訓練速度更快,因為每次只需預測單一目標詞,計算量低於 CBOW
  4. D兩者對低頻詞的表現完全相同,差異僅在於訓練時的 Batch組織方式
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 CBOW 以上下文多個詞的平均預測中心詞,每步整合多詞訊號,訓練速度快,對高頻詞的表示平滑穩定;但低頻詞的訊號會在上下文平均中被稀釋,向量品質較差。Skip-gram 則以中心詞逐一預測周圍每個詞,低頻詞每次出現都會作為中心詞產生多筆訓練樣本,等於為長尾詞累積更多更新機會,因此在數十億 token、長尾詞彙多的語料上,Skip-gram 的低頻詞向量品質較優,代價是訓練較慢。(B) 完整描述了此取捨。 【為何其他選項錯了?】 - (A):方向相反,CBOW 的上下文平均正是稀釋低頻詞梯度訊號的原因,而非強化稀疏詞的訓練訊號。 - (C):Skip-gram 每個中心詞需對多個上下文詞分別計算預測,計算量高於 CBOW,訓練速度較慢而非更快。 - (D):兩者的預測方向與梯度更新方式本質不同,對低頻詞的表現差異是明確的模型特性,並非僅差在批次(Batch)組織方式。 提示:標準取捨:CBOW 快而平滑、弱於低頻詞;Skip-gram 較慢但長尾詞表現佳;與此對調的選項皆錯。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第5題

某電商平台的工程師在開發商品評論情感分析系統時,發現使用 One-Hot 編碼無法表達詞語之間的語意關係,且隨著詞彙表擴大,向量維度與記憶體需求快速增加。工程師因此改用 Word2Vec 進行詞語表示。請問 Word2Vec 從根本上解決了上述問題的哪項限制?

  1. A建立詞語之間的序列依賴關係,以捕捉長距離上下文語意
  2. B根據詞語在語料中的出現頻率調整其重要性,使模型更重視高頻詞
  3. C降低詞彙表示的維度,同時保留語意結構,避免高維稀疏表示所帶來的限制
  4. D透過監督式學習利用標註語料,提升詞語分類的準確性
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 One-Hot 編碼有兩項根本限制:其一,向量維度等於詞彙表大小,詞彙量增加時向量高維且稀疏,記憶體需求快速上升;其二,任兩個詞向量彼此正交、內積為零,無法表達詞語間的語意關係。Word2Vec 透過上下文預測任務,將每個詞學習為低維(常見數百維)的稠密向量,且語意相近的詞在向量空間中距離相近,同時解決「高維稀疏」與「缺乏語意結構」兩項限制,正是 (C) 的敘述。 【為何其他選項錯了?】 - (A):建立序列依賴、捕捉長距離上下文是 RNN、Transformer 等序列模型的功能;Word2Vec 產出靜態詞向量,一詞一向量,不處理序列依賴。 - (B):依詞頻調整重要性是 TF-IDF 的邏輯,且 TF-IDF 的設計是降低高頻常用詞的權重,選項連方向都描述相反。 - (D):Word2Vec 屬自監督學習,直接以未標註語料的上下文作為監督訊號,不需人工標註資料,亦非以分類準確性為目標。 提示:題幹兩個痛點是維度爆炸與語意缺失;正解須同時涵蓋「降維」與「保留語意」,僅 (C) 兩者兼具。

相關節點