深度學習知識地圖 · NLP 與 LLM
詞嵌入
Word2Vec, GloVe
觀念教學
詞嵌入將文字轉換為數字向量,讓電腦能理解詞與詞之間的語意關係。
白話說明
電腦不懂文字,只懂數字。詞嵌入把每個詞變成一串數字(向量),而且意思相近的詞,向量也會靠近。經典例子:「國王 - 男 + 女 ≈ 女王」,向量運算居然能算出語意關係。
經典算法
- Word2Vec:用「周圍的詞猜中間」或「中間猜周圍」來學向量
- GloVe:用全局共現統計來學向量
- 現代做法:直接用 BERT/GPT 的 Embedding 層,能根據上下文動態調整
使用場景
所有 NLP 任務的第一步、語意搜尋、推薦系統、RAG 的向量檢索。
優點
把文字變成可計算的數學物件,語意相似度可以直接算。
缺點
Word2Vec/GloVe 是靜態的(一個詞只有一個向量,「蘋果」公司和水果分不開),現代 Contextual Embedding 解決了這問題。
應用場景
評估指標
iPAS 歷屆考題詳解(5 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某電商平台導入CLIP(Contrastive Language-Image Pre-training)模型,讓使用者能直接輸入文字描述來搜尋商品圖片。請問CLIP 模型是透過哪一種方式來衡量文字描述與圖片之間的相符程度?
- A餘弦相似度(Cosine Similarity),計算文字與圖片在向量空間中的方向相似程度;
- BBLEU 分數,衡量文字描述與圖片標題之間的詞彙重疊程度;
- C交叉熵損失(Cross-Entropy Loss),用於衡量模型預測機率與實際標籤之間的差異;
- DF1 分數(F1 Score),綜合評估搜尋結果的精確率與召回率
看正解與逐選項詳解
正解:A
在詞向量(Word Embedding)訓練方法中,GloVe(Global Vectors for Word Representation)與Word2Vec 的主要差異為何?
- AWord2Vec 以詞頻權重訓練詞向量,而 GloVe以隨機初始化向量進行學習
- BWord2Vec 以全局統計矩陣為基礎,而 GloVe採用神經網路進行上下文預測
- CWord2Vec 為基於預測的模型,而 GloVe為基於共現統計的模型
- DWord2Vec 僅能用於靜態文本語料,而 GloVe可應用於即時語料更新
看正解與逐選項詳解
正解:C
企業團隊在使用 Word2Vec模型訓練客服文本語料時,若訓練資料量龐大且希望模型能更有效捕捉罕見詞的語意關聯,下列哪一種訓練策略最為適合?
- A採用Skip-gram模型,但以隨機初始化權重加快高頻詞的訓練收斂
- B採用CBOW 模型(Continuous Bag of Words Model)並結合 TF- IDF權重以強化低頻詞表示
- C採用Skip-gram模型,利用中心詞預測周圍詞語,能更有效學習低頻詞關係
- D採用CBOW 模型(Continuous Bag of Words Model),利用周圍詞預測中心詞,能提升罕見詞的語意穩定度
看正解與逐選項詳解
正解:C
某工程師在建構搜尋引擎的詞向量模型時,語料庫規模達數十億 token,且包含大量長尾詞彙(Long-tail Terms)。他在Word2Vec的 CBOW與Skip-gram 兩種訓練策略之間進行選擇,需考量訓練效率與低頻詞表示品質之差異。下列何者最能準確地反映兩者在此情境下的取捨?
- ACBOW 對長尾詞表現更好,因為它透過多個上下文詞的平均來強化稀疏詞的訓練訊號
- BCBOW訓練速度較快、整體語意平滑,但對低頻詞的向量品質較差;Skip-gram以中心詞預測周圍詞,對長尾詞累積更多訓練樣本,向量品質較優
- CSkip-gram 訓練速度更快,因為每次只需預測單一目標詞,計算量低於 CBOW
- D兩者對低頻詞的表現完全相同,差異僅在於訓練時的 Batch組織方式
看正解與逐選項詳解
正解:B
某電商平台的工程師在開發商品評論情感分析系統時,發現使用 One-Hot 編碼無法表達詞語之間的語意關係,且隨著詞彙表擴大,向量維度與記憶體需求快速增加。工程師因此改用 Word2Vec 進行詞語表示。請問 Word2Vec 從根本上解決了上述問題的哪項限制?
- A建立詞語之間的序列依賴關係,以捕捉長距離上下文語意
- B根據詞語在語料中的出現頻率調整其重要性,使模型更重視高頻詞
- C降低詞彙表示的維度,同時保留語意結構,避免高維稀疏表示所帶來的限制
- D透過監督式學習利用標註語料,提升詞語分類的準確性
看正解與逐選項詳解
正解:C