深度學習知識地圖 · NLP 與 LLM

Transformer

NLP 現代基石

在互動地圖中開啟 回深度學習知識地圖

觀念教學

Transformer (2017) 拋棄了循環結構,完全依賴注意力機制 (Attention is All You Need)。它是 BERT (Encoder) 和 GPT (Decoder) 的共同祖先,開啟了 LLM 時代。

Flash Attention

Transformer 的自注意力計算量是 O(N²),序列越長記憶體和時間爆炸越嚴重。Flash Attention 不是新模型架構,而是更聰明的計算方式:

核心原理
把大矩陣拆成小塊(tiling),在 GPU 的高速 SRAM 裡分塊計算,避免反覆讀寫慢速 HBM 記憶體。

效果

  • 記憶體用量從 O(N²) 降到 O(N)(省超多)
  • 速度快 2-4 倍(同樣的 GPU 能跑更長序列)
  • 計算結果完全一樣(不是近似,是精確等價)

版本演進

  • Flash Attention 1:分塊計算 + IO 感知
  • Flash Attention 2:更好的並行化,速度再提升
  • Flash Attention 3:針對新 GPU 架構(Hopper)優化
比喻:原本要把整張大桌子搬進小房間算數學,Flash Attention 改成一次搬一小塊進來算,算完換下一塊,結果一樣但不用大房間。

其他類似優化:Sparse Attention(只算部分位置)、Longformer(局部+全局混合)、Ring Attention(跨 GPU 分散序列)。

應用場景

幾乎所有現代 NLP 任務機器翻譯文本生成

評估指標

BLEUPerplexity

iPAS 歷屆考題詳解(5 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

115年第二次初級AI應用規劃師第一科人工智慧基礎概論 第35題

某企業導入大型語言模型(LLM)進行長篇法規文件的問答查詢。使用者反映,當問題需整合文件中較不相關的資訊時,模型回答的連貫性與準確性明顯下降。技術團隊認為此現象與模型架構特性有關。下列何者最能說明傳統 Transformer 在此情境下的限制?

  1. A模型在推理時僅能依賴固定長度的上下文窗口,無法同時處理分散於全文的資訊;
  2. B模型能記住的內容取決於訓練語料,推理時遇到新內容可能無法應對;
  3. CTransformer 在長序列處理時效率下降,但仍可完整處理所有輸入內容;
  4. D每次推理後 Transformer 都需重新訓練才能記住新的資訊
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 傳統 Transformer 推理時受上下文視窗(Context Window)長度限制,注意力一次只能涵蓋固定長度內的 token。長篇法規文件的問答若需整合分散於全文各處的資訊,一旦相關內容超出或接近視窗上限,模型便無法同時納入所有必要片段,回答的連貫性與準確性隨之下降,正是題幹描述的現象。 【為何其他選項錯了?】 - (B):模型推理時可讀取輸入的新內容,並非只能依賴訓練語料;題幹的問題在於上下文長度與分散資訊的整合能力,而非訓練資料的涵蓋範圍。 - (C):長序列下效率下降屬實,但「仍可完整處理所有輸入內容」與事實不符;超出上下文視窗的內容無法被同時處理,這正是限制所在。 - (D):Transformer 推理時直接處理輸入內容,不需要重新訓練即可回應新資訊;「每次推理後需重新訓練」的敘述錯誤。 提示:長文件問答的瓶頸在一次能納入注意力的上下文長度;注意分辨「效率下降」與「超出視窗無法納入」的差異。
115年第二次初級AI應用規劃師第二科生成式AI應用與規劃 第27題

某電信公司導入以Encoder-Decoder 架構為基礎的智慧客服系統,用於自動回覆用戶的資費查詢與故障申訴。下列何者最能準確敘述該系統中解碼器(Decoder)的作用?

  1. A解碼器(Decoder)直接將編碼器(Encoder)的語義表示一次轉換為完整回覆句子,以提升回覆效率;
  2. B解碼器(Decoder)根據編碼器(Encoder)的語義表示,並結合先前已生成的內容,逐詞產生回覆;
  3. C解碼器(Decoder)先生成完整回覆句子,再由編碼器(Encoder)進行語意修正;
  4. D解碼器(Decoder)先產生多個候選回覆句子,再從中選擇語意最適合的一句作為輸出
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 在 Encoder-Decoder 架構中,編碼器先將使用者輸入轉換為語義表示,解碼器再以此表示為條件,結合先前已生成的 token,以自迴歸方式逐詞產生回覆:每一步的輸出都取決於編碼器的語義表示與已生成的部分序列。此「條件式逐步生成」正是解碼器的典型運作方式,故 (B) 正確。 【為何其他選項錯了?】 - (A):解碼器並非一次輸出完整句子,而是逐 token 依序生成,每步都參考先前輸出;「一次轉換為完整回覆」不符合自迴歸生成的機制。 - (C):流程順序顛倒;實際上是編碼器先理解輸入,解碼器再生成輸出,不存在解碼器先產生句子、再由編碼器修正的設計。 - (D):先產生多個候選再挑選較接近束搜尋(Beam Search)等解碼策略的描述,屬於可選的推論技巧,並非解碼器的核心定義;解碼器的本職是依上下文逐步生成序列。 提示:記住分工:Encoder 理解輸入,Decoder 逐詞生成;凡「一次輸出」「先生成再理解」的敘述皆違反自迴歸原則。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第2題

某跨國金融科技公司導入 Transformer 架構開發多語客服系統,以提升長篇金融文件的自動翻譯品質。下列何者為該模型能顯著改善翻譯準確度的主要原因?

  1. A透過自注意力機制(Self-Attention Mechanism)捕捉長距離語境依賴關係
  2. B透過卷積運算(Convolution Operation)加速訓練過程
  3. C透過強化學習(Reinforcement Learning)自動調整語句生成策略
  4. D透過資料增強(Data Augmentation)平衡多語語料比例
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 Transformer 的核心是自注意力機制(Self-Attention Mechanism):序列中每個詞都能直接與任意位置的詞計算關聯權重,資訊傳遞路徑長度為常數,因此能有效捕捉長距離語境依賴。金融長文中,代名詞指涉與條款引用經常橫跨大量句子,自注意力能將相隔很遠的語意直接連結,翻譯準確度因此顯著提升,這也是其優於 RNN 逐步傳遞架構的關鍵。 【為何其他選項錯了?】 - (B):Transformer 架構不使用卷積運算(Convolution Operation),卷積是 CNN 的機制;且加速訓練與翻譯準確度提升之間並無直接因果關係。 - (C):強化學習(Reinforcement Learning)並非 Transformer 架構的內建成分;RLHF 等技術屬於後續的對齊訓練,不是該架構改善翻譯品質的主因。 - (D):資料增強(Data Augmentation)是資料層面的通用手法,任何模型皆可採用,並非 Transformer 本身的架構優勢。 提示:題幹問「架構層面的主因」,直接對應自注意力與長距離依賴;卷積、強化學習、資料增強皆非 Transformer 的核心機制。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第35題

某工程師在開發一個以 Transformer為基礎的文本分類模型時,發現模型對於詞語順序的變化不夠敏感,影響語意判斷效果。請問在 Transformer 架構中,位置編碼(Positional Encoding)的主要作用為何?

  1. A在詞嵌入(Embedding)中加入隨機擾動,以提升模型對輸入變化的泛化能力
  2. B在注意力機制中加入遮罩(Mask),限制模型只能關注部分詞語
  3. C將輸入序列轉換為可同時運算的向量表示,以提升計算效率
  4. D在詞的向量表示中加入位置資訊,使模型能區分序列中不同位置的詞語
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 自注意力機制對輸入順序具有排列不變性:將句中詞語打亂,注意力計算出的關聯集合不變,模型本身無法區分詞序差異。位置編碼(Positional Encoding)將每個位置的資訊(以正弦、餘弦函數或可學習向量表示)加入對應詞的嵌入向量,使模型能區分同一詞語出現在不同位置的差異,恢復對詞序的感知能力,正是題幹「對詞語順序不敏感」問題的對應解方。 【為何其他選項錯了?】 - (A):在嵌入中加入隨機擾動屬於資料增強或正則化手法;位置編碼是確定性的位置訊號,並非雜訊,目的也不是提升泛化能力。 - (B):注意力遮罩(Mask)的功能是遮蔽不應關注的位置,例如解碼時的未來詞或 Padding,與編碼位置資訊是兩個不同機制。 - (C):將序列轉為可平行運算的向量表示是嵌入層與自注意力架構本身的特性;位置編碼的目的不是計算效率,而是補回平行化所犧牲的順序資訊。 提示:自注意力天生不含順序資訊,位置編碼負責注入位置訊號;遮罩管的是「哪些位置不可看」,兩者勿混淆。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第19題

某團隊開發合約文件審查系統,需比對合約首頁的定義條款與第 20 頁的責任條款是否一致。工程師初版採用雙向長短期記憶(Bidirectional LSTM),但發現長文件的跨段落語義關聯捕捉效果不佳,且訓練時間隨文件長度明顯增加。改用Transformer架構後問題獲得改善,下列何者為最主要的原因?

  1. ATransformer 參數量比 LSTM 少,因此訓練速度更快、不易過擬合
  2. BTransformer 內建位置編碼,使模型天生理解文件的章節結構與段落順序
  3. CLSTM 無法處理超過512個 token的輸入,Transformer無此硬性限制
  4. DTransformer 的 Self-Attention 可讓任意 token 直接建立關聯,不受距離限制,且運算可平行化
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 Self-Attention 讓序列中任意兩個 token 直接計算關聯權重,資訊傳遞路徑長度為 O(1):首頁的定義條款與第 20 頁的責任條款可直接建立關聯,不必如 LSTM 般逐步傳遞而使訊息在途中衰減。同時注意力為矩陣運算,可對整個序列平行計算,不像 RNN 必須依時間順序逐步展開,長文件的訓練時間因此大幅縮短。此特性同時解決題幹的兩個痛點:跨段落語義關聯與訓練時間。 【為何其他選項錯了?】 - (A):Transformer 的參數量通常多於 LSTM;其速度優勢來自可平行化,而非參數較少,「不易過擬合」亦無根據。 - (B):位置編碼提供的是 token 的順序資訊,「天生理解章節結構與段落順序」屬過度延伸,文件的層級結構仍需模型自行學習。 - (C):512 token 是 BERT 等特定實作的設定,並非 LSTM 的硬性限制;LSTM 理論上可處理任意長度序列,問題在於長距離依賴的保留能力。 提示:題幹兩個線索「跨段落關聯不佳」與「訓練時間隨長度增加」,分別對應 Self-Attention 的 O(1) 關聯路徑與可平行化。

相關節點