深度學習知識地圖 · NLP 與 LLM
Transformer
NLP 現代基石
觀念教學
Transformer (2017) 拋棄了循環結構,完全依賴注意力機制 (Attention is All You Need)。它是 BERT (Encoder) 和 GPT (Decoder) 的共同祖先,開啟了 LLM 時代。
Flash Attention
Transformer 的自注意力計算量是 O(N²),序列越長記憶體和時間爆炸越嚴重。Flash Attention 不是新模型架構,而是更聰明的計算方式:
核心原理
把大矩陣拆成小塊(tiling),在 GPU 的高速 SRAM 裡分塊計算,避免反覆讀寫慢速 HBM 記憶體。
效果
- 記憶體用量從 O(N²) 降到 O(N)(省超多)
- 速度快 2-4 倍(同樣的 GPU 能跑更長序列)
- 計算結果完全一樣(不是近似,是精確等價)
版本演進
- Flash Attention 1:分塊計算 + IO 感知
- Flash Attention 2:更好的並行化,速度再提升
- Flash Attention 3:針對新 GPU 架構(Hopper)優化
比喻:原本要把整張大桌子搬進小房間算數學,Flash Attention 改成一次搬一小塊進來算,算完換下一塊,結果一樣但不用大房間。
其他類似優化:Sparse Attention(只算部分位置)、Longformer(局部+全局混合)、Ring Attention(跨 GPU 分散序列)。
應用場景
評估指標
iPAS 歷屆考題詳解(5 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某企業導入大型語言模型(LLM)進行長篇法規文件的問答查詢。使用者反映,當問題需整合文件中較不相關的資訊時,模型回答的連貫性與準確性明顯下降。技術團隊認為此現象與模型架構特性有關。下列何者最能說明傳統 Transformer 在此情境下的限制?
- A模型在推理時僅能依賴固定長度的上下文窗口,無法同時處理分散於全文的資訊;
- B模型能記住的內容取決於訓練語料,推理時遇到新內容可能無法應對;
- CTransformer 在長序列處理時效率下降,但仍可完整處理所有輸入內容;
- D每次推理後 Transformer 都需重新訓練才能記住新的資訊
看正解與逐選項詳解
正解:A
某電信公司導入以Encoder-Decoder 架構為基礎的智慧客服系統,用於自動回覆用戶的資費查詢與故障申訴。下列何者最能準確敘述該系統中解碼器(Decoder)的作用?
- A解碼器(Decoder)直接將編碼器(Encoder)的語義表示一次轉換為完整回覆句子,以提升回覆效率;
- B解碼器(Decoder)根據編碼器(Encoder)的語義表示,並結合先前已生成的內容,逐詞產生回覆;
- C解碼器(Decoder)先生成完整回覆句子,再由編碼器(Encoder)進行語意修正;
- D解碼器(Decoder)先產生多個候選回覆句子,再從中選擇語意最適合的一句作為輸出
看正解與逐選項詳解
正解:B
某跨國金融科技公司導入 Transformer 架構開發多語客服系統,以提升長篇金融文件的自動翻譯品質。下列何者為該模型能顯著改善翻譯準確度的主要原因?
- A透過自注意力機制(Self-Attention Mechanism)捕捉長距離語境依賴關係
- B透過卷積運算(Convolution Operation)加速訓練過程
- C透過強化學習(Reinforcement Learning)自動調整語句生成策略
- D透過資料增強(Data Augmentation)平衡多語語料比例
看正解與逐選項詳解
正解:A
某工程師在開發一個以 Transformer為基礎的文本分類模型時,發現模型對於詞語順序的變化不夠敏感,影響語意判斷效果。請問在 Transformer 架構中,位置編碼(Positional Encoding)的主要作用為何?
- A在詞嵌入(Embedding)中加入隨機擾動,以提升模型對輸入變化的泛化能力
- B在注意力機制中加入遮罩(Mask),限制模型只能關注部分詞語
- C將輸入序列轉換為可同時運算的向量表示,以提升計算效率
- D在詞的向量表示中加入位置資訊,使模型能區分序列中不同位置的詞語
看正解與逐選項詳解
正解:D
某團隊開發合約文件審查系統,需比對合約首頁的定義條款與第 20 頁的責任條款是否一致。工程師初版採用雙向長短期記憶(Bidirectional LSTM),但發現長文件的跨段落語義關聯捕捉效果不佳,且訓練時間隨文件長度明顯增加。改用Transformer架構後問題獲得改善,下列何者為最主要的原因?
- ATransformer 參數量比 LSTM 少,因此訓練速度更快、不易過擬合
- BTransformer 內建位置編碼,使模型天生理解文件的章節結構與段落順序
- CLSTM 無法處理超過512個 token的輸入,Transformer無此硬性限制
- DTransformer 的 Self-Attention 可讓任意 token 直接建立關聯,不受距離限制,且運算可平行化
看正解與逐選項詳解
正解:D