深度學習知識地圖 · NLP 與 LLM
注意力機制
Self-Attention
觀念教學
注意力機制讓模型在處理序列時能「聚焦」在重要資訊上,Self-Attention 是 Transformer 的核心。
白話說明
讀一句「小明把蘋果給了小華,他很開心」,「他」指的是誰?注意力機制會讓模型回頭看前面的詞,發現「他」跟「小華」的關聯最強。就像你讀文章時眼睛會自動跳回去看重點。
Self-Attention 怎麼算
每個詞產生三個向量:Query(我在找什麼)、Key(我是什麼)、Value(我的內容)。Q 和 K 配對算分數,分數高的 V 就被重點關注。
使用場景
幾乎所有現代 NLP/CV 模型的核心(Transformer、BERT、GPT、ViT)。
優點
能捕捉長距離依賴、可平行計算(比 RNN 快很多)。
缺點
計算量 O(N²),序列越長越吃記憶體(所以才需要 Flash Attention)。
應用場景
評估指標
iPAS 歷屆考題詳解(6 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
對非常長的輸入序列進行推理(Inference)時,Transformer 模型推理的主要計算瓶頸通常是什麼?
- A模型輸出層產生文本的過程,因為每生成一個詞都必須重新訓練整個模型一次
- B詞嵌入(Embedding)查找操作,因為其時間複雜度隨詞彙表大小指數級增長
- CSoftmax 函數的計算,因為對每個 Token 都需要執行繁重的運算
- D自注意力層的計算和其記憶體使用,因為注意力矩陣的大小隨序列長度呈平方級增長
看正解與逐選項詳解
正解:D
某環保局想建立 AI 系統監測空氣品質,透過分析監測站攝影機拍攝的影像來識別 煙霧。系統需要在影像中找出煙霧區域並標示其位置和範圍。這個應用主要屬於 電腦視覺的哪個技術領域?
- A影像分類,判斷影像中是否有煙霧
- B物件偵測,找出煙霧位置並用方框標示
- C影像分割,精確標示出煙霧的像素區域
- D人臉辨識,識別煙霧來源
看正解與逐選項詳解
正解:C
當Transformer 模型發生「注意力分布過於平均(Attention Collapse)」的情形時,導致模型無法有效聚焦於關鍵資訊,下列哪一項策略可有效改善此問題?
- A提高Query-Key點積(Dot Product)的縮放常數
- B在Softmax 前加入高斯雜訊(Gaussian Noise)
- C使用 ReLU 函數取代 Softmax
- D對注意力權重施加稀疏化約束(Sparsity Constraint)
看正解與逐選項詳解
正解:D
某語音辨識系統開發團隊採用 Transformer 架構,為了讓模型能同時理解語音片段中的發音特徵、語速變化與語意脈絡等多層次資訊,團隊在設計中導入了多頭注意力(Multi-head Attention)機制。請問下列何者為此機制的主要優點?
- A減少模型參數量以降低訓練成本
- B加速整體注意力計算過程
- C從不同表示子空間(Representation Subspaces)同時捕捉多樣化關聯資訊
- D避免梯度消失(Gradient Vanishing)問題
看正解與逐選項詳解
正解:C
某工程師在分析 Transformer架構時,發現自注意力機制(Self-Attention)能夠有效提升模型對序列中長距離依賴關係的建模能力。請問 Self-Attention 的核心功能為何?
- A透過隱藏狀態的遞迴傳遞,逐步累積序列中的上下文資訊
- B讓序列中每個 token 能與其他所有 token建立關聯,並根據重要性分配權重
- C對輸入序列進行局部運算,以捕捉相鄰詞之間的關係
- D將整個序列壓縮為固定長度表示,以提供後續任務使用
看正解與逐選項詳解
正解:B
某工程師在撰寫 Transformer 的 Attention 層時,需手動驗證矩陣維度是否相容。輸入矩陣 Q 已攤平成形狀為 (1, 10),Query 投影權重矩陣 W 形狀為 (10, 64)。執行 Q × W 後輸出的形狀為何?
- A(1, 64)
- B(10, 10)
- C(64, 1)
- D維度不相容,無法相乘
看正解與逐選項詳解
正解:A