深度學習知識地圖 · NLP 與 LLM

注意力機制

Self-Attention

在互動地圖中開啟 回深度學習知識地圖

觀念教學

注意力機制讓模型在處理序列時能「聚焦」在重要資訊上,Self-Attention 是 Transformer 的核心。

白話說明
讀一句「小明把蘋果給了小華,他很開心」,「他」指的是誰?注意力機制會讓模型回頭看前面的詞,發現「他」跟「小華」的關聯最強。就像你讀文章時眼睛會自動跳回去看重點。

Self-Attention 怎麼算
每個詞產生三個向量:Query(我在找什麼)、Key(我是什麼)、Value(我的內容)。Q 和 K 配對算分數,分數高的 V 就被重點關注。

使用場景
幾乎所有現代 NLP/CV 模型的核心(Transformer、BERT、GPT、ViT)。

優點
能捕捉長距離依賴、可平行計算(比 RNN 快很多)。

缺點
計算量 O(N²),序列越長越吃記憶體(所以才需要 Flash Attention)。

應用場景

機器翻譯 (對齊)長文本理解圖像描述

評估指標

Attention Scores

iPAS 歷屆考題詳解(6 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第28題

對非常長的輸入序列進行推理(Inference)時,Transformer 模型推理的主要計算瓶頸通常是什麼?

  1. A模型輸出層產生文本的過程,因為每生成一個詞都必須重新訓練整個模型一次
  2. B詞嵌入(Embedding)查找操作,因為其時間複雜度隨詞彙表大小指數級增長
  3. CSoftmax 函數的計算,因為對每個 Token 都需要執行繁重的運算
  4. D自注意力層的計算和其記憶體使用,因為注意力矩陣的大小隨序列長度呈平方級增長
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 自注意力(Self-Attention)需計算 QKᵀ 注意力矩陣,序列長度為 N 時,矩陣大小為 N×N,時間與記憶體複雜度皆為 O(N²)。序列越長,注意力層的計算量與記憶體占用呈平方級成長,長序列推理時常導致記憶體不足或延遲大幅上升,是 Transformer 最主要的計算瓶頸;Flash Attention、稀疏注意力(Sparse Attention)、Longformer 等技術正是為緩解此問題而提出。 【為何其他選項錯了?】 - (A):推理是自迴歸的前向傳播過程,每步僅生成一個 token,完全不需要重新訓練模型;「重新訓練」混淆了推理與訓練階段。 - (B):詞嵌入查找是查表操作,成本近似常數時間,僅與詞彙表大小相關,與序列長度無關,更不會呈指數級增長。 - (C):Softmax 對注意力分數的計算為線性複雜度,真正繁重的是產生其輸入的 N×N 注意力矩陣;將 Softmax 視為主要瓶頸屬因果倒置。 提示:看到「長序列+Transformer 瓶頸」,直接對應自注意力的 O(N²) 時間與記憶體複雜度。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第32題

某環保局想建立 AI 系統監測空氣品質,透過分析監測站攝影機拍攝的影像來識別 煙霧。系統需要在影像中找出煙霧區域並標示其位置和範圍。這個應用主要屬於 電腦視覺的哪個技術領域?

  1. A影像分類,判斷影像中是否有煙霧
  2. B物件偵測,找出煙霧位置並用方框標示
  3. C影像分割,精確標示出煙霧的像素區域
  4. D人臉辨識,識別煙霧來源
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 電腦視覺對影像的理解有不同精細層次。影像分類(Image Classification)只回答整張影像「是否含有煙霧」;物件偵測(Object Detection)進一步以方框(Bounding Box)標出目標位置;影像分割(Image Segmentation)則做到像素級辨識,將屬於煙霧的每一個像素精確標示,形成貼合煙霧形狀的不規則區域。題幹要求「找出煙霧區域並標示其位置和範圍」,且煙霧屬於邊界不規則、形狀擴散的目標,像素級的影像分割能提供最精確的範圍標示,故 (C) 最符合。 【為何其他選項錯了?】 - (A):影像分類僅輸出整張影像的類別標籤(有煙或無煙),無法標示煙霧的位置與範圍。 - (B):物件偵測只能給出矩形方框,對煙霧這類形狀不規則、邊界模糊的目標,方框無法精確描述其實際範圍。 - (D):人臉辨識用於識別人物身分,與煙霧的偵測及範圍標示無關。 提示:分類回答「有沒有」,偵測給出「方框」,分割精確到「像素」;題幹要求精確範圍即指向影像分割。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第18題

當Transformer 模型發生「注意力分布過於平均(Attention Collapse)」的情形時,導致模型無法有效聚焦於關鍵資訊,下列哪一項策略可有效改善此問題?

  1. A提高Query-Key點積(Dot Product)的縮放常數
  2. B在Softmax 前加入高斯雜訊(Gaussian Noise)
  3. C使用 ReLU 函數取代 Softmax
  4. D對注意力權重施加稀疏化約束(Sparsity Constraint)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 注意力分布過於平均,代表 Softmax 之後的權重接近均勻分布,模型對各位置的關注度幾乎相同,等於失去聚焦能力。對注意力權重施加稀疏化約束(Sparsity Constraint),例如 Sparsemax、Entmax 或稀疏正則化項,可迫使大部分位置的權重趨近於零、僅保留少數關鍵位置的權重,直接針對「分布過平」的問題處理,使注意力重新集中於關鍵資訊。 【為何其他選項錯了?】 - (A):縮放點積注意力將 QK 點積除以縮放常數(根號 d);若再提高縮放常數,logits 數值變得更小,Softmax 輸出更趨平坦,注意力反而更平均,與目標相反。 - (B):在 Softmax 前加入高斯雜訊(Gaussian Noise)僅增加隨機性,無法保證權重集中,還可能使分布更混亂。 - (C):以 ReLU 取代 Softmax 會失去權重歸一化為機率分布的性質,且 ReLU 本身不具備使權重集中的機制,無法解決分布平均的問題。 提示:注意力過平的對策是稀疏化;提高縮放常數會使分布更平坦,方向相反,是本題主要陷阱。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第21題

某語音辨識系統開發團隊採用 Transformer 架構,為了讓模型能同時理解語音片段中的發音特徵、語速變化與語意脈絡等多層次資訊,團隊在設計中導入了多頭注意力(Multi-head Attention)機制。請問下列何者為此機制的主要優點?

  1. A減少模型參數量以降低訓練成本
  2. B加速整體注意力計算過程
  3. C從不同表示子空間(Representation Subspaces)同時捕捉多樣化關聯資訊
  4. D避免梯度消失(Gradient Vanishing)問題
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 多頭注意力(Multi-head Attention)將 Query、Key、Value 經由多組不同的線性投影,映射到多個表示子空間(Representation Subspaces),每個注意力頭在自己的子空間中獨立計算注意力,分別捕捉不同型態的關聯,例如語法結構、語意相關性、位置或韻律關係,最後再將各頭輸出串接整合。如此模型能同時從多個面向理解發音特徵、語速變化與語意脈絡等多層次資訊,正是題幹情境所需的效果。 【為何其他選項錯了?】 - (A):多頭注意力並不會減少參數量;多個頭的投影矩陣合計後,參數量與同維度的單頭注意力相當甚至更多。 - (B):多頭設計是將維度切分至各頭平行處理,總計算量與單頭相近,並非為了加速注意力計算。 - (D):緩解梯度消失(Gradient Vanishing)主要依靠殘差連接(Residual Connection)與層正規化(Layer Normalization),並非多頭注意力的作用。 提示:多頭注意力的關鍵詞是「多個表示子空間、多樣化關聯」;參數量、速度、梯度問題皆非其設計目的。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第11題

某工程師在分析 Transformer架構時,發現自注意力機制(Self-Attention)能夠有效提升模型對序列中長距離依賴關係的建模能力。請問 Self-Attention 的核心功能為何?

  1. A透過隱藏狀態的遞迴傳遞,逐步累積序列中的上下文資訊
  2. B讓序列中每個 token 能與其他所有 token建立關聯,並根據重要性分配權重
  3. C對輸入序列進行局部運算,以捕捉相鄰詞之間的關係
  4. D將整個序列壓縮為固定長度表示,以提供後續任務使用
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 自注意力(Self-Attention)為序列中每個 token 產生 Query、Key、Value 三組向量,以自身的 Q 與所有 token 的 K 計算相似度,經 Softmax 得到注意力權重後,對所有 V 加權求和。因此任兩個 token 之間的關聯都是一步直達,不論距離多遠皆可直接建立依賴並依重要性分配權重,這正是 Transformer 擅長建模長距離依賴、且可整序列平行計算的關鍵。 【為何其他選項錯了?】 - (A):依靠隱藏狀態遞迴傳遞、逐步累積上下文是 RNN、LSTM 的機制,長序列下有梯度消失與資訊衰減問題;自注意力的設計正是為了取代這種逐步傳遞。 - (C):以局部運算捕捉相鄰詞關係是 CNN 卷積的特性,感受野需靠疊層逐步擴大;自注意力天生具備全域視野。 - (D):將整個序列壓縮為固定長度向量是早期 Encoder-Decoder 架構的瓶頸設計;注意力機制的提出正是為了解決此資訊瓶頸,並非其核心功能。 提示:Self-Attention 的定義關鍵是「每個 token 與所有 token 建立加權關聯」;遞迴傳遞屬 RNN,局部運算屬 CNN。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第3題

某工程師在撰寫 Transformer 的 Attention 層時,需手動驗證矩陣維度是否相容。輸入矩陣 Q 已攤平成形狀為 (1, 10),Query 投影權重矩陣 W 形狀為 (10, 64)。執行 Q × W 後輸出的形狀為何?

  1. A(1, 64)
  2. B(10, 10)
  3. C(64, 1)
  4. D維度不相容,無法相乘
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 矩陣乘法 (m, n) × (n, k) 的相容條件是前者的行數等於後者的列數,輸出形狀為 (m, k)。本題 Q 形狀為 (1, 10),W 形狀為 (10, 64),內側維度 10 相等,故可相乘,輸出形狀為 (1, 64)。語意上即是將一個 token 的 10 維輸入向量,經線性投影轉換為 64 維的 Query 向量,正是 Attention 中 Q/K/V 投影層的運算。 【為何其他選項錯了?】 - (B):(10, 10) 是誤將兩個內側維度相乘;矩陣乘法的輸出取外側維度 (1, 64),內側維度在相乘過程中消去,不會保留在結果中。 - (C):(64, 1) 是正確答案的轉置,相當於計算 Wᵀ × Qᵀ;矩陣乘法不具交換律,順序與轉置皆不可任意調換。 - (D):內側維度一致(10 對 10)即可相乘;僅當內側維度不相等,例如 (1, 10) × (64, 10),才會發生維度不相容。 提示:記住 (m, n) × (n, k) = (m, k):內側維度須相等且會消去,輸出保留外側維度。

相關節點