深度學習知識地圖 · 基礎架構

激活函數

ReLU, Sigmoid

在互動地圖中開啟 回深度學習知識地圖

觀念教學

神經網路若只會加權求和,疊一百層也只是一條直線。激活函數(Activation Function)就是那個「掰彎」的動作:引入非線性,網路才能擬合複雜函數。

核心觀念

每個神經元加權求和後,要先經過一次非線性轉換,再把訊號傳給下一層。沒有它,多層網路在數學上會塌縮成單層線性模型;有了它,網路才有本錢學會影像、語言這種複雜規律。

白話理解

Sigmoid 像一支老舊水龍頭:輸入太大或太小都「轉不動」(兩端飽和),梯度趨近於零。深層網路一層層連乘下去,訊號越傳越弱,最後參數更新極小、訓練停滯 — 這就是梯度消失問題(Vanishing Gradient)。換成 ReLU,正區間暢通無阻,深網路才練得動。

三大主角與分工

  • ReLU:輸入小於零輸出零,大於零原樣放行;計算快、正區間梯度恆定,有效緩解梯度消失,是隱藏層預設款
  • Sigmoid:把數值壓進 0 到 1 之間,適合二元分類的輸出層(輸出可讀成機率);缺點是兩端飽和
  • Softmax:把一組分數轉成總和為 1 的機率分佈,多類別分類輸出層專用,例如影音平台預測使用者對各影片類型的偏好機率
  • 對付梯度消失的組合拳:改用 ReLU、搭配批次正規化(Batch Normalization)、加殘差連接
  • 梯度爆炸則用梯度裁剪(Gradient Clipping)壓制
🎯 口訣:隱藏靠 ReLU,二元 Sigmoid,多類 Softmax。

iPAS 考點

歷屆考三個方向。一、「輸出層需將結果轉為各類別的機率分佈」→ Softmax,關鍵字是機率分佈、多類別推薦。二、「訓練誤差長期不降、參數更新極小、與梯度傳遞效率有關」→ 梯度消失,改善策略選 ReLU 或批次正規化。三、「避免梯度消失或梯度爆炸、提升收斂速度與穩定性,最常用的做法」→ 同一組答案方向。防偷襲:題目若講「只有部分影像有標註」,那是半監督學習的範式題,和激活函數無關,別被神經網路場景騙走。

📝 本節掛載 4 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

應用場景

非線性映射神經元觸發控制

評估指標

梯度消失問題

iPAS 歷屆考題詳解(6 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第47題

在訓練神經網路時,為了提升模型收斂速度與穩定性,避免梯度消失或梯度爆炸,下列哪一種做法最常被使用?

  1. A對輸入資料進行隨機旋轉或水平翻轉,以增加資料多樣性
  2. B選用 ReLU 或其變體作為隱藏層的啟動函數,以改善梯度傳播
  3. C減少樣本量提升訓練速度
  4. D對目標變數或特徵進行標準化
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 梯度消失與梯度爆炸源於反向傳播時梯度逐層連乘:Sigmoid、Tanh 等飽和型激活函數的導數偏小(Sigmoid 導數最大僅 0.25),深層網路中梯度層層相乘後趨近於零,參數難以更新。改用 ReLU(Rectified Linear Unit)或其變體(如 Leaky ReLU)作為隱藏層激活函數,正區間導數恆為 1,梯度得以有效傳遞,可明顯提升收斂速度與訓練穩定性,是深度網路的標準做法。 【為何其他選項錯了?】 - (A):隨機旋轉與水平翻轉屬資料增強(Data Augmentation),目的是增加樣本多樣性以抑制過擬合,不改變梯度在網路中的傳遞特性,無法解決梯度消失或爆炸。 - (C):減少樣本量僅縮短訓練時間,反而使梯度估計的變異更大、訓練更不穩定,也會犧牲模型效能,與題目要求的收斂穩定性背道而馳。 - (D):標準化可使特徵尺度一致、有助於初期收斂,但屬輔助手段;梯度消失與爆炸的主因在於激活函數的飽和特性與網路深度,核心解法仍是更換激活函數。 提示:題幹關鍵詞「梯度消失或梯度爆炸」對應激活函數的選擇;資料增強處理過擬合,標準化僅是輔助措施。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第9題

某影音串流平台建立神經網路模型,用於預測使用者最可能感興趣的影片類型。 模型輸出層需將結果轉換為各類別的機率分佈,以便系統依機率高低推薦內容。 下列哪一種函數最適合用於模型輸出層?

  1. ASoftmax 函數(Softmax Function)
  2. BSigmoid 函數(Sigmoid Function)
  3. C線性函數(Linear Function)
  4. DReLU 函數(Rectified Linear Unit Function)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 題幹要求輸出層將結果轉換為「各類別的機率分布」,並依機率高低推薦內容。Softmax 函數(Softmax Function)專為多類別單選分類的輸出層設計:它將輸出層各神經元的分數轉換為 0~1 之間、總和為 1 的機率分布,可直接解讀為使用者對各影片類型感興趣的相對可能性,便於排序與推薦。 【名詞白話語典】 - Softmax 函數:神經網路輸出層常用函數,能將多個數值轉換為機率分布,且確保所有機率總和為 1。 【為何其他選項錯了?】 - (B):Sigmoid 函數將單一數值壓縮至 0 到 1 之間,主要用於二元分類;多個輸出彼此獨立、總和不保證為 1,無法構成題幹要求的機率分布。 - (C):線性函數輸出範圍沒有限制,數值可為負或大於 1,不具機率意義,通常用於迴歸任務的輸出層。 - (D):ReLU 函數是隱藏層常用的激活函數,將負值歸零、正值原樣輸出,輸出無上界,不適合在輸出層轉換機率。 提示:「多類別+機率總和為 1」對應 Softmax;二元分類輸出用 Sigmoid,迴歸輸出用線性函數。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第45題

某團隊訓練深層神經網路模型時,發現訓練誤差長時間幾乎未下降,模型參數更 新幅度極小,呈現學習停滯現象。若研判問題與梯度傳遞效率有關,下列何者最 適合的改善策略?

  1. A延長模型訓練時間,使模型有更多機會調整參數
  2. B增加訓練樣本數量,以提升模型學習能力
  3. C調整模型中的啟動函數設定,以改善訓練過程的穩定性
  4. D簡化模型結構,以降低模型過度擬合的可能性
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 訓練誤差長時間幾乎未下降、參數更新幅度極小,且研判與梯度傳遞效率有關,是典型的梯度消失(Vanishing Gradient)問題:Sigmoid 這類飽和型啟動函數在深層網路中導數趨近於零,反向傳播時梯度逐層衰減,淺層參數幾乎收不到有效的更新訊號,形成學習停滯。調整啟動函數設定,例如改用 ReLU 及其變體(Leaky ReLU、PReLU),能維持梯度的有效傳遞,改善訓練過程的穩定性,是針對病因的處置。 【為何其他選項錯了?】 - (A):梯度趨近於零時,參數更新近乎停滯,延長訓練時間只是重複無效的更新,無法恢復梯度訊號。 - (B):增加訓練樣本提升的是資料多樣性與泛化能力,並不改變梯度在網路內部的傳遞效率,無法解決學習停滯。 - (D):簡化模型結構是處理過擬合的手段;本題是參數「學不動」的優化問題,而非泛化問題,診斷方向不同。 提示:「誤差不降+更新幅度極小+梯度傳遞效率」三個線索指向梯度消失,對策是調整啟動函數,而非增加資料或訓練時間。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第31題

某農場收集了大量作物葉片影像,但只有30%的影像有病害類別標註,其餘70% 的影像沒有任何標籤。農場希望充分利用所有資料來訓練病害識別模型。這種情 況最適合使用哪一種學習方法?

  1. A半監督式學習(Semi-supervised Learning)
  2. B監督式學習(Supervised Learning)
  3. C非監督式學習(Unsupervised Learning)
  4. D強化式學習(Reinforcement Learning)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 題幹資料為 30% 有病害標註、70% 無標籤,且希望「充分利用所有資料」。半監督式學習(Semi-supervised Learning)正是為此情境設計:先以少量有標籤資料建立基礎模型,再利用大量無標籤資料學習整體資料的結構與分布(例如偽標籤、一致性正則化等技術),同時發揮兩類資料的價值。在標註成本高、無標籤資料充足的實務場景,半監督式學習是標準選擇。 【名詞白話語典】 - 半監督式學習(Semi-supervised Learning):訓練資料中同時包含有標籤與無標籤樣本的學習方法,介於監督式與非監督式學習之間。 【為何其他選項錯了?】 - (B):監督式學習只能使用 30% 有標籤影像,其餘 70% 無標籤資料被閒置,不符合「充分利用所有資料」的要求。 - (C):非監督式學習完全不使用標籤,等於放棄既有 30% 的病害類別標註資訊,無法直接訓練出病害分類模型。 - (D):強化式學習依賴代理人與環境互動的獎勵機制,適用於序列決策問題,與本題的影像標註資料利用情境不符。 提示:「部分有標籤+大量無標籤+全部都要用」即半監督式學習;全有標籤為監督式,全無標籤為非監督式。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第27題

某智慧製造團隊在開發瑕疵影像檢測模型時,發現使用線性激活函數(Activation Function)後,模型的訓練準確率長期停滯,懷疑模型無法學習到足夠複雜的特徵表達。若要改善此問題,下列哪一項調整方案最為合適?

  1. A增加卷積層(Convolutional Layer)數量,使網路更深以強化特徵提取
  2. B將輸入影像先進行灰階化處理,降低運算量
  3. C使用Sigmoid 激活函數,以將輸出壓縮至[0,1]範圍;
  4. D改用ReLU(Rectified Linear Unit)激活函數,以引入非線性並提升模型表達能力
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 若每一層都使用線性激活函數,無論疊多少層,整個網路在數學上都等價於「單一層線性轉換」(線性函數的組合仍是線性),永遠學不到複雜的非線性特徵表達——這正是題目中訓練準確率長期停滯的根源。改用 ReLU(f(x)=max(0,x))引入非線性,深度網路才能真正發揮逐層組合特徵的能力;且 ReLU 在正區間梯度恆為 1,不易飽和、收斂快,是 CNN 的主流選擇。 【為何其他選項錯了?】 - (A):激活函數仍是線性的話,增加再多卷積層,整體依舊等價於一個線性映射,加深沒有實質效果。 - (B):灰階化只是減少輸入通道、降低運算量,完全不解決「模型缺乏非線性表達能力」的根本問題。 - (C):Sigmoid 雖然是非線性,但兩端飽和使深層網路容易梯度消失;且此選項所給理由(把輸出壓縮到 [0,1])與題幹的特徵表達力問題無關。 提示:線性函數疊加任意多層仍是線性;引入 ReLU 等非線性激活,網路深度才有意義。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第12題

某工程師在設計一個二元分類器(Binary Classifier)時,考慮在輸出層使用Sigmoid函數。請問 Sigmoid 函數的主要特性與限制為何?

  1. A可將輸入轉換為任意實數範圍,適合用於迴歸任務
  2. B可將輸入壓縮至(0, 1)區間,可解釋為機率值,但在輸入值過大或過小時可能產生梯度消失問題
  3. C可將輸入轉換為多類別機率分布,常用於多分類任務
  4. D可在整個輸入範圍內梯度保持穩定,適合用於深層神經網路
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 Sigmoid 函數 σ(x)=1/(1+e^-x) 把任意實數壓縮到 (0,1) 區間,輸出天然可解讀為「屬於正類的機率」,因此是二元分類輸出層的經典選擇,通常搭配二元交叉熵損失使用。其限制同樣明確:當輸入絕對值很大時函數進入飽和區,導數趨近於 0(導數最大值僅 0.25),反向傳播時梯度層層相乘後迅速縮小,造成梯度消失(Vanishing Gradient),這也是深層網路的隱藏層改用 ReLU 家族的主要原因。 【為何其他選項錯了?】 - (A):Sigmoid 輸出被限制在 (0,1),不是任意實數範圍;迴歸任務的輸出層通常使用線性輸出(不加激活函數)。 - (C):把輸出轉成多類別機率分布是 Softmax 的功能,單一 Sigmoid 僅輸出一個二元機率。 - (D):「整個輸入範圍梯度穩定」正是 Sigmoid 做不到的:兩端飽和是其固有限制,深層網路的隱藏層因此多改用 ReLU 及其變體。 提示:Sigmoid 壓縮輸出至 (0,1) 可作機率,但兩端飽和易梯度消失:適合二元分類輸出層,不適合深層隱藏層。

相關節點