AI 方法論知識地圖 · 模型開發

模型訓練與調參

訓練、正則化、調參

在互動地圖中開啟 回AI 方法論知識地圖

觀念教學

訓練模型像調吉他:弦太鬆走音(欠擬合),太緊會斷(過擬合)— 這一站所有技術,都在找那個剛剛好。

核心觀念

模型訓練與調參涵蓋:選擇演算法、訓練模型、處理過擬合、超參數調整。主軸是偏差與變異權衡(Bias-Variance Tradeoff):高偏差(Bias)代表模型太簡單導致欠擬合;高變異(Variance)代表模型太複雜導致過擬合。總誤差 = 偏差的平方 + 變異 + 不可約誤差,目標是找到讓總誤差最小的複雜度平衡點。

白話理解

盯著兩條曲線:訓練誤差低、驗證誤差高 → 過擬合(背題);兩個都高 → 欠擬合(沒學會)。兩者的差距就是泛化誤差的訊號,調參就是拿這個儀表板決定加藥或減藥。

工具箱

  • 正則化(Regularization):L1 讓權重稀疏、L2 平滑縮小權重,懲罰過大參數
  • Early Stopping:驗證誤差開始回升就停止訓練
  • Dropout:隨機關掉神經元,防止依賴單一路徑
  • Batch Normalization:標準化各層輸入分布 — 損失震盪大、批次間學習方向不穩時加它,訓練更穩、收斂更快
  • 超參數搜尋:Grid Search 地毯式全掃、Random Search 隨機抽樣更適合高維、Bayesian Search 用前次結果聰明選下一組
  • AutoML:把特徵處理、選模、調參自動化,讓非技術團隊不依賴 IT 也能快速建模
🎯 口訣:高偏差 = 太笨(欠擬合),高變異 = 太貪(過擬合);訓練驗證兩條線,張開嘴就是過擬合。

iPAS 考點

五個真題方向:「偏差與變異權衡」解的是模型複雜度與泛化能力的平衡問題;微調(Fine-tuning)出現災難性遺忘(Catastrophic Forgetting)→ 學會新任務、卻喪失原任務能力;產線瑕疵辨識訓練損失震盪、批次間方向不穩 → 加 Batch Normalization 穩定各層輸入分布;行銷部門想不依賴 IT 快速建情緒分類系統 → AutoML 的核心價值是自動化與低門檻;同節點群也考過基礎演算法:已排序陣列找目標值用二分搜尋,每輪取中間值比較、範圍砍半,照 low 與 high 追蹤比較順序即可作答。

📝 本節掛載 5 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

應用場景

偏差-變異權衡正則化 (L1/L2)Early StoppingDropoutGrid SearchRandom SearchBayesian Optimization交叉驗證學習曲線分析

評估指標

訓練誤差驗證誤差泛化誤差偏差變異

iPAS 歷屆考題詳解(21 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第5題

在機器學習中,「偏差與變異權衡(Bias-Variance Tradeoff)」主要用來解決下列哪一類型的問題?

  1. A因資料來源或收集方式限制,導致模型學習到的資訊不足
  2. B測試資料樣本與訓練資料高度重複,造成模型泛化能力評估失準
  3. C訓練資料中類別分布不均,使模型在少數類別上表現不佳
  4. D如何在模型偏差與變異之間取得平衡,以避免過度擬合或欠擬合
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 偏差與變異權衡(Bias-Variance Tradeoff)描述模型複雜度與泛化誤差之間的關係:偏差(Bias)過高代表模型過於簡單、無法捕捉資料規律,導致欠擬合(Underfitting);變異(Variance)過高代表模型過於複雜,連訓練資料的雜訊都一併學入,導致過擬合(Overfitting)。總誤差可拆解為偏差平方、變異與不可避免誤差之和,權衡的目標是找到使總誤差最小的模型複雜度。實務上常以正則化、早期停止、Dropout 與集成學習等手段調整此平衡,故 (D) 正確。 【為何其他選項錯了?】 - (A):資料來源或收集方式受限屬於資料品質與資料量的問題;它可能是欠擬合的成因之一,但偏差與變異權衡處理的是模型複雜度的取捨,而非資料收集策略。 - (B):測試資料與訓練資料高度重複屬於資料洩漏(Data Leakage)或測試集污染,是評估流程設計的缺失,不在偏差與變異權衡的範疇。 - (C):類別分布不均是類別不平衡(Class Imbalance)問題,對應解法為過採樣、欠採樣、加權損失函數等,並非偏差與變異權衡所要解決的對象。 提示:題幹出現「過度擬合與欠擬合之間的平衡」即對應偏差與變異權衡;資料重複是洩漏問題,類別不均是不平衡問題,各有專屬處理方法。
第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第26題

在深度學習模型的微調(Fine-tuning)過程中,可能出現所謂的「災難性遺忘(Catastrophic Forgetting)」。此現象最可能造成哪種情況?

  1. A由於計算資源或訓練步驟不足,模型在微調過程中無法完整收斂,導致學習效果受限
  2. B微調後模型的表現變得隨機,無法有效記憶新學到的模式與知識
  3. C微調後模型的部分權重產生偏移,導致模型無法針對較長的文字進行回應
  4. D模型過度適應微調的資料分佈,逐漸遺忘先前預訓練所獲得的廣泛知識,在原有任務或廣泛領域上表現變差
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 災難性遺忘(Catastrophic Forgetting)指神經網路在學習新任務時,權重被新資料的梯度大幅覆寫,導致先前學到的知識遭到破壞。在微調(Fine-tuning)情境中,模型過度適應微調資料的分佈,逐漸喪失預訓練階段獲得的廣泛知識,於原有任務或一般領域的表現明顯退化,此即 (D) 的描述。實務上常以 LoRA 等參數高效微調(PEFT)、經驗重播(Replay)、彈性權重鞏固(Elastic Weight Consolidation)等方法降低遺忘程度。 【為何其他選項錯了?】 - (A):計算資源或訓練步驟不足造成的是收斂不完全、新任務學習效果受限,屬於訓練不足的問題;災難性遺忘的重點是新知識覆寫舊知識,兩者機制不同。 - (B):表現變得隨機、無法記憶「新」學到的模式,方向與災難性遺忘相反;此現象的本質是新任務學會了,但舊知識流失。 - (C):無法回應較長文字牽涉上下文長度限制或注意力機制設計,與微調造成的知識遺忘無關;權重在微調中本來就會調整,不必然導致長文處理能力喪失。 提示:災難性遺忘的關鍵是「學新忘舊」;學不會新任務是訓練不足,處理不了長文是上下文長度問題,不可混淆。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第18題

某電商平台工程師需在已排序的價格清單中,快速定位指定價格是否存在,給定 排序後陣列:arr = [3, 8, 14, 19, 21, 27, 33, 45, 52]。若搜尋目標值為27,且採用標 準二分搜尋(Binary Search)流程(每次比較後排除中位數),請問最多需要比較 幾次即可找到目標?

  1. A2次
  2. B3次
  3. C4次
  4. D5次
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 二分搜尋(Binary Search)在已排序的陣列中,每次取中間元素與目標比較,依比較結果排除一半的搜尋範圍。以陣列 [3, 8, 14, 19, 21, 27, 33, 45, 52](共 9 個元素)搜尋 27 的流程如下。第一次比較:中間元素為 21,27 大於 21,排除左半部與 21,剩下 [27, 33, 45, 52]。第二次比較:取中間元素 33,27 小於 33,排除 33 與其右側,剩下 [27]。第三次比較:僅剩的元素 27 與目標相等,搜尋完成。共需 3 次比較,故 (B) 正確。 【為何其他選項錯了?】 - (A):前兩次比較分別命中 21 與 33,皆非目標;此時範圍雖已縮小至 [27],但尚未與 27 本身比較,無法在 2 次內確認找到。 - (C):標準流程在第三次比較即命中目標並結束,不需要第 4 次;4 次是此長度陣列在最不利情況下的比較上限,並非本題目標值的實際次數。 - (D):9 個元素的二分搜尋每次比較後排除約一半範圍,所需次數約為 log2(n) 的量級,5 次已超出任何情況所需。 提示:二分搜尋每次比較後排除一半範圍,比較次數約為 log2(n);依中位數比較流程逐步模擬即可得出答案。
115年第二次初級AI應用規劃師第一科人工智慧基礎概論 第28題

某AI 團隊正在訓練一個深度神經網路,用於辨識工廠產線上的瑕疵零件。工程師發現訓練過程中損失函數震盪幅度大,且不同批次資料造成模型學習方向不穩定。為改善此問題,團隊在各隱藏層加入Batch Normalization 機制。請問此調整在訓練階段最主要的作用為何?

  1. A將輸入影像標準化,使不同類別的特徵分布更加一致;
  2. B自動調整模型權重初始化方式,以避免訓練初期震盪;
  3. C增加模型隱藏層的非線性能力,以提升分類精度上限;
  4. D降低不同批次輸入造成的內部特徵分布變動,使梯度更新更穩定
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 Batch Normalization 在訓練階段對每個批次的隱藏層中間輸出進行正規化:減去批次均值、除以批次標準差,再套用可學習的縮放與平移參數。此機制降低不同批次輸入造成的內部特徵分布變動,使梯度更新方向較為一致、訓練過程更穩定,並可加速收斂。題幹描述損失震盪幅度大、不同批次造成學習方向不穩,正是 Batch Normalization 所要緩解的問題,故 (D) 正確。 【為何其他選項錯了?】 - (A):Batch Normalization 作用於各隱藏層的中間輸出,而非僅將原始輸入影像標準化;輸入標準化屬於資料前處理範疇。 - (B):它不改變權重初始化方式;其機制是正規化批次特徵分布,與初始化策略是不同層面的設計。 - (C):非線性能力主要來自激活函數;Batch Normalization 的目的在於穩定分布與梯度,並非增加模型的非線性表達能力。 提示:題幹出現「批次間分布變動、梯度更新不穩」即對應 Batch Normalization 穩定中間特徵分布的作用。
115年第二次初級AI應用規劃師第二科生成式AI應用與規劃 第11題

某中小企業行銷部門主管希望在不需高度依賴IT 支援的情況下,快速建立一套能自動分析顧客問卷回饋並進行情緒分類的系統。他評估了AutoML 平台與自行開發機器學習模型兩種方案。下列何者最能說明AutoML 在此情境下的核心優勢?

  1. AAutoML 仍需使用者熟悉Python 與深度學習框架,否則無法進行模型訓練;
  2. BAutoML 可自動完成模型選擇、特徵處理與訓練流程,使非技術背景人員也能快速建立並上線模型;
  3. CAutoML 僅適用於文字情緒分析,若應用於其他預測任務需重新開發系統;
  4. DAutoML 產出的模型無法直接應用於實務場景,仍需完全重寫程式才能使用
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 AutoML 的核心價值在於將模型選擇、特徵處理、超參數調整與訓練流程自動化,部分平台亦涵蓋部署環節,使非技術背景人員能以較低門檻快速建立並上線模型。題幹的行銷部門主管希望在不高度依賴 IT 支援下,快速建立問卷情緒分類系統,AutoML 正可降低對機器學習專家與工程資源的依賴,故 (B) 最能說明其核心優勢。 【為何其他選項錯了?】 - (A):AutoML 的設計目的正是降低 Python 與深度學習框架的技術門檻,並非要求使用者必須熟悉這些工具;此敘述與 AutoML 的定位相反。 - (C):AutoML 是通用建模工具,適用於分類、迴歸、時間序列預測等多種任務,並非僅限文字情緒分析。 - (D):AutoML 產出的模型通常可直接部署或匯出使用,不需要完全重寫程式;此敘述否定了 AutoML 的實用價值,與事實不符。 提示:AutoML 的關鍵字是「自動化建模流程、降低專業門檻」;描述其門檻高、用途窄、成果不可用的選項皆與其定位矛盾。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第9題

某企業在訓練生成式 AI模型時,導入資料增強(Data Augmentation)技術以擴充訓練資料,但觀察到模型效能反而下降。下列哪一項最可能的原因與對應改善策略最為正確?

  1. A增強樣本未經隨機初始化,導致模型梯度更新不穩定,應重新設計訓練啟動流程
  2. B增強後資料的特徵分佈與原始資料不一致,影響模型的泛化能力,應檢查並調整增強策略以維持語意一致性
  3. C增強樣本的比例過高,造成模型對特定資料產生偏好,應適度提高增強比例並調整學習率
  4. D增強後資料的標註可信度下降,導致訓練訊號偏差,應以半監督學習方式重新校正資料
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 資料增強(Data Augmentation)的前提是增強後樣本仍屬於原始資料的分佈,語意與標籤維持不變。若增強策略過於激進,例如過度裁切、雜訊過強或改寫至語意變質,增強資料的特徵分佈會偏離真實分佈,模型學到的是失真樣本的規律,在真實測試資料上的效能反而下降。正確的改善方向是檢查增強前後的分佈一致性,調整增強種類與強度,維持語意一致,故 (B) 的原因診斷與對策皆正確。 【為何其他選項錯了?】 - (A):隨機初始化是權重層面的概念,資料樣本並無初始化的問題;此選項將資料處理與權重初始化混為一談,診斷不成立。 - (C):敘述前後矛盾:既診斷增強樣本比例過高造成偏好,改善策略卻是再提高增強比例,會使問題加劇而非緩解。 - (D):多數增強手法(旋轉、翻轉、同義改寫)沿用原標籤,標註可信度下降並非效能下降的典型主因;以半監督學習重新校正亦非對應此問題的處置。 提示:判斷增強策略是否失當,先檢查增強樣本與原始資料的分佈與語意一致性;選項內部邏輯矛盾者可直接排除。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第36題

某資料科學團隊在開發預測模型時,針對多種模型設定(如學習率、樹深度、正則化係數等)進行系統化測試,希望找出在驗證資料上表現最穩定的組合。此過程最可能採用下列哪一種方法?

  1. A使用交叉驗證(Cross Validation)反覆評估模型以降低過擬合風險
  2. B透過網格搜尋(Grid Search)在多組超參數設定中進行系統化搜尋與評估
  3. C以隨機搜尋(Random Search)快速探索部分參數空間以提升搜尋效率
  4. D採用貝葉斯優化(Bayesian Optimization)根據歷次結果動態調整搜尋方向
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 題幹關鍵是「針對多種模型設定進行系統化測試」。網格搜尋(Grid Search)將每個超參數的候選值列成清單,窮舉所有組合逐一訓練與評估,正是系統化搜尋與評估的定義;它保證涵蓋整個預先定義的參數網格,適合在多組設定中找出驗證表現最穩定組合的情境。實務上常與交叉驗證結合為 GridSearchCV,以網格搜尋列舉組合、以交叉驗證評估每組表現。 【為何其他選項錯了?】 - (A):交叉驗證(Cross Validation)是評估「單一組設定」表現好壞的方法,常與網格搜尋搭配使用,但其本身不負責在多組超參數之間進行搜尋。 - (C):隨機搜尋(Random Search)在參數空間中隨機抽樣,以抽樣效率換取覆蓋完整性,不符合題幹「系統化」窮舉的描述。 - (D):貝葉斯優化(Bayesian Optimization)依據歷次結果動態決定下一組嘗試點,屬於自適應搜尋策略,同樣不是題幹描述的系統化逐一測試。 提示:「系統化窮舉所有組合」對應網格搜尋;「隨機抽樣」對應隨機搜尋;「依歷史結果調整方向」對應貝葉斯優化;「評估單組設定」對應交叉驗證。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第37題

某公司正在訓練一個大型語音合成模型,開發團隊使用多台 GPU 進行訓練,但經常出現 GPU 記憶體不足問題。由於模型架構已固定且無法更換硬體,團隊希望在維持模型效能與收斂品質的前提下,下列哪一種方法最有效降低單張 GPU 的記憶體壓力?

  1. A減少訓練資料量以降低記憶體使用
  2. B採用較小的批次大小(Batch Size)並搭配資料分片(Data Sharding)分散訓練負載
  3. C增加學習率(Learning Rate)以加快收斂速度
  4. D改用測試資料集(Test Set)進行部分訓練以節省空間
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 GPU 記憶體的主要占用來自模型參數、梯度、優化器狀態與激活值,其中激活值的大小與批次大小(Batch Size)成正比。縮小批次可立即降低單卡的記憶體壓力;搭配資料分片(Data Sharding)將資料切分至多卡分散訓練負載,必要時再配合梯度累積(Gradient Accumulation)維持等效批次大小,即可在不更動模型架構與硬體的前提下,兼顧記憶體限制與收斂品質,故 (B) 為最有效的做法。 【為何其他選項錯了?】 - (A):減少訓練資料量降低的是總訓練時間與儲存需求;單一訓練步驟的記憶體占用主要取決於批次大小與模型規模,縮減資料還會犧牲模型效能。 - (C):學習率影響收斂速度與穩定性,與記憶體占用無關;學習率過大反而可能使訓練發散。 - (D):以測試資料集參與訓練會造成資料洩漏,使最終評估失去效力,且節省的記憶體極為有限,是評估流程上不可接受的做法。 提示:單卡記憶體不足的標準處置:縮小批次、資料分片,再以梯度累積補回等效批次大小。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第10題

下列哪一種應用情境最適合導入 AutoML,以提升模型開發效率?

  1. A公司已有完整的 MLOps 平台與資深資料科學團隊,模型更新採固定流程
  2. B製造部門的生產良率模型已長期穩定運作,只需定期調整參數
  3. C行銷部門希望在短時間內比較多種顧客流失預測模型,缺乏專職工程師與時間進行手動建模
  4. D財務部門正在開發高度客製化的信用風險評估模型,需要精細控制特徵工程與演算法細節
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 AutoML 的價值在於自動化特徵處理、模型選擇與超參數調整,讓缺乏專職資料科學人力的團隊能在短時間內比較多種模型並快速產出可用結果。行銷部門的情境同時具備「時間有限」「缺乏專職工程師」「需比較多種顧客流失預測模型」三項條件,正是 AutoML 最能發揮效益的適用場景,故 (C) 正確。 【為何其他選項錯了?】 - (A):已有完整 MLOps 平台與資深團隊,且模型更新採固定流程,自建管線在掌控度與客製性上更佳,導入 AutoML 的邊際效益有限。 - (B):模型已長期穩定運作、僅需定期調整參數,維運需求單純,導入 AutoML 重建整套流程並無必要。 - (D):高度客製化的信用風險模型需要精細控制特徵工程與演算法細節,且金融監理重視可解釋性,AutoML 的自動化流程難以提供足夠的控制粒度與透明度。 提示:AutoML 適用於「人力少、時間短、需快速比較多模型」的情境;需要精細控制或已有成熟管線時,導入效益有限。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第11題

相較於Grid Search,Random Search 在超參數調整上具備哪一項主要優勢?

  1. A可自動產生模型架構
  2. B可使用更大的訓練集
  3. C避免模型過擬合
  4. D能更有效率搜尋高維參數空間
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 Grid Search 對每個超參數取固定格點,組合數隨參數維度呈指數成長;且若部分超參數對效能影響不大,網格仍會在這些維度上重複大量嘗試,造成運算浪費。Random Search 改為在參數空間隨機取樣,在相同運算預算下,能在真正重要的超參數維度上探索更多不同取值(Bergstra 與 Bengio 的經典研究結論),因此在高維參數空間中的搜尋效率更高,故 (D) 正確。 【為何其他選項錯了?】 - (A):自動產生模型架構屬於神經架構搜尋(Neural Architecture Search, NAS)的範疇;Random Search 僅是超參數取樣策略,不涉及架構生成。 - (B):搜尋策略與可使用的訓練集大小無關,兩者是互相獨立的設計決策。 - (C):Random Search 與 Grid Search 皆僅為超參數搜尋方式,本身不具防止過擬合的功能;防過擬合須依靠正則化、早期停止等手段。 提示:參數維度高時,網格組合數呈指數成長;隨機搜尋以相同預算涵蓋更多重要維度的取值,是其主要優勢。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第12題

某智慧製造公司開發一套設備故障預測系統,利用感測器資料訓練深度神經網路(Deep Neural Network, DNN)模型,以提前偵測異常運作跡象。在訓練過程中,團隊發現模型收斂速度不穩定:有時過快導致過擬合,有時又遲遲無法達到最佳準確率。開發團隊可以藉由調整下列哪一項超參數(Hyperparameter)以改善此問題?

  1. A每個神經元的輸出結果
  2. B損失函數(Loss Function)在訓練過程中的梯度變化值(Gradient)
  3. C學習率(Learning Rate),控制模型權重更新的速度
  4. D模型在訓練後產生的權重值
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 學習率(Learning Rate)是控制每次權重更新步伐大小的超參數:設定過大時損失震盪、收斂過快甚至發散,容易造成不穩定或過擬合;設定過小時收斂緩慢,遲遲無法達到理想準確率。題幹描述「收斂有時過快、有時遲遲無法達到最佳準確率」,最直接對應的調整對象即為學習率;實務上亦常搭配學習率排程(Learning Rate Scheduling)或 Adam 等自適應優化器改善收斂穩定性。 【為何其他選項錯了?】 - (A):神經元的輸出是前向傳播的計算結果,由權重與輸入決定,並非可事先設定的超參數。 - (B):梯度是訓練過程中由損失函數反向傳播計算而得的數值,同樣不是人為設定的超參數。 - (D):訓練後產生的權重是模型學到的參數;參數由訓練決定,超參數由人在訓練前設定,兩者不可混淆。 提示:超參數是訓練前設定的(學習率、批次大小、層數);參數是訓練中學得的(權重、偏差);收斂速度問題優先檢查學習率。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第26題

在防止監督式學習模型過擬合(Overfitting)時,下列哪一種策略不屬於降低模型複雜度或限制學習能力的作法?

  1. A採用L1或L2 正則化
  2. B在訓練過程中使用 Dropout 技術
  3. C採取早期停止(Early Stopping)機制
  4. D擴增輸入特徵變數以提升模型表達能力
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 防止過擬合的策略核心是限制模型的有效複雜度或學習能力;擴增輸入特徵變數則是提升模型的表達能力、擴大假設空間,方向完全相反。特徵增加後若無相應的正則化與更多資料支撐,模型反而更容易過擬合。因此 (D) 不屬於降低複雜度或限制學習能力的作法,為本題答案。 【為何其他選項錯了?】 - (A):L1 與 L2 正則化在損失函數中加入權重懲罰項,壓抑係數大小(L1 並可將係數壓至零),直接限制模型複雜度,屬於題幹所述的作法。 - (B):Dropout 在訓練時隨機關閉部分神經元,防止神經元之間過度共適應,等效於限制網路的有效容量,同屬限制複雜度的作法。 - (C):早期停止(Early Stopping)在驗證表現開始惡化前結束訓練,限制模型過度擬合訓練資料的機會,屬於隱式正則化,亦為限制學習能力的作法。 提示:防過擬合的手段多為限制與刪減(懲罰項、隨機丟棄、提前停止);增加特徵或參數屬於提升複雜度,方向相反。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第31題

某能源公司利用歷史氣象與用電資料,開發長期電力需求預測模型,採用深度神經網路架構進行訓練。在訓練過程中,模型在訓練集上的損失值持續下降,但在驗證集上,損失在第 80輪後開始波動,呈現週期性上升與下降。團隊懷疑模型受到季節性資料波動與隨機噪音影響,導致驗證損失難以穩定收斂。若要在此情境下合理運用早期停止法(Early Stopping)以確保模型具最佳泛化能力,下列哪一項策略最為適當?

  1. A直接根據訓練集損失最低點停止訓練,以確保模型充分擬合所有樣本
  2. B監控驗證集損失並設定適度的耐心值(Patience),在連續多輪未改善後再停止訓練
  3. C改以測試集損失作為早停依據,以提升模型最終評估一致性
  4. D將所有資料重新合併後訓練至收斂,避免因資料分割導致評估波動
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 驗證損失受季節性波動與隨機噪音影響而週期性起伏時,若以「一出現惡化即停止」為準則,容易被單次波動誤導而過早停止訓練。合理作法是監控驗證集損失並設定適度的耐心值(Patience),連續多輪未見改善才觸發停止,並保留驗證損失最佳時刻的模型權重。如此既能避免過擬合,也不會因短期噪音提前終止,在波動環境下確保最佳泛化能力,故 (B) 最為適當。 【為何其他選項錯了?】 - (A):以訓練集損失最低點作為停止準則,等同於訓練至過擬合為止,違背早期停止保護泛化能力的目的。 - (C):測試集僅供最終評估;以測試集損失決定停止時機,等於將測試資訊洩漏進訓練流程,最終評估將失去公信力。 - (D):將全部資料合併訓練即失去驗證集,無從判斷停止時機,只能訓練至收斂,過擬合風險反而更高。 提示:早期停止三要素:監控驗證集、設定耐心值、保留最佳權重;測試集只在最終評估時使用一次。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第39題

以下程式碼實作了神經網路的一項訓練技巧: def forward(x, p, training=True):  if training:   mask = np.random.binomial(1, p, size=x.shape)   return x * mask / p  else:   return x 請問此程式碼實現的是哪一種正則化技術?

  1. AL1正則化
  2. BL2正則化
  3. CDropout
  4. DBatch Normalization
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 程式碼具備三項關鍵特徵:第一,np.random.binomial(1, p) 產生 0 與 1 的隨機遮罩,等同隨機關閉部分神經元輸出;第二,除以 p 是 Inverted Dropout 的縮放補償,使訓練期輸出的期望值與推論期一致;第三,training=False 時直接原樣回傳輸入,訓練與推論行為不同。三者合併即為 Dropout 的標準實作:訓練時隨機丟棄神經元,防止神經元間過度共適應,達到抑制過擬合的效果。 【為何其他選項錯了?】 - (A):L1 正則化是在損失函數加入權重絕對值懲罰項,作用對象是權重,不會對輸出乘上隨機遮罩。 - (B):L2 正則化是加入權重平方懲罰項;程式碼中並無任何懲罰項的計算。 - (D):Batch Normalization 對每個批次做減均值、除標準差的正規化,並帶有可學習的縮放與平移參數,沒有隨機丟棄的機制。 提示:隨機 0/1 遮罩、除以保留率、訓練與推論行為不同,三項特徵合併即可辨識為 Dropout 實作。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第34題

某廣告技術公司的點擊率(CTR)預測系統每天新增數百個用戶行為特徵(如新廣告位、新設備類型),特徵空間持續動態擴展。若採用傳統靜態模型每週批次重訓一次,會導致嚴重的模型過期問題。為在特徵空間頻繁變化的情況下維持模型即時準確度,最適合的模型架構方向為何?

  1. A採用傳統靜態羅吉斯迴歸(Logistic Regression),縮短批次重訓週期從每週改為每日
  2. B採用支援增量學習(Incremental Learning)的模型,使模型能隨新資料即時更新並適應新增特徵,而不需重新訓練整個模型
  3. C採用固定架構的深度神經網路(DNN),每次有新特徵時重新定義輸入層後全量重訓
  4. D改用預訓練圖神經網路(GNN),透過圖結構建立特徵間的關聯,自動應對新增特徵
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 題幹的問題是特徵空間每日新增數百個特徵,靜態模型每週批次重訓,導致模型持續過期。增量學習(Incremental Learning,亦稱線上學習 Online Learning)讓模型隨新資料流持續更新參數,並可支援動態擴展的特徵空間(廣告點擊率預測領域常見如 FTRL 演算法搭配特徵雜湊),不需每次全量重訓即可納入新特徵,同時兼顧即時準確度與運算成本,正符合題目「特徵頻繁變化下維持模型即時準確度」的要求。 【為何其他選項錯了?】 - (A):將重訓週期由每週縮短為每日,模型本質仍是靜態快照;面對每日新增數百個特徵,模型在重訓間隔內依然無法辨識新特徵,過期問題未獲解決。 - (C):固定架構 DNN 每逢新特徵即重新定義輸入層並全量重訓,計算成本極高且維運負擔沉重,無法應付高頻率的特徵變動。 - (D):GNN 不會自動應對新增特徵,圖結構與節點特徵仍需重建與再訓練;且題幹痛點是特徵空間的動態擴展,並非特徵間關聯的建模需求。 提示:特徵持續新增且資料持續流入時,對應增量學習或線上學習;批次重訓無論週期多短,本質上仍是靜態模型。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第15題

某資料工程師在建構大規模影像資料處理流程時,需要處理數千萬筆訓練影像,並發現模型出現嚴重的過度擬合(Overfitting):訓練集準確率達 99%,但驗證集僅有 72%。在不改變模型架構的前提下,下列哪一項「資料處理層面」的調整最無法有效改善過度擬合,甚至可能使問題惡化?

  1. A在資料處理流程中加入資料增強(Data Augmentation),於訓練時動態生成多樣化影像樣本
  2. B擴充資料來源,收集更多不同場景與條件的影像,以提升訓練資料分布的多樣性
  3. C為了提升資料處理吞吐量(Throughput),預先將影像轉為固定特徵並快取(Cache),反覆使用相同訓練資料以加速訓練流程
  4. D在資料前處理階段進行資料清理,移除標註錯誤或品質不佳的影像資料
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 從資料處理層面改善過度擬合,核心是增加訓練資料的多樣性,降低模型記憶固定樣本的機會。選項 (C) 反其道而行:將影像預先轉為固定特徵並快取後,每個訓練週期反覆使用完全相同的資料,等於關閉了資料增強等隨機變化,模型更容易記憶這批固定樣本。此做法雖提升吞吐量,卻無助於改善過度擬合,甚至可能使其惡化,故為本題所問的選項。 【為何其他選項錯了?】 - (A):資料增強在訓練時動態產生翻轉、裁切、色彩擾動等變化,同一影像每個週期呈現不同樣貌,是改善影像過度擬合的常用有效手段,故非答案。 - (B):擴充不同場景與條件的資料來源,直接增加訓練分布的涵蓋面,可提升模型泛化能力,屬有效作法。 - (D):移除標註錯誤與品質不佳的影像,可減少模型記憶錯誤標籤與雜訊的機會,有助於泛化,同樣屬有效作法。 提示:資料層面防過擬合的方向是多樣化(增強、擴充來源)與乾淨化(清理標註);使模型反覆讀取同一份固定資料的加速手段,須留意過擬合副作用。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第30題

訓練資料共 5,000萬筆,工程師比較 Batch Size=32 與 Batch Size = 4096 的訓練表現,發現大批次(Large Batch)雖然訓練較快,但模型泛化能力較差。從最佳化理論角度,下列何者為此現象最合理的解釋?

  1. A大批次(Large Batch)計算量過大,GPU無法有效處理
  2. B大批次(Large Batch)梯度估計更穩定,但容易收斂至局部極小值(Local Minima),導致泛化能力較差
  3. C小批次(Small Batch)因隨機性高,更容易發生梯度爆炸(Gradient Explosion)
  4. D批次大小(Batch Size)與泛化能力無關,問題出在學習率(Learning Rate)設定
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 大批次的梯度是對更多樣本平均的結果,估計更穩定、雜訊更小;但最佳化理論與實證研究(如 Keskar 等人的研究)指出,低雜訊的更新使模型容易收斂至尖銳極小值(Sharp Minima)一類泛化較差的解;小批次的梯度雜訊則具有類似退火的作用,能使參數跳出狹窄的極小值區域,較常收斂至平坦極小值(Flat Minima),對未見資料的表現較穩健。這是「大批次訓練快但泛化較差」的主流理論解釋,(B) 的描述最為貼近。 【為何其他選項錯了?】 - (A):大批次正是為了充分利用 GPU 平行運算而設計,吞吐量通常更高;題幹亦說明大批次訓練較快,可見 GPU 處理並無困難,此敘述與題設矛盾。 - (C):梯度爆炸的主因是網路深度、初始化與學習率設定,並非批次較小;且題目問的是大批次泛化較差的原因,此選項答非所問。 - (D):批次大小影響梯度雜訊尺度與收斂解的平坦程度,與泛化能力關係密切;學習率固然須隨批次調整(如線性縮放法則),但宣稱兩者無關即否定了實驗觀察到的現象。 提示:大批次梯度穩定、易收斂至尖銳極小值、泛化較差;小批次雜訊較大、傾向平坦極小值、泛化較佳;放大批次時應同步調整學習率。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第13題

某工程師訓練文本情感分類模型,訓練集 F1=0.96、驗證集 F1=0.71,落差明顯,顯示模型出現過擬合。下列哪一種策略能最直接從降低模型複雜度的角度緩解過擬合?

  1. A增加訓練 Epoch 數至200,讓模型充分學習訓練資料的所有細節
  2. B引入更多原始文本特徵(包括原始 URL、HTML 標籤),增加特徵多樣性
  3. C對Embedding 層與全連結層加入 L2權重衰減(Weight Decay),懲罰參數值
  4. D移除驗證集並將其併入訓練集,以增加模型可見的訓練樣本數
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 訓練集 F1=0.96 與驗證集 F1=0.71 的明顯落差是典型過擬合。L2 權重衰減(Weight Decay)在損失函數中加入參數平方懲罰項,迫使權重數值縮小、限制模型的有效自由度,是直接從「降低模型複雜度」著手的正則化手段;對 Embedding 層與全連結層這類參數量龐大的部位尤其有效,故 (C) 正確。 【為何其他選項錯了?】 - (A):將訓練 Epoch 增至 200 會讓模型更徹底記憶訓練資料的雜訊,過擬合更加嚴重,方向相反。 - (B):引入原始 URL、HTML 標籤等高雜訊特徵會擴大特徵空間、提高模型複雜度,同時引入無關訊號,對緩解過擬合有害無益。 - (D):移除驗證集併入訓練集後,將失去偵測過擬合的依據;過擬合問題依然存在,只是無法再被觀察到,並非解決方法。 提示:從降低複雜度緩解過擬合的常用手段:L1/L2 懲罰、Dropout、簡化架構;增加訓練輪數、增加雜訊特徵、移除驗證集皆為反向操作。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第30題

某信用風險模型:訓練AUC=0.97、驗證AUC=0.72、少數違約樣本預測波動極大及不同K-fold切分結果差異明顯。下列何者為最可能的問題?

  1. A高偏差
  2. B高變異
  3. C過擬合
  4. D資料漂移
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 高變異(High Variance)指模型對訓練資料的微小變動極度敏感。題目的三項症狀正是高變異的典型表現:訓練 AUC 0.97 與驗證 AUC 0.72 的巨大落差、少數違約樣本的預測波動極大、不同 K-fold 切分結果差異明顯。資料一經更換,模型行為即大幅改變,即為變異過高的定義;常見成因是模型過於複雜或少數類樣本過少,對應處置包括正則化、增加資料與集成學習。 【為何其他選項錯了?】 - (A):高偏差是模型過於簡單、連訓練集都無法學好;本題訓練 AUC 高達 0.97,顯然不屬於此類。 - (C):過擬合是高變異最常見的表現形式,兩者高度重疊;但題目額外強調切分敏感與預測波動大,對應的診斷術語是高變異,它同時涵蓋訓練與驗證落差以及對資料擾動的不穩定,是四個選項中最完整的答案。 - (D):資料漂移指上線後輸入分布隨時間改變;本題所有現象皆發生於訓練與驗證階段,與漂移無關。 提示:更換切分結果即大幅變動,對應高變異;連訓練集都學不好,對應高偏差;先確立診斷,再決定正則化、增加資料或集成等處置。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第34題

某工程師使用 XGBoost 模型進行調參,需對以下超參數進行網格搜尋(Grid Search):learning_rate(3 個候選值)、max_depth(4 個)、n_estimators(5 個)、subsample(3 個)、colsample_bytree(3 個)。每組參數組合皆需完整進行 5-Fold交叉驗證。請問總共需要訓練幾個模型?

  1. A3 + 4 + 5 + 3 + 3 = 18 個
  2. B5 × 5 = 25個
  3. Cmax(3,4,5,3,3) × 5 = 25 個
  4. D3 × 4 × 5 × 3 × 3 × 5 = 2,700 個
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 網格搜尋嘗試的是各超參數候選值的笛卡兒積:3(learning_rate)× 4(max_depth)× 5(n_estimators)× 3(subsample)× 3(colsample_bytree)= 540 種參數組合;每種組合皆需完整執行 5-Fold 交叉驗證,即各訓練 5 個模型,總計 540 × 5 = 2,700 個模型。組合數隨參數個數呈乘積成長,這也是參數較多時實務上改採隨機搜尋或貝氏優化的原因。 【為何其他選項錯了?】 - (A):將各參數候選數相加是對網格搜尋的誤解;網格搜尋逐一嘗試所有組合,而非每個參數獨立測試後即結束。 - (B):5 × 5 = 25 與任何正確的計算邏輯皆不對應,屬干擾選項。 - (C):取最大候選數再乘以折數沒有依據;網格搜尋涵蓋完整的組合空間,不是僅沿單一參數的候選值進行。 提示:網格搜尋的訓練模型總數 = 各參數候選數連乘 × 交叉驗證折數;每增加一個參數,總數即乘上其候選值個數。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第48題

以 CIFAR-10 訓練 CNN 後,繪製訓練與驗證準確率曲線(Training and Validation Accuracy):訓練曲線隨 Epoch 穩定上升,驗證曲線雖上升但出現明顯波動。當 Epochs=6 時,訓練曲線值(0.81)明顯大於驗證曲線值(0.72),下列何者為最可能的原因?

  1. A學習率(Learning Rate)太低
  2. B批次大小(Batch Size)設定太大
  3. C模型低度擬合(Underfitting)
  4. D模型過擬合(Overfitting)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 訓練準確率(0.81)明顯高於驗證準確率(0.72),且訓練曲線持續穩定上升、驗證曲線波動且改善有限,兩條曲線的差距逐漸擴大。模型對訓練資料的擬合越來越好,對未見資料的表現卻停滯,是過擬合的典型徵兆:模型開始記憶訓練資料的細節與雜訊,泛化能力受限。此時應考慮更強的正則化(Dropout、權重衰減)、資料增強或早期停止。 【為何其他選項錯了?】 - (A):學習率太低的症狀是訓練與驗證兩條曲線皆上升緩慢,不會單獨造成訓練與驗證之間的落差。 - (B):批次大小過大主要影響收斂行為與泛化的細節,並非「訓練高、驗證低」這種差距的最直接典型解釋。 - (C):低度擬合是訓練與驗證表現皆偏低、連訓練集都學不好;訓練準確率已達 0.81 且持續上升,不符合此描述。 提示:判讀學習曲線:兩線皆低為欠擬合;訓練高、驗證低且差距擴大為過擬合。

相關節點