iPAS 歷屆考題 · 中級

114年第二梯次中級AI應用規劃師
機器學習技術與應用

第三科 · 共 50 題 · 每題附正解與逐選項詳解,「觀念複習」直達對應教學節點。

50 中級第三科
開啟互動地圖 其他卷別

建議先自行作答再展開詳解;每題可透過「觀念複習」回到掛載該題的知識節點。試題著作權屬原主辦單位,本站解析僅供考生學習之用。

第 1 題觀念複習:資料切分

某零售企業建立一個銷售預測模型,希望評估該模型在不同月份的新資料上,是否仍能維持穩定的預測表現。資料科學團隊計畫利用統計方法檢驗模型對未觀察資料的適應能力與泛化效果。下列哪一種方法最適合用於此目的?

  1. AF檢定(F-test)
  2. B交叉驗證(Cross-Validation)
  3. C配對樣本t 檢定(Paired-sample t-test)
  4. D卡方檢定(Chi-square Test)
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 題幹要求評估模型對「未觀察資料」的適應能力與泛化效果。交叉驗證(Cross-Validation)將資料反覆切分為多組訓練與驗證子集,輪流以一部分資料訓練、另一部分評估,最後平均各折的表現。此方法能檢驗模型在不同資料切分下的穩定性,避免僅憑單一次切分結果下結論,正符合評估模型於不同月份新資料上是否維持穩定預測表現的需求。 【為何其他選項錯了?】 - (A):F檢定用於比較變異數或檢驗迴歸模型的整體顯著性,屬於統計假設檢定,無法衡量模型對新資料的預測泛化能力。 - (C):配對樣本t檢定比較同一組樣本在兩種條件下的平均差異,檢驗的是「差異是否顯著」,而非模型的泛化表現。 - (D):卡方檢定處理類別變數的獨立性或適合度問題,與評估預測模型在新資料上的穩定性無關。 提示:題幹問「未見過的資料上表現如何」對應交叉驗證;問「兩組數字差異是否顯著」才對應統計假設檢定。

本題掛載於「資料切分」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 2 題觀念複習:Lasso (L1)

在建立迴歸或分類模型時,若希望避免模型過度擬合(Overfitting),可透過加入正則化項以限制模型的複雜度。其中,L1正則化(Lasso)的主要效果為何?

  1. A增加模型參數的數量,以提升表現靈活度
  2. B強化梯度穩定性,避免參數更新過度震盪
  3. C產生稀疏模型(Sparse Model),使部分參數權重收斂為零
  4. D提高學習率(Learning Rate),加速模型收斂速度
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 L1 正則化(Lasso)在損失函數中加入權重絕對值總和作為懲罰項。絕對值懲罰的幾何特性(約束區域是有稜角的菱形)使最佳解容易落在座標軸上,讓部分不重要特徵的係數被壓縮到恰好為零,產生稀疏模型(Sparse Model),同時達到內建特徵選擇的效果。這也是 Lasso 常用於高維資料自動挑選變數的原因。 【為何其他選項錯了?】 - (A):正則化的目的是限制模型複雜度,不是增加參數數量;參數越多越容易過擬合,方向完全相反。 - (B):強化梯度穩定性、避免更新震盪依靠批次正規化、梯度裁剪或調整學習率等技巧,不是 L1 懲罰項的功能。 - (D):學習率是優化器的超參數,與正則化項無關;L1 的作用是將不重要的權重壓縮至零,並不會提高學習率或加速收斂。 提示:L1=Lasso=稀疏並內建特徵選擇;L2=Ridge=縮小權重但不歸零。

本題掛載於「Lasso (L1)」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 3 題觀念複習:梯度下降

在訓練非線性模型時,若目標函數為非凸函數(Non-convex Function),演算法在參數更新過程中可能出現多個極值點,導致最佳化結果不穩定。請問此時最可能發生下列哪一種情況?

  1. A梯度消失
  2. B資料過少
  3. C局部最優解
  4. D過擬合
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 非凸函數的損失曲面存在多個極小值與鞍點,梯度下降這類依靠局部梯度資訊的優化演算法,只會沿著當前坡度往下走,走到某個梯度為零的低點就停止——但該低點不一定是全域最低點。因此不同初始值、不同更新路徑可能收斂到不同的局部最優解(Local Optimum),導致最佳化結果不穩定,這正是題目描述的情況。 【為何其他選項錯了?】 - (A):梯度消失是深層網路反向傳播時梯度逐層縮小的問題,主要與網路深度和激活函數的飽和特性有關,不是非凸多極值直接造成的現象。 - (B):資料量多寡是資料收集層面的問題,與目標函數是否為凸函數無關;凸性是函數形狀的數學性質。 - (D):過擬合是模型在訓練集表現好、新資料表現差的泛化問題,與優化過程停在哪個極值點屬不同層次的議題。 提示:非凸函數存在多個極小值:梯度下降只保證收斂到局部極小值,不保證找到全域最優解。

本題掛載於「梯度下降」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 4 題觀念複習:DBSCAN / HDBSCAN

在執行 DBSCAN(Density-Based Spatial Clustering of Applications with Noise)群集分析時,若某資料點鄰域內的樣本數不足以形成核心點(Core Point),且該點未被任何核心點的鄰域所包含,也未與其他群集形成密度可達關係(Density Reachability),此資料點最終將被歸類為哪一種類型?

  1. A鄰近點(Neighbor Point)
  2. B雜訊點(Noise Point)
  3. C邊界點(Border Point)
  4. D潛在點(Potential Point)
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 DBSCAN 將資料點分為三類:核心點(鄰域半徑 ε 內樣本數達 MinPts)、邊界點(本身不是核心點,但落在某核心點的鄰域內)、雜訊點(兩者皆非)。題目描述的點:鄰域樣本數不足以成為核心點、未被任何核心點鄰域包含、也不與任何群集存在密度可達關係,三個條件皆不符合核心點與邊界點的定義,依演算法將被標記為雜訊點(Noise Point),不屬於任何群集。能在分群的同時辨識離群雜訊,正是 DBSCAN 的一大優點。 【為何其他選項錯了?】 - (A):「鄰近點」不是 DBSCAN 的標準術語;其正式分類只有核心點、邊界點、雜訊點三種。 - (C):邊界點的定義是「落在某個核心點的鄰域內」;題目明言該點未被任何核心點鄰域包含,不符合邊界點的資格。 - (D):「潛在點」同樣不存在於 DBSCAN 的定義之中,屬於干擾選項。 提示:DBSCAN 三分法:密度達標者為核心點,依附核心者為邊界點,兩者皆非即為雜訊點。

本題掛載於「DBSCAN / HDBSCAN」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 5 題觀念複習:CNN

某智慧製造公司開發一套影像辨識系統,用於自動檢測生產線上的瑕疵產品。系統採用卷積神經網路(Convolutional Neural Network, CNN)作為主要模型架構,其中第一層卷積層(Convolutional Layer)主要負責的功能為下列何者?

  1. A自動提取輸入影像中的局部特徵
  2. B降低影像維度以加速運算效率
  3. C增加神經元與參數數量以提升模型容量
  4. D整合所有特徵並輸出最終分類結果
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 卷積層以小尺寸濾波器(Kernel)在影像上滑動,對每個局部區域做卷積運算,自動學習並提取局部特徵;第一層卷積通常學到邊緣、線條、紋理等低階特徵,越深層再把它們組合成越抽象的形狀與物件部件。這種「自動特徵提取」正是 CNN 取代人工特徵工程、適合瑕疵檢測等影像任務的核心價值。 【為何其他選項錯了?】 - (B):降低影像空間維度、壓縮運算量主要是池化層(Pooling)的工作;卷積層的首要任務是擷取特徵,不是縮小尺寸。 - (C):卷積層藉由參數共享,參數量反而遠少於全連接層;「增加神經元與參數以提升容量」與卷積層的設計理念相反。 - (D):整合所有特徵並輸出最終分類結果,是網路末端全連接層(搭配 Softmax/Sigmoid)的職責,不是第一層卷積層的功能。 提示:CNN 分工:卷積層擷取特徵、池化層縮減尺寸、全連接層輸出決策。

本題掛載於「CNN」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 6 題觀念複習:CNN

某智慧城市團隊開發一套交通監控系統,用於即時辨識路口監視器影像中的車輛與行人。團隊比較後發現,卷積神經網路(Convolutional Neural Network, CNN)在訓練與推論效率上,明顯優於傳統的全連接神經網路(Fully Connected Neural Network, FCNN)。請問下列何者為主要原因?

  1. ACNN 能自動學習影像的旋轉與比例不變性
  2. BCNN 可直接跳過人工特徵提取步驟進行分類
  3. CCNN 透過區域感知(Local Receptive Field)與參數共享(Parameter Sharing)機制,降低模型參數量與運算複雜度
  4. DCNN 捨棄激勵函數(Activation Function),以加快運算速度
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 CNN 訓練與推論效率優於全連接網路(FCNN)的關鍵是兩個機制:區域感知(Local Receptive Field,每個神經元只連接輸入的一小塊局部視窗,而非全部像素)與參數共享(Parameter Sharing,同一組濾波器權重在整張影像上重複使用)。兩者合力大幅減少參數量與運算複雜度——全連接層直接處理高解析度影像時,參數會隨像素數暴增,CNN 則可避免。 【為何其他選項錯了?】 - (A):CNN 藉由卷積與池化對「平移」有一定容忍度,但旋轉與比例不變性並非天生具備,實務上須靠資料增強補足;且這也不是效率差異的來源。 - (B):CNN 確實免去人工特徵提取,但 FCNN 同樣可以端到端學習,這不是 CNN 運算效率較高的原因。 - (D):CNN 每個卷積層後仍需接激活函數(如 ReLU)引入非線性;捨棄激活函數的說法完全錯誤。 提示:CNN 降低參數量的兩大機制:區域感知(只連局部)與參數共享(同組濾波器整張影像重複使用)。

本題掛載於「CNN」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 7 題觀念複習:RNN / LSTM

下列哪一種應用最適合採用長短期記憶網路(Long Short-Term Memory, LSTM)模型?

  1. A預測未來七天的電力需求變化趨勢
  2. B辨識監視影像中不同類別的物件
  3. C將大量顧客資料依相似特徵自動分群
  4. D將高維度的感測器資料壓縮成低維表示
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 LSTM 是循環神經網路(RNN)的改良架構,透過輸入門、遺忘門、輸出門控制記憶單元,擅長捕捉序列資料中的長期依賴關係,並克服傳統 RNN 的梯度消失問題。電力需求預測是典型的時間序列任務:未來七天的需求與過去用電模式、週期性趨勢高度相關,正是 LSTM 適用的場景。 【為何其他選項錯了?】 - (B):監視影像的物件類別辨識屬於空間特徵問題,主流作法為 CNN 或 YOLO 等物件偵測架構,而非處理序列的 LSTM。 - (C):顧客分群屬於非監督式學習,以 K-means、階層式分群等演算法處理;LSTM 為監督式的序列模型,不適用於分群任務。 - (D):高維感測器資料壓縮為低維表示屬於降維任務,對應 PCA、自編碼器(Autoencoder)等方法,與序列建模無關。 提示:辨識題幹的資料型態:具時間順序與前後依賴的預測任務,優先考慮 RNN/LSTM。

本題掛載於「RNN / LSTM」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 8 題觀念複習:決策樹/隨機森林

資訊增益(Information Gain)常用於衡量特徵對分類結果的不確定性貢獻程度,並據以進行特徵選擇。此方法主要應用於下列哪一類模型架構中?

  1. A使用 L1 正則化進行特徵篩選的線性模型
  2. B利用激活函數(Activation Function)進行特徵擷取的深度神經網路
  3. C透過核函數(Kernel Function)將特徵映射至高維空間的分類模型
  4. D透過遞迴分裂方式建立分類規則的決策樹模型
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 資訊增益(Information Gain)定義為分裂前的熵減去分裂後的加權熵,衡量「以某特徵切分資料後,不確定性下降多少」。它是決策樹家族(如 ID3、C4.5)在每個節點挑選分裂特徵的核心準則:計算各候選特徵的資訊增益,選擇增益最大者進行切分,並遞迴地對子節點重複此程序,逐步建立樹狀分類規則,正是選項 (D) 所述「透過遞迴分裂方式建立分類規則的決策樹模型」。 【為何其他選項錯了?】 - (A):L1 正則化透過懲罰項將部分係數壓縮至零以達成特徵篩選,是基於權重大小的線性模型技術,與熵或資訊增益無關。 - (B):深度神經網路以梯度下降配合激活函數逐層學習特徵表示,特徵擷取由網路自動完成,並不使用資訊增益作為特徵選擇準則。 - (C):核函數是支援向量機將特徵映射至高維空間以處理線性不可分問題的技巧,其運作機制與資訊增益無關。 提示:熵、資訊增益、吉尼不純度皆為決策樹的節點分裂準則;看到「遞迴分裂」即指向樹模型。

本題掛載於「決策樹/隨機森林」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 9 題觀念複習:標準化 / Robust

在建構以距離為基礎的機器學習模型(如 KNN、SVM)時,下列哪一項資料前處理方式最為關鍵?

  1. A進行特徵縮放(Feature Scaling),使各特徵變數具有相似的數值範圍
  2. B將連續型特徵變數轉換為類別型變數
  3. C以平均值或中位數進行缺失值補齊;
  4. D進行隨機抽樣以平衡資料筆數
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 KNN、SVM 這類模型以樣本間「距離」(或內積)為計算核心。若特徵尺度差異懸殊,例如年收入(數十萬)與年齡(數十),數值範圍大的特徵會主宰距離計算,使其他特徵的影響幾乎消失,模型判斷因此失真。因此建模前必須進行特徵縮放(標準化或 Min-Max 正規化),讓各特徵在相近的數值範圍內公平比較,這是距離型模型最關鍵的前處理步驟。 【為何其他選項錯了?】 - (B):把連續特徵轉成類別型會損失數值資訊,對距離型模型不僅非必要,通常還有害。 - (C):缺失值補齊是各類模型都需要的通用資料清理步驟,並非距離型模型「特別關鍵」的環節。 - (D):隨機抽樣平衡資料處理的是類別不平衡問題,與特徵尺度扭曲距離計算無關。 提示:以距離為基礎的演算法(KNN、SVM、K-means)在建模前必須先完成特徵縮放,使各特徵尺度一致。

本題掛載於「標準化 / Robust」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 10 題觀念複習:模型訓練與調參

下列哪一種應用情境最適合導入 AutoML,以提升模型開發效率?

  1. A公司已有完整的 MLOps 平台與資深資料科學團隊,模型更新採固定流程
  2. B製造部門的生產良率模型已長期穩定運作,只需定期調整參數
  3. C行銷部門希望在短時間內比較多種顧客流失預測模型,缺乏專職工程師與時間進行手動建模
  4. D財務部門正在開發高度客製化的信用風險評估模型,需要精細控制特徵工程與演算法細節
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 AutoML 的價值在於自動化特徵處理、模型選擇與超參數調整,讓缺乏專職資料科學人力的團隊能在短時間內比較多種模型並快速產出可用結果。行銷部門的情境同時具備「時間有限」「缺乏專職工程師」「需比較多種顧客流失預測模型」三項條件,正是 AutoML 最能發揮效益的適用場景,故 (C) 正確。 【為何其他選項錯了?】 - (A):已有完整 MLOps 平台與資深團隊,且模型更新採固定流程,自建管線在掌控度與客製性上更佳,導入 AutoML 的邊際效益有限。 - (B):模型已長期穩定運作、僅需定期調整參數,維運需求單純,導入 AutoML 重建整套流程並無必要。 - (D):高度客製化的信用風險模型需要精細控制特徵工程與演算法細節,且金融監理重視可解釋性,AutoML 的自動化流程難以提供足夠的控制粒度與透明度。 提示:AutoML 適用於「人力少、時間短、需快速比較多模型」的情境;需要精細控制或已有成熟管線時,導入效益有限。

本題掛載於「模型訓練與調參」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 11 題觀念複習:模型訓練與調參

相較於Grid Search,Random Search 在超參數調整上具備哪一項主要優勢?

  1. A可自動產生模型架構
  2. B可使用更大的訓練集
  3. C避免模型過擬合
  4. D能更有效率搜尋高維參數空間
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 Grid Search 對每個超參數取固定格點,組合數隨參數維度呈指數成長;且若部分超參數對效能影響不大,網格仍會在這些維度上重複大量嘗試,造成運算浪費。Random Search 改為在參數空間隨機取樣,在相同運算預算下,能在真正重要的超參數維度上探索更多不同取值(Bergstra 與 Bengio 的經典研究結論),因此在高維參數空間中的搜尋效率更高,故 (D) 正確。 【為何其他選項錯了?】 - (A):自動產生模型架構屬於神經架構搜尋(Neural Architecture Search, NAS)的範疇;Random Search 僅是超參數取樣策略,不涉及架構生成。 - (B):搜尋策略與可使用的訓練集大小無關,兩者是互相獨立的設計決策。 - (C):Random Search 與 Grid Search 皆僅為超參數搜尋方式,本身不具防止過擬合的功能;防過擬合須依靠正則化、早期停止等手段。 提示:參數維度高時,網格組合數呈指數成長;隨機搜尋以相同預算涵蓋更多重要維度的取值,是其主要優勢。

本題掛載於「模型訓練與調參」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 12 題觀念複習:模型訓練與調參

某智慧製造公司開發一套設備故障預測系統,利用感測器資料訓練深度神經網路(Deep Neural Network, DNN)模型,以提前偵測異常運作跡象。在訓練過程中,團隊發現模型收斂速度不穩定:有時過快導致過擬合,有時又遲遲無法達到最佳準確率。開發團隊可以藉由調整下列哪一項超參數(Hyperparameter)以改善此問題?

  1. A每個神經元的輸出結果
  2. B損失函數(Loss Function)在訓練過程中的梯度變化值(Gradient)
  3. C學習率(Learning Rate),控制模型權重更新的速度
  4. D模型在訓練後產生的權重值
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 學習率(Learning Rate)是控制每次權重更新步伐大小的超參數:設定過大時損失震盪、收斂過快甚至發散,容易造成不穩定或過擬合;設定過小時收斂緩慢,遲遲無法達到理想準確率。題幹描述「收斂有時過快、有時遲遲無法達到最佳準確率」,最直接對應的調整對象即為學習率;實務上亦常搭配學習率排程(Learning Rate Scheduling)或 Adam 等自適應優化器改善收斂穩定性。 【為何其他選項錯了?】 - (A):神經元的輸出是前向傳播的計算結果,由權重與輸入決定,並非可事先設定的超參數。 - (B):梯度是訓練過程中由損失函數反向傳播計算而得的數值,同樣不是人為設定的超參數。 - (D):訓練後產生的權重是模型學到的參數;參數由訓練決定,超參數由人在訓練前設定,兩者不可混淆。 提示:超參數是訓練前設定的(學習率、批次大小、層數);參數是訓練中學得的(權重、偏差);收斂速度問題優先檢查學習率。

本題掛載於「模型訓練與調參」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 13 題觀念複習:公平性與去偏見

標籤偏差(Label Bias)通常是因為什麼原因造成?

  1. A訓練資料量過大
  2. B標記資料本身帶有主觀偏見
  3. C模型結構設計不當
  4. D特徵數量設定過多
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 標籤偏差(Label Bias)指訓練資料的「標記本身」帶有系統性偏見,例如標註者的主觀判斷標準不一,或標籤來自帶有歧視的歷史決策(過去審核人員對特定族群較嚴格,其核駁紀錄被直接當成標籤)。模型的學習目標就是這些標籤;標籤本身失真,模型再準確也只是精確地複製並放大既有偏見,故 (B) 正確。 【為何其他選項錯了?】 - (A):訓練資料量影響的是模型的變異與泛化能力;資料量大小與標籤是否帶有主觀偏見沒有因果關係。 - (C):模型結構設計不當造成的是欠擬合或過擬合,屬於模型端問題;標籤偏差是資料端「真值本身失真」的問題。 - (D):特徵數量過多可能導致維度災難或過擬合,同樣與標籤是否被主觀汙染無關。 提示:Label Bias 的根源在標註過程:標籤由誰標註、依什麼標準標註,偏見即由該環節進入資料。

本題掛載於「公平性與去偏見」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 14 題觀念複習:可解釋 AI (XAI)

下列哪一種AI 應用情境中,模型的可解釋性(Explainability)最為關鍵?

  1. A電商平台利用深度學習模型預測用戶的下一次購買時間,以優化推播行銷策略
  2. B新創公司使用機器學習演算法自動調整廣告出價策略,以提升點擊轉換率
  3. C醫院導入AI 模型分析病患影像並給出腫瘤惡性可能性,作為臨床醫師診斷依據
  4. D銀行導入AI 模型預測客戶流失率,並自動推薦留客優惠方案
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 醫療診斷屬於高風險決策場景:AI 給出的腫瘤惡性可能性會直接影響醫師的臨床判斷與病患的治療方案,一旦出錯,代價是健康與生命。醫師必須理解模型依據哪些影像特徵做出判斷,才能負責任地採納或推翻建議;醫療法規與倫理審查也對 AI 輔助診斷的透明度有嚴格要求。因此可解釋性在此情境最為關鍵,故 (C) 正確。 【為何其他選項錯了?】 - (A):預測購買時間以優化推播屬於行銷應用,預測錯誤的代價僅是行銷成效下降,評估重點在成效指標而非解釋決策依據。 - (B):廣告出價策略以點擊轉換率為主要評估標準,錯誤代價低且可快速迭代修正,對模型解釋性的需求相對次要。 - (D):客戶流失預測出錯損失的是行銷預算與部分客戶關係;金融業雖也重視解釋性,但錯誤後果的嚴重程度仍遠低於醫療診斷。 提示:錯誤代價越高的場景(醫療、司法、信貸核決),可解釋性越是必要條件而非加分項目。

本題掛載於「可解釋 AI (XAI)」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 15 題觀念複習:評估指標

在線性迴歸模型中,若 R²值為 0.85,其意義為何?

  1. A模型準確率為 85%
  2. B85%的變異可被模型解釋
  3. C預測誤差為 15%
  4. D模型有85%的信心水準
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 R²(判定係數)= 1 − SSE/SST,衡量迴歸模型能解釋的應變數變異佔總變異的比例。R² = 0.85 的正確解讀是:應變數 y 的總變異中,有 85% 可以被模型(自變數)解釋,剩下 15% 是模型無法解釋的殘差變異。它反映的是解釋力,不是預測對錯的比例。 【為何其他選項錯了?】 - (A):「準確率」是分類問題的指標(答對筆數的比例),迴歸模型沒有「準確率 85%」的說法,兩種指標不能混用。 - (C):R² 描述的是變異解釋比例,不能直接換算成「預測誤差為 15%」;誤差大小應以 MAE、RMSE 等有單位的指標衡量。 - (D):信心水準(Confidence Level)是統計推論中信賴區間的概念,與 R² 完全不同,屬於名詞混淆。 提示:R² 表示模型解釋變異的能力;它不是準確率、不是誤差率、也不是信心水準。

本題掛載於「評估指標」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 16 題觀念複習:模型評估

在二元分類問題中,若精確率(Precision)為0.8,召回率(Recall)為0.6,則F1分數(F1 Score)為何?

  1. A0.686
  2. B0.700
  3. C0.720
  4. D0.750
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 F1 分數是精確率與召回率的調和平均:F1 = 2×P×R/(P+R) = 2×0.8×0.6/(0.8+0.6) = 0.96/1.4 ≈ 0.686。調和平均的特性是受較低的數值主導,因此 F1 能懲罰精確率與召回率失衡的模型,比單看任一指標更全面,故 (A) 正確。 【為何其他選項錯了?】 - (B):0.700 是 (0.8+0.6)/2 的算術平均;F1 採調和平均,其值恆小於等於算術平均,僅在 P=R 時兩者相等。 - (C):0.720 不對應任何正確的平均計算方式(幾何平均為 √0.48 ≈ 0.693,亦非此值),屬干擾選項。 - (D):0.750 同樣無法由正確公式導出,屬干擾選項。 提示:F1 計算式為兩者乘積的兩倍除以兩者之和;其值必介於 P 與 R 之間且偏向較小的一方。

本題掛載於「模型評估」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 17 題觀念複習:梯度下降

下列哪一種優化演算法內建動量(Momentum)的設計機制?

  1. ASGD+Momentum
  2. BAdam
  3. CRMSProp
  4. DAdagrad
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 Adam(Adaptive Moment Estimation)的演算法設計「內建」了動量機制:它同時維護梯度的一階動量(梯度的指數移動平均,即 Momentum 的概念)與二階動量(梯度平方的指數移動平均,即 RMSProp 的概念),經偏差校正後以兩者共同更新參數。因此就「內建動量設計機制」而言,Adam 是正確答案。 【為何其他選項錯了?】 - (A):SGD+Momentum 是在原始 SGD 之外「外加」動量項的組合寫法;SGD 演算法本身並沒有內建動量,題目問的是內建的設計機制。 - (C):RMSProp 只維護梯度平方的移動平均來自適應調整學習率(二階資訊),沒有一階動量項。 - (D):Adagrad 累積歷史梯度平方來縮放學習率,同樣沒有動量設計;且其累積效應會使學習率單調遞減至趨近於零。 提示:Adam 同時內建一階動量(Momentum)與二階動量(RMSProp 思想);SGD+Momentum 屬外加組合,非內建設計。

本題掛載於「梯度下降」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 18 題觀念複習:梯度提升樹 (GBDT)

下列何者最能同時反映 XGBoost(eXtreme Gradient Boosting)相較於傳統梯度提升決策樹(Gradient Boosting Decision Tree, GBDT)的主要技術改進?

  1. A引入正則化項(Regularization)以抑制過擬合,並支援缺失值自動處理與並行化訓練
  2. B改以隨機森林(Random Forest)架構取代樹模型以提升準確率
  3. C以類神經網路(Neural Network)取代弱分類器(Weak Learners)
  4. D採用批次正規化(Batch Normalization)技術提升模型穩定性
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 XGBoost 相較傳統梯度提升決策樹(GBDT)的代表性技術改進有三:第一,在目標函數中加入正則化項(對葉節點數量與葉節點權重的懲罰),直接抑制過擬合;第二,採用稀疏感知(Sparsity-aware)設計,能自動學習缺失值的最佳分支方向,毋須事先補值;第三,在特徵層級實作並行化與快取優化,大幅加速訓練。選項 (A) 同時涵蓋這三項改進,描述最完整正確。 【為何其他選項錯了?】 - (B):隨機森林屬於 Bagging 集成策略,XGBoost 屬於 Boosting 集成策略,兩者是不同的集成路線;XGBoost 並未改採隨機森林架構。 - (C):XGBoost 的弱學習器仍是決策樹(CART),並非以神經網路取代。 - (D):批次正規化(Batch Normalization)是深度神經網路用於穩定各層輸入分布的訓練技巧;樹模型沒有層與批次梯度訓練的概念,並無此機制。 提示:XGBoost 三大改進:目標函數帶正則化、缺失值自動處理、並行化加速。

本題掛載於「梯度提升樹 (GBDT)」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 19 題觀念複習:樣本不平衡

某醫療機構開發疾病早期偵測模型,正樣本(確診病例)僅佔 3%。在模型訓練與評估過程中,下列哪一種作法最不適合用於提升對少數類病例的預測能力?

  1. A使用SMOTE 過採樣
  2. B調整類別權重
  3. C使用準確率(Accuracy)作為評估指標;
  4. D欠採樣多數類(Undersampling the majority class)
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 正樣本僅佔 3% 的極不平衡資料中,模型只要全部預測「陰性」就能得到 97% 的準確率;數字看似良好,實際上一個病例都沒有偵測到,對疾病早期偵測毫無價值。因此準確率(Accuracy)在此情境是最不適合的評估指標,應改用召回率、精確率、F1、AUC-PR 等對少數類敏感的指標。本題問「最不適合」的作法,故選 (C)。 【為何其他選項錯了?】 - (A):SMOTE 以插值方式合成少數類樣本,平衡訓練分布,是處理不平衡資料的常用且適合的手段,故非本題答案。 - (B):調整類別權重使模型漏判病例時付出更大的損失代價,直接提升對少數類的重視程度,屬適合的作法。 - (D):欠採樣多數類同樣能平衡類別比例,雖會捨棄部分多數類資料,但仍是合理可行的作法之一。 提示:極不平衡資料下 Accuracy 會被多數類推高而失去鑑別力;評估少數類請改看 Recall、F1、AUC-PR。

本題掛載於「樣本不平衡」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 20 題觀念複習:特徵工程

某電子商務公司為開發商品評論情感分析模型,希望模型能捕捉評論中不同特徵之間的關聯影響,例如「商品價格」與「顧客滿意度」的互動效果。下列哪一種特徵工程設計方式最適合用於建立互動特徵(Interaction Features)?

  1. A將單一特徵取平方
  2. B對所有特徵進行對數轉換
  3. C將兩個或多個特徵進行乘積或交互組合
  4. D對特徵進行標準化
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 互動特徵(Interaction Features)的定義,是將兩個以上的特徵做乘積或交互組合以產生新特徵,使模型能捕捉特徵聯合作用的效應,例如「商品價格×顧客滿意度」這種單看任一變數都無法呈現的交互影響。多項式特徵展開中的交叉項(x1·x2)即為此設計,對線性模型尤其重要,因為線性模型無法自行學出特徵間的乘積關係,故 (C) 正確。 【為何其他選項錯了?】 - (A):單一特徵取平方屬多項式特徵,僅描述單一變數自身的非線性效果,不涉及兩個特徵之間的互動。 - (B):對數轉換用於調整單一特徵的分布形狀(如壓縮右偏長尾),與特徵之間的關聯無關。 - (D):標準化僅將特徵縮放至相同尺度,不會產生任何新的互動資訊。 提示:互動特徵=特徵相乘產生新欄位;當兩變數的聯合效果不等於各自效果相加時,就需要交互項。

本題掛載於「特徵工程」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 21 題觀念複習:注意力機制

某語音辨識系統開發團隊採用 Transformer 架構,為了讓模型能同時理解語音片段中的發音特徵、語速變化與語意脈絡等多層次資訊,團隊在設計中導入了多頭注意力(Multi-head Attention)機制。請問下列何者為此機制的主要優點?

  1. A減少模型參數量以降低訓練成本
  2. B加速整體注意力計算過程
  3. C從不同表示子空間(Representation Subspaces)同時捕捉多樣化關聯資訊
  4. D避免梯度消失(Gradient Vanishing)問題
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 多頭注意力(Multi-head Attention)將 Query、Key、Value 經由多組不同的線性投影,映射到多個表示子空間(Representation Subspaces),每個注意力頭在自己的子空間中獨立計算注意力,分別捕捉不同型態的關聯,例如語法結構、語意相關性、位置或韻律關係,最後再將各頭輸出串接整合。如此模型能同時從多個面向理解發音特徵、語速變化與語意脈絡等多層次資訊,正是題幹情境所需的效果。 【為何其他選項錯了?】 - (A):多頭注意力並不會減少參數量;多個頭的投影矩陣合計後,參數量與同維度的單頭注意力相當甚至更多。 - (B):多頭設計是將維度切分至各頭平行處理,總計算量與單頭相近,並非為了加速注意力計算。 - (D):緩解梯度消失(Gradient Vanishing)主要依靠殘差連接(Residual Connection)與層正規化(Layer Normalization),並非多頭注意力的作用。 提示:多頭注意力的關鍵詞是「多個表示子空間、多樣化關聯」;參數量、速度、梯度問題皆非其設計目的。

本題掛載於「注意力機制」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 22 題觀念複習:朴素貝氏

某電商平台希望預測顧客是否會購買特定商品。系統蒐集顧客的瀏覽紀錄、停留時間、商品類別偏好與過去購買行為,並以此推估「在觀察到這些行為特徵的情況下,該顧客會購買的機率」。若模型採用貝氏定理(Bayes’Theorem)進行推論,下列敘述何者最符合其核心運作機制?

  1. A根據歷史樣本自動分群,找出行為相似的顧客群
  2. B以條件機率方式計算顧客屬於「會購買」或「不會購買」的分類機率
  3. C以最小平方誤差(Mean Squared Error)為損失函數,預測顧客的購買金額
  4. D依據回饋信號(Feedback Signal)透過強化學習(Reinforcement Learning)動態調整推薦策略
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 貝氏定理的核心是後驗機率的計算:P(類別|特徵) = P(特徵|類別) × P(類別) / P(特徵)。題幹情境「在觀察到瀏覽紀錄、停留時間等行為特徵的情況下,推估顧客會購買的機率」,正是以條件機率計算樣本屬於「會購買」或「不會購買」兩類的後驗機率,再取機率較高者作為分類結果,這即是貝氏分類器(如 Naive Bayes)的核心運作機制。 【為何其他選項錯了?】 - (A):依相似度自動分群是非監督式學習(如 K-means)的行為,不需要標籤,也與貝氏定理的條件機率推論無關。 - (C):以最小平方誤差作為損失函數預測購買「金額」屬於迴歸任務;題幹要求的是購買「機率」的分類推論,任務型態不符。 - (D):依回饋信號動態調整推薦策略是強化學習的運作模式,與貝氏定理的機率推論機制不同。 提示:貝氏定理=先驗 × 似然推得後驗;題幹出現「在觀察到某些條件下的機率」即指向條件機率。

本題掛載於「朴素貝氏」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 23 題觀念複習:階段 4 大數據/ML

一家再生能源公司希望預測未來三個月太陽能發電量的波動範圍。由於氣候條件具有高度隨機性,且輸入變數(如日照時數、雲量、溫度)之間存在不確定關係,工程團隊決定以隨機抽樣方式模擬多種可能情境,以估算整體發電量的機率分佈與風險區間。請問此時所採用的技術最符合下列哪一種方法?

  1. A蒙地卡羅方法(Monte Carlo Method);
  2. BK-means聚類(K-means Clustering)
  3. C支持向量迴歸(Support Vector Regression, SVR)
  4. D特徵選取(Feature Selection)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 蒙地卡羅方法(Monte Carlo Method)的核心:當系統具高度隨機性、輸入變數間的關係複雜難以解析求解時,以大量隨機抽樣模擬各種可能情境,再從模擬結果的統計分布,估算目標量的機率分佈、期望值與風險區間。題幹描述對日照時數、雲量、溫度等不確定輸入進行隨機抽樣、模擬多種情境,並估算發電量的機率分佈與風險區間,每個要素都對應蒙地卡羅方法的標準流程,故 (A) 正確。 【為何其他選項錯了?】 - (B):K-means 是把資料劃分為 K 個群集的非監督式聚類演算法,不進行隨機模擬,也無法輸出機率分佈與風險區間。 - (C):支持向量迴歸(SVR)輸出單點預測值,無法直接提供波動範圍與風險區間這類分佈層級的資訊,亦與隨機抽樣模擬無關。 - (D):特徵選取(Feature Selection)是挑選對預測有用變數的前處理步驟,與情境模擬和機率分佈估算無關。 提示:「隨機抽樣、模擬多種情境、估算機率分佈」三個關鍵詞同時出現,即指向蒙地卡羅方法。

本題掛載於「階段 4 大數據/ML」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 24 題觀念複習:線性回歸

某房地產公司利用多元迴歸模型(Multiple Regression Model)預測房價,並繪製殘差圖(Residual Plot)檢查模型品質。結果顯示部分資料點的殘差極大,且在高價區樣本中出現系統性彎曲分佈現象。根據此觀察,下列何者為最可能的正確解釋?

  1. A模型過度擬合(Overfitting),導致在訓練資料上表現過好、泛化能力不足
  2. B模型特徵數量不足,導致欠擬合(Underfitting)
  3. C模型存在異常值(Outlier)或非線性關係,違反迴歸假設
  4. D殘差圖呈現隨機分佈,表示模型已完全符合所有假設
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 殘差圖是迴歸診斷的重要工具:健康的模型殘差應隨機、均勻地散佈在零線附近,沒有任何規律。題目觀察到兩個徵兆:部分資料點殘差極大(存在異常值 Outlier),高價區樣本殘差呈系統性彎曲(模型遺漏非線性關係,線性假設被違反)。這正是「存在異常值或非線性關係、違反迴歸假設」的典型證據;對策包括處理離群值、加入多項式項或進行變數轉換。 【為何其他選項錯了?】 - (A):過度擬合的特徵是模型過度貼合訓練資料、訓練殘差普遍極小,與「殘差極大+系統性彎曲」的觀察相反。 - (B):欠擬合通常表現為整體擬合度差;題目的證據(特定區段系統性彎曲加上極端殘差點)更明確指向非線性與異常值,(C) 的解釋更完整貼題。 - (D):題幹明確指出殘差出現系統性彎曲,「隨機分佈、完全符合假設」與題目觀察直接矛盾。 提示:殘差圖出現系統性圖案(彎曲、漏斗形)代表模型假設被違反;殘差如隨機噪點才是健康狀態。

本題掛載於「線性回歸」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 25 題觀念複習:邏輯斯回歸

某金融機構正在建立傳統信用評分卡模型,採用邏輯迴歸(Logistic Regression)作為建模方法,並依循監理機關建議的標準化流程進行模型開發。下列哪一項不是傳統信用評分卡模型開發流程中的常見步驟?

  1. A使用生成式模型進行特徵學習
  2. B進行特徵選擇與多重共線性(Multicollinearity)分析
  3. C進行分箱(Binning)與資訊值(Information Value, IV)檢定
  4. D使用樣本穩定性指標(Population Stability Index, PSI)檢驗模型穩定性
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 傳統信用評分卡是受監理高度規範的建模流程,標準步驟包括:變數分箱(Binning)、以證據權重(WOE)與資訊值(IV)評估變數預測力、特徵選擇與多重共線性分析、邏輯迴歸建模與分數刻度轉換,以及上線後以樣本穩定性指標(PSI)監控母體偏移,全程強調透明、可解釋、可稽核。「使用生成式模型進行特徵學習」屬深度學習時代的作法,結果不易解釋、難以向監理機關說明,不屬於傳統評分卡的常見步驟,故為本題答案。 【為何其他選項錯了?】 - (B):特徵選擇與多重共線性分析是評分卡變數篩選的基本步驟;共線性會使迴歸係數不穩定、難以解釋,屬常見步驟。 - (C):分箱與 IV 檢定用於將連續變數離散化並評估預測力,是評分卡的代表性步驟。 - (D):PSI 用於檢驗上線後申請母體分布是否偏移,是監理建議的標準模型監控指標,屬常見步驟。 提示:評分卡流程:分箱看 IV、迴歸防共線、上線盯 PSI,全程走可解釋路線;生成式特徵學習不在其中。

本題掛載於「邏輯斯回歸」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 26 題觀念複習:模型訓練與調參

在防止監督式學習模型過擬合(Overfitting)時,下列哪一種策略不屬於降低模型複雜度或限制學習能力的作法?

  1. A採用L1或L2 正則化
  2. B在訓練過程中使用 Dropout 技術
  3. C採取早期停止(Early Stopping)機制
  4. D擴增輸入特徵變數以提升模型表達能力
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 防止過擬合的策略核心是限制模型的有效複雜度或學習能力;擴增輸入特徵變數則是提升模型的表達能力、擴大假設空間,方向完全相反。特徵增加後若無相應的正則化與更多資料支撐,模型反而更容易過擬合。因此 (D) 不屬於降低複雜度或限制學習能力的作法,為本題答案。 【為何其他選項錯了?】 - (A):L1 與 L2 正則化在損失函數中加入權重懲罰項,壓抑係數大小(L1 並可將係數壓至零),直接限制模型複雜度,屬於題幹所述的作法。 - (B):Dropout 在訓練時隨機關閉部分神經元,防止神經元之間過度共適應,等效於限制網路的有效容量,同屬限制複雜度的作法。 - (C):早期停止(Early Stopping)在驗證表現開始惡化前結束訓練,限制模型過度擬合訓練資料的機會,屬於隱式正則化,亦為限制學習能力的作法。 提示:防過擬合的手段多為限制與刪減(懲罰項、隨機丟棄、提前停止);增加特徵或參數屬於提升複雜度,方向相反。

本題掛載於「模型訓練與調參」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 27 題觀念複習:激活函數

某智慧製造團隊在開發瑕疵影像檢測模型時,發現使用線性激活函數(Activation Function)後,模型的訓練準確率長期停滯,懷疑模型無法學習到足夠複雜的特徵表達。若要改善此問題,下列哪一項調整方案最為合適?

  1. A增加卷積層(Convolutional Layer)數量,使網路更深以強化特徵提取
  2. B將輸入影像先進行灰階化處理,降低運算量
  3. C使用Sigmoid 激活函數,以將輸出壓縮至[0,1]範圍;
  4. D改用ReLU(Rectified Linear Unit)激活函數,以引入非線性並提升模型表達能力
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 若每一層都使用線性激活函數,無論疊多少層,整個網路在數學上都等價於「單一層線性轉換」(線性函數的組合仍是線性),永遠學不到複雜的非線性特徵表達——這正是題目中訓練準確率長期停滯的根源。改用 ReLU(f(x)=max(0,x))引入非線性,深度網路才能真正發揮逐層組合特徵的能力;且 ReLU 在正區間梯度恆為 1,不易飽和、收斂快,是 CNN 的主流選擇。 【為何其他選項錯了?】 - (A):激活函數仍是線性的話,增加再多卷積層,整體依舊等價於一個線性映射,加深沒有實質效果。 - (B):灰階化只是減少輸入通道、降低運算量,完全不解決「模型缺乏非線性表達能力」的根本問題。 - (C):Sigmoid 雖然是非線性,但兩端飽和使深層網路容易梯度消失;且此選項所給理由(把輸出壓縮到 [0,1])與題幹的特徵表達力問題無關。 提示:線性函數疊加任意多層仍是線性;引入 ReLU 等非線性激活,網路深度才有意義。

本題掛載於「激活函數」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 28 題觀念複習:取樣偏差

一家零售電商公司希望建立顧客流失預測模型,用以判斷哪些會員可能在三個月內不再消費。團隊以去年會員資料進行訓練,並僅採用「曾經購買三次以上」的活躍顧客紀錄作為樣本。模型上線後,對整體會員進行預測時,發現模型對於新註冊會員與低消費會員的預測準確率明顯偏低。下列何者為造成此現象最可能的原因?

  1. A特徵設計未排除與會員忠誠度高度相關的變數,導致特徵偏差(Feature Bias)
  2. B標記(Label)由人工標註,導致標籤偏差(Label Bias)
  3. C訓練樣本僅涵蓋高活躍顧客,造成取樣偏差(Sampling Bias)
  4. D模型未進行超參數調整,導致過擬合(Overfitting)
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 訓練樣本只選取「曾購買三次以上」的高活躍顧客,但模型上線後要對「全體會員」預測:訓練分佈與應用母體不一致,新註冊與低消費會員的行為模式從未出現在訓練資料中,模型對這些族群自然出現系統性失準。這是典型的取樣偏差(Sampling Bias):樣本無法代表目標母體,模型在未被涵蓋的族群上泛化能力不足,故 (C) 正確。 【為何其他選項錯了?】 - (A):特徵偏差指特徵設計不當、混入偏頗變數;本題的問題不在特徵設計,而在樣本根本未涵蓋低活躍族群。 - (B):流失與否的標籤由消費行為客觀定義,並非人工主觀標註,不構成標籤偏差。 - (D):過擬合的症狀是訓練集表現佳、新資料普遍表現差;本題是「特定族群」的系統性偏差,且成因明確是樣本選取範圍,而非超參數設定。 提示:訓練樣本的涵蓋範圍決定模型的適用範圍;樣本選取條件排除的族群,就是模型預測失準的族群。

本題掛載於「取樣偏差」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 29 題觀念複習:資料切分

在工業設備故障預測專案中,模型訓練與超參數調整均依賴於一段歷史數據作為驗證集。然而,隨著設備運行環境與工況條件的變化,原有驗證集已無法充分反映現況,導致模型在實際部署後的預測準確率逐漸下降。下列哪一種策略最能有效提升模型在長期運行環境中的穩健性與泛化能力?

  1. A固定驗證集內容,並透過模型正則化技巧(如 L2 正則化)強化模型泛化
  2. B將全部歷史資料納入訓練,不使用驗證集,依靠早期停止(Early Stopping)控制訓練
  3. C簡化模型架構,減少模型參數數量以降低過擬合風險
  4. D採用時間序列交叉驗證(Time Series Cross Validation)或滑動視窗驗證(Rolling Window Validation)方法,動態更新驗證資料以適應時間演進
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 設備運行環境與工況隨時間演變,固定的歷史驗證集會逐漸偏離當前資料分布,模型上線後的表現因此持續下滑。時間序列交叉驗證(Time Series Cross Validation)依時間先後展開,以過去資料訓練、其後區間驗證;滑動視窗驗證(Rolling Window Validation)則讓訓練與驗證視窗隨時間滾動、動態更新。兩者皆尊重時間順序,避免以未來資料驗證過去,並讓驗證資料持續反映最新環境,是提升長期穩健性與泛化能力的適當策略。 【為何其他選項錯了?】 - (A):L2 正則化可降低過擬合,但驗證集固定不變,仍無法偵測與適應資料分布漂移,未解決根本問題。 - (B):早期停止本身需要驗證集提供停止依據;將全部資料納入訓練、不設驗證集,早停即失去判斷基準,做法自相矛盾。 - (C):簡化模型降低的是過擬合風險,無法處理環境變動造成的資料分布漂移問題。 提示:時間序列驗證原則是只能以過去預測未來;環境會漂移,驗證視窗須隨時間滾動更新。

本題掛載於「資料切分」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 30 題觀念複習:模型評估

某情感分析模型在英文資料集上取得 macro F1-score = 0.91。當該模型部署於西班牙文資料集時,F1-score 驟降至 0.58。下列哪一項解釋最合理,且與F1-score 變化相關?

  1. Amacro F1-score 本身波動性高,建議改用 micro-average F1-score評估
  2. B模型在西班牙文語料上過度擬合,導致評估結果偏高
  3. C語言轉移造成召回率(Recall)下降,模型無法正確辨識關鍵情緒詞彙
  4. D以均方誤差(MSE)取代 F1-score 評估可獲得更準確的結果
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 模型在英文語料上訓練,對西班牙文的情緒詞彙、慣用表達與語法結構的辨識能力大幅下降,導致大量真實情緒樣本被漏判,召回率(Recall)顯著下滑;而 F1-score 是精確率與召回率的調和平均,召回率一旦大幅降低,F1 隨之明顯下降至 0.58。此解釋同時說明了跨語言部署造成的效能衰退(語言領域偏移),並直接連結到 F1 的組成結構,故 (C) 最合理。 【為何其他選項錯了?】 - (A):macro F1 是各類別 F1 的平均,本身並無波動性高的問題;改用 micro 平均也無法改變模型難以辨識西班牙文情緒詞彙的事實。 - (B):過擬合的表現是在訓練分布上的評估偏高;本題在西班牙文資料上量得的 0.58 是實際偏低的表現,「導致評估結果偏高」的敘述邏輯不通。 - (D):MSE 是迴歸指標,不適用於情感分類的評估,更換指標也無法解釋效能下降的原因。 提示:模型跨語言或跨領域部署後 F1 下降,應拆解檢視 Precision 與 Recall 何者衰退;辨識不出關鍵詞彙通常先反映在 Recall。

本題掛載於「模型評估」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 31 題觀念複習:模型訓練與調參

某能源公司利用歷史氣象與用電資料,開發長期電力需求預測模型,採用深度神經網路架構進行訓練。在訓練過程中,模型在訓練集上的損失值持續下降,但在驗證集上,損失在第 80輪後開始波動,呈現週期性上升與下降。團隊懷疑模型受到季節性資料波動與隨機噪音影響,導致驗證損失難以穩定收斂。若要在此情境下合理運用早期停止法(Early Stopping)以確保模型具最佳泛化能力,下列哪一項策略最為適當?

  1. A直接根據訓練集損失最低點停止訓練,以確保模型充分擬合所有樣本
  2. B監控驗證集損失並設定適度的耐心值(Patience),在連續多輪未改善後再停止訓練
  3. C改以測試集損失作為早停依據,以提升模型最終評估一致性
  4. D將所有資料重新合併後訓練至收斂,避免因資料分割導致評估波動
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 驗證損失受季節性波動與隨機噪音影響而週期性起伏時,若以「一出現惡化即停止」為準則,容易被單次波動誤導而過早停止訓練。合理作法是監控驗證集損失並設定適度的耐心值(Patience),連續多輪未見改善才觸發停止,並保留驗證損失最佳時刻的模型權重。如此既能避免過擬合,也不會因短期噪音提前終止,在波動環境下確保最佳泛化能力,故 (B) 最為適當。 【為何其他選項錯了?】 - (A):以訓練集損失最低點作為停止準則,等同於訓練至過擬合為止,違背早期停止保護泛化能力的目的。 - (C):測試集僅供最終評估;以測試集損失決定停止時機,等於將測試資訊洩漏進訓練流程,最終評估將失去公信力。 - (D):將全部資料合併訓練即失去驗證集,無從判斷停止時機,只能訓練至收斂,過擬合風險反而更高。 提示:早期停止三要素:監控驗證集、設定耐心值、保留最佳權重;測試集只在最終評估時使用一次。

本題掛載於「模型訓練與調參」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 32 題觀念複習:Lasso (L1)

某電信公司開發客戶流失預測模型,使用大量顧客行為特徵,例如通話時長、上網頻率、帳單金額、客服聯絡次數等。在訓練過程中,團隊發現部分特徵彼此高度相關,但同時也懷疑有些特徵對流失預測的貢獻度有限。若希望模型在避免過擬合(Overfitting)的同時,能自動篩選出較具代表性的特徵,採用下列哪一種方法最為合適?

  1. A使用早期停止法(Early Stopping)控制訓練回合數,避免過擬合(Overfitting)
  2. B同時移除多重共線性特徵並採用 L2正則化(Ridge),以確保模型穩定收斂
  3. C僅使用L2正則化(Ridge),抑制所有權重幅度但保留全部特徵
  4. D採用L1正則化(Lasso),透過懲罰項使部分特徵係數縮為 0
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 L1 正則化(Lasso)在損失函數加入係數絕對值懲罰,最佳化過程會把貢獻度低、冗餘的特徵係數直接壓縮到 0,等於模型自動完成特徵篩選,同時抑制過擬合。題目要求「避免過擬合的同時,自動篩選出較具代表性的特徵」,兩個需求 Lasso 一次滿足,對高度相關且貢獻有限的特徵尤其適用。 【為何其他選項錯了?】 - (A):早期停止只透過控制訓練回合數防止過擬合,對「哪些特徵重要」沒有任何篩選作用。 - (B):先手動移除共線特徵再使用 Ridge 雖屬可行流程,但「手動移除」不符合題目要求的「自動篩選」,且 Ridge 仍保留所有剩餘特徵。 - (C):L2(Ridge)只把權重整體縮小、不會歸零,全部特徵都留在模型中,沒有特徵選擇效果。 提示:需要模型自動淘汰特徵用 L1(Lasso);只需權重穩定收斂、特徵全數保留用 L2(Ridge)。

本題掛載於「Lasso (L1)」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 33 題觀念複習:階段 4 大數據/ML

某資料科學團隊正在開發一個客戶相似度比對系統,用於計算所有客戶之間的相似度分數。若系統需逐一比對每一位客戶與其他所有客戶的資料組合,此時演算法的時間複雜度最可能為哪一種?其代表意義為何?

  1. AO(n) — 執行時間與資料量成線性關係
  2. BO(n²) — 執行時間與資料量平方成正比
  3. CO(1) — 執行時間固定不變
  4. DO(log n) — 執行時間與資料量呈對數成長關係
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 每一位客戶都要與其他所有客戶配對比較,配對總數為 n(n−1)/2,約為 n²/2;以 Big-O 記號忽略常數係數後即為 O(n²),代表執行時間與資料量的平方成正比。客戶數從 1 萬成長到 10 萬(10 倍),比對次數約增加 100 倍。這也是大規模相似度比對系統需改用近似最近鄰(ANN)索引或分桶策略的原因:O(n²) 的成長速度無法支撐百萬級用戶規模。故 (B) 正確。 【為何其他選項錯了?】 - (A):O(n) 代表每筆資料只處理固定次數的線性掃描;兩兩配對需對每筆資料再遍歷其餘所有資料,運算量遠超過線性成長。 - (C):O(1) 是不隨資料量變動的固定時間操作,例如雜湊表的單次查找,與逐一配對的情境完全不符。 - (D):O(log n) 是每一步將問題規模減半的對數成長,如二分搜尋;兩兩比對的運算量與對數成長相差多個數量級。 提示:題目描述「每一位與其他所有」的兩兩比對,即對應 O(n²) 的平方成長。

本題掛載於「階段 4 大數據/ML」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 34 題觀念複習:資料切分

某醫療人工智慧團隊正在開發心臟病風險預測模型,資料量僅有 150 筆,其中陽性個案不到 8%。由於樣本數稀少且類別分布極不平衡,團隊希望在有限資料下,仍能準確評估模型在不同資料上的表現穩定性,同時避免訓練資料被過度切分而影響模型效能。若團隊希望在有限樣本下,同時兼顧資料的利用率與各類別在驗證折中的比例一致性,最適合採用下列哪一種交叉驗證方法?

  1. A5-Fold交叉驗證(5-Fold Cross Validation)
  2. B留一法交叉驗證(Leave-One-Out Cross Validation)
  3. C隨機交叉驗證(Random Cross Validation)
  4. D分層留一法交叉驗證(Stratified Leave-One-Out Cross Validation)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 樣本僅 150 筆,留一法交叉驗證(LOOCV)每次僅保留 1 筆作驗證、其餘全數投入訓練,可將有限資料的利用率提升到最高,適合小樣本情境。陽性個案不到 8%,分層(Stratified)機制確保切分過程中各類別比例維持一致,避免驗證過程的類別分布失衡。題目同時要求「資料利用率」與「各類別在驗證折中的比例一致性」,結合兩種機制的分層留一法交叉驗證即為對應選項。 【為何其他選項錯了?】 - (A):5-Fold 每折驗證集約 30 筆,陽性僅約 2 至 3 筆,統計波動大;未分層時類別比例更易失衡,訓練資料利用率也不如留一法。 - (B):單純留一法的資料利用率最高,但未涵蓋題目強調的類別比例一致性需求。 - (C):隨機交叉驗證既不保證各折的類別比例,資料利用率也不如留一法,兩項需求皆未滿足。 提示:小樣本對應留一法提高資料利用率,類別不平衡對應分層維持比例;題幹兩項需求並列時,選同時具備兩種機制的方法。

本題掛載於「資料切分」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 35 題觀念複習:評估指標

某公司針對製程感測器資料進行主成分分析(PCA),經標準化與協方差矩陣分解後,得到三個主成分的特徵值如下:λ1=6.0, λ2=3.0, λ3=1.0。若團隊決定僅保留能解釋至少 80% 總變異量的主成分,以進行後續模型建構,下列哪一項敘述最合理且數據解讀正確?

  1. A前兩個主成分合計解釋 90%的總變異量,因此可安全降維至二維,且仍保留大部分資訊
  2. B第一主成分解釋 60%的變異量,表示資料結構呈現明顯線性關係,僅保留一維即可避免過擬合
  3. C雖然前兩個主成分可解釋超過 80% 變異量,但第二主成分貢獻仍高達30%,不宜捨棄第三主成分
  4. D三個特徵值相差不大,顯示各主成分變異均衡,降維可能導致資訊損失
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 各主成分的解釋變異比例=該特徵值 ÷ 特徵值總和。總和為 6.0 + 3.0 + 1.0 = 10:PC1 解釋 6/10 = 60%,PC2 解釋 3/10 = 30%,前兩者累積 90%,已超過題目設定的 80% 門檻。依準則保留前兩個主成分、將資料降至二維,仍保留九成變異資訊,選項 (A) 的敘述與數據解讀皆正確。 【為何其他選項錯了?】 - (B):PC1 單獨僅解釋 60%,未達 80% 門檻,只保留一維會損失過多資訊;「解釋 60% 即代表明顯線性關係、保留一維可避免過擬合」的推論也缺乏依據。 - (C):題目的決策準則是「累積解釋變異達 80% 即可」,PC3 僅貢獻 10%,依準則本應捨棄;「不宜捨棄第三主成分」與既定準則矛盾。 - (D):特徵值為 6:3:1,第一主成分的變異量是第三主成分的六倍,差距明顯,「相差不大、變異均衡」與數據不符。 提示:解釋變異比例=λi/Σλ;累積比例達到門檻後,其餘主成分即可捨棄。

本題掛載於「評估指標」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 36 題觀念複習:隱私 / 治理

某銀行計畫與多家合作機構共同訓練一個 AI信用風險預測模型,為避免客戶交易資料在傳輸與運算過程中外洩,技術團隊評估使用同態加密(Homomorphic Encryption)技術。下列何者最能正確描述同態加密在此應用中的關鍵特性?

  1. A系統以隨機雜訊(Noise)干擾輸出,確保統計結果不洩漏個資
  2. B各參與銀行透過安全通道交換私鑰,確保模型參數一致
  3. C將原始資料壓縮並同時加密,以減少加密後資料量與運算時間
  4. D資料在加密狀態下仍可進行數值運算,模型訓練可於未解密資料上完成
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 同態加密(Homomorphic Encryption)的關鍵特性:資料加密後,仍可直接在密文上進行加法、乘法等數值運算,運算結果解密後與在明文上運算的結果一致。應用到跨機構聯合建模:各參與銀行送出加密資料,模型訓練全程在未解密的資料上完成,運算方自始至終接觸不到明文,交易資料在傳輸與運算過程中都不會外洩,正是題目要求的保護方式。 【為何其他選項錯了?】 - (A):以隨機雜訊干擾輸出、確保統計結果不洩漏個資的是差分隱私(Differential Privacy),不是同態加密。 - (B):私鑰不應透過通道交換,此敘述本身違反金鑰管理原則;同態加密的重點是密文可運算,與交換私鑰無關。 - (C):同態加密通常導致密文體積膨脹、運算開銷大增,「壓縮資料量、減少運算時間」與其實際特性相反。 提示:同態加密的辨識點是「未解密資料上完成運算」;出現「雜訊擾動統計輸出」則對應差分隱私。

本題掛載於「隱私 / 治理」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 37 題觀念複習:隱私 / 治理

某跨銀行風控平台希望整合多家銀行的用戶行為資料,用於訓練信用風險預測模型。由於競爭與法規限制,各銀行僅願意提供加密後資料,且資料在任何時間不得被平台解密。同時,平台需建立安全通訊協議以確保資料在傳輸過程未被竄改或重放。下列哪一組技術最能完整對應上述需求?

  1. A對稱加密(Symmetric Encryption)+ 單向雜湊(Hash Function)+非對稱加密(Asymmetric Encryption)+ 差分隱私(Differential Privacy)
  2. B同態加密(Homomorphic Encryption)+ 非對稱加密(Asymmetric Encryption)+ 單向雜湊( One-way Hash Function)+ 對稱加密(Symmetric Encryption)
  3. C差分隱私(Differential Privacy)+ 對稱加密(Symmetric Encryption)+ 同態加密(Homomorphic Encryption)+ 數位簽章(Digital Signature)
  4. D同態加密(Homomorphic Encryption)+ 安全多方計算(Secure Multi-party Computation, MPC)+ 雜湊函數(Hash Function)+ 對稱加密(Symmetric Encryption)
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 把題目需求逐一對應:1) 資料加密後平台不得解密、仍要能運算訓練→同態加密(密文上運算);2) 跨機構安全交換金鑰與身分驗證→非對稱加密;3) 確保傳輸過程未被竄改、驗證資料完整性→單向雜湊函數;4) 大量資料傳輸時的加密效率→對稱加密。選項 (B) 的四項組合恰好完整覆蓋「密文運算+安全通訊協議」的全部需求。 【為何其他選項錯了?】 - (A):缺少同態加密,平台無法在不解密的情況下以資料訓練模型;差分隱私是對統計輸出加入雜訊擾動,不是加密技術,無法滿足「資料在任何時間不得被解密」的前提。 - (C):包含差分隱私同樣不符合題目需求;且組合中缺少獨立的雜湊函數與非對稱加密配置,難以完整支撐防竄改與金鑰交換需求。 - (D):同態加密與安全多方計算(MPC)功能高度重疊,且缺少非對稱加密,金鑰分發與身分驗證機制不足,通訊協議不完整。 提示:密文運算對應同態加密,金鑰交換對應非對稱加密,完整性驗證對應雜湊函數,大量傳輸對應對稱加密。

本題掛載於「隱私 / 治理」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 38 題觀念複習:評估指標

以下程式碼定義了一個評估函式: def metric(y_true, y_pred):  return sum((y_true - y_pred) ** 2) / len(y_true) 請問此程式碼所計算的是哪一類型的評估指標?

  1. AMAE
  2. BMSE
  3. CRMSE
  4. D
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 程式碼把每筆預測誤差(y_true − y_pred)取平方後加總,再除以樣本數 len(y_true),正是均方誤差 MSE(Mean Squared Error)的定義:誤差平方的平均值。平方運算會放大並加重懲罰大誤差,且使函數處處可微,因此 MSE 是迴歸模型最常用的損失與評估指標之一。 【為何其他選項錯了?】 - (A):MAE(平均絕對誤差)取誤差絕對值的平均;若為 MAE,程式碼中應以 abs() 取絕對值,而非對誤差取平方。 - (C):RMSE 是 MSE 再開平方根;程式碼缺少開根號的步驟,計算結果停在 MSE。 - (D):R² 的公式為 1 − SSE/SST,需要與總變異 SST 相除比較,程式碼中沒有對應的結構。 提示:平方未開根=MSE;再開根號=RMSE;取絕對值=MAE;與總變異比較=R²。

本題掛載於「評估指標」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 39 題觀念複習:模型訓練與調參

以下程式碼實作了神經網路的一項訓練技巧: def forward(x, p, training=True):  if training:   mask = np.random.binomial(1, p, size=x.shape)   return x * mask / p  else:   return x 請問此程式碼實現的是哪一種正則化技術?

  1. AL1正則化
  2. BL2正則化
  3. CDropout
  4. DBatch Normalization
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 程式碼具備三項關鍵特徵:第一,np.random.binomial(1, p) 產生 0 與 1 的隨機遮罩,等同隨機關閉部分神經元輸出;第二,除以 p 是 Inverted Dropout 的縮放補償,使訓練期輸出的期望值與推論期一致;第三,training=False 時直接原樣回傳輸入,訓練與推論行為不同。三者合併即為 Dropout 的標準實作:訓練時隨機丟棄神經元,防止神經元間過度共適應,達到抑制過擬合的效果。 【為何其他選項錯了?】 - (A):L1 正則化是在損失函數加入權重絕對值懲罰項,作用對象是權重,不會對輸出乘上隨機遮罩。 - (B):L2 正則化是加入權重平方懲罰項;程式碼中並無任何懲罰項的計算。 - (D):Batch Normalization 對每個批次做減均值、除標準差的正規化,並帶有可學習的縮放與平移參數,沒有隨機丟棄的機制。 提示:隨機 0/1 遮罩、除以保留率、訓練與推論行為不同,三項特徵合併即可辨識為 Dropout 實作。

本題掛載於「模型訓練與調參」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 40 題觀念複習:階段 4 大數據/ML

以下程式碼: import numpy as np v1 = np.array([1, 2, 3]) v2 = np.array([4, 5, 6]) A = np.array([[1, 2], [3, 4]]) 依據上述程式碼進行資料處理,下列何者正確?

  1. Anp.linalg.inv(A) 計算矩陣 A 的行列式
  2. Bv1 * v2 結果為 array([5, 7, 9])
  3. Cnp.dot(v1, v2) 結果為 np.int64(32)
  4. Dnp.linalg.eig(A) 計算矩陣 A 的反矩陣
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 np.dot(v1, v2) 計算兩向量的內積:1×4+2×5+3×6=4+10+18=32,回傳值為純量整數,NumPy 的顯示形式即 np.int64(32),故 (C) 正確。內積是機器學習最基礎的線性代數運算之一,從線性迴歸的加權和到注意力機制的相似度計算,底層皆以內積實作。 【為何其他選項錯了?】 - (A):np.linalg.inv(A) 計算的是反矩陣;行列式需使用 np.linalg.det(A),兩個函數的功能不同。 - (B):v1 * v2 是逐元素相乘,結果為 array([4, 10, 18]);array([5, 7, 9]) 是 v1 + v2 逐元素相加的結果,選項將乘法與加法混淆。 - (D):np.linalg.eig(A) 計算特徵值與特徵向量;反矩陣是 np.linalg.inv(A) 的功能,選項把兩個函數的用途對調。 提示:dot 是內積、* 是逐元素相乘、inv 是反矩陣、det 是行列式、eig 是特徵分解,依函數名稱對應功能。

本題掛載於「階段 4 大數據/ML」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 41 題觀念複習:階段 4 大數據/ML

考慮擲骰子並採用蒙地卡羅(Monte Carlo)方法估算條件機率,程式碼如下: import numpy as np np.random.seed(123) n = 100000 dice_rolls = np.random.randint(1, 7, size=n) A = (dice_rolls % 2 == 0) B = (dice_rolls > 3) A_and_B = A & B 事件 A:擲出偶數;事件 B:擲出大於 3。請問下列何者為條件機率 P(A|B) 的正確估計式?

  1. AA_and_B.sum() / (A.sum() * B.sum())
  2. BA_and_B.sum() / (A.sum() + B.sum())
  3. CA_and_B.sum() / A.sum()
  4. DA_and_B.sum() / B.sum()
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 條件機率的定義:P(A|B)=P(A∩B)/P(B)。以蒙地卡羅方法估計時,機率以發生次數的比例代替:P(A∩B)≈A_and_B.sum()/n,P(B)≈B.sum()/n,兩者相除後分母的 n 互相消去,得到估計式 A_and_B.sum()/B.sum(),故 (D) 正確。理論驗算:B={4,5,6},其中偶數為 {4,6},P(A|B)=2/3,十萬次模擬的估計值會非常接近 0.667。 【為何其他選項錯了?】 - (A):以 A 與 B 的發生次數相乘作分母,單位變成次數的平方,不對應任何機率公式。 - (B):以兩事件發生次數相加作分母沒有機率意義,P(A)+P(B) 不會出現在條件機率的分母。 - (C):以 A.sum() 作分母計算的是 P(B|A),即「給定擲出偶數,擲出大於 3 的機率」,條件方向與題目要求相反。 提示:P(A|B) 讀作「給定 B 之下 A 的機率」,條件事件 B 的發生次數放分母。

本題掛載於「階段 4 大數據/ML」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 42 題觀念複習:CNN

在深度神經網路中,不同層的參數量(parameter count)差異極大。有些層雖然數量少但計算量大,有些則相反。了解參數分佈情形,有助於模型壓縮與遷移學習設計。請問在 VGG16中,下列何者的參數量最多?

  1. A卷積層(Conv2d)
  2. B全連接層(Linear)
  3. CReLU激活函數
  4. D池化層(MaxPool2d, AdaptiveAvgPool2d)
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 從 VGG16 的參數統計看:三個全連接層(Linear)的參數量分別為 102,764,544、16,781,312、4,097,000,合計約 1.236 億,佔總參數 138,357,544 的近九成;僅第一個全連接層(把 512×7×7=25088 維展平向量接到 4096 個神經元)一層就超過一億。相較之下,13 個卷積層合計僅約 1,470 萬。全連接層是 VGG16 參數量最大的部分,也因此成為模型壓縮的首要目標。 【為何其他選項錯了?】 - (A):卷積層靠參數共享節省參數,單層最多約兩百多萬,13 層加總約 14.7M,只佔總量約一成。 - (C):ReLU 只是逐元素的 max(0, x) 運算,模型摘要中參數欄位為 0,不含任何可學習參數。 - (D):池化層(MaxPool2d、AdaptiveAvgPool2d)只做取最大值或平均值的固定運算,同樣沒有可學習參數。 提示:VGG16 約九成參數集中於全連接層;模型壓縮優先處理 FC 層。

本題掛載於「CNN」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 43 題觀念複習:CNN

在神經網路中,了解各層的運算量分佈,有助於模型壓縮與硬體加速的策略設計。請問在 VGG16中,下列何者運算量(FLOPs)最多?

  1. A卷積層(Conv2d)
  2. B全連接層(Linear)
  3. CReLU激活函數
  4. D池化層(MaxPool2d, AdaptiveAvgPool2d)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 運算量(FLOPs)與參數量是兩個不同的指標:卷積層的每個濾波器要在特徵圖的「每一個空間位置」重複做乘加運算,FLOPs 約等於參數量乘以輸出特徵圖的空間尺寸。例如 Conv2d-3 只有 36,928 個參數,但在 150×150 的特徵圖上滑動,單層運算量就達數億次;全部卷積層的 FLOPs 以百億計,佔 VGG16 總運算量九成以上,是模型中運算最密集的部分。 【為何其他選項錯了?】 - (B):全連接層參數雖多,但每個權重只參與一次乘加,FLOPs 約等於參數量(約 1.2 億次),比卷積層低約兩個數量級。 - (C):ReLU 只做逐元素比較取大,運算量極低,可忽略不計。 - (D):池化層只做局部取最大值或平均值,沒有密集的乘加運算,FLOPs 同樣可忽略。 提示:參數集中於 FC、運算集中於 Conv;壓縮參數優先處理全連接層,加速推論優先優化卷積層。

本題掛載於「CNN」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 44 題觀念複習:CNN

以 torchsummary 對輸入尺寸 (3, 150, 150) 的預訓練 VGG16 輸出模型摘要,關鍵資訊節錄如下: MaxPool2d-31 輸出 [-1, 512, 4, 4],參數 0 AdaptiveAvgPool2d-32 輸出 [-1, 512, 7, 7],參數 0 Linear-33 輸出 [-1, 4096],參數 102,764,544 Linear-36 輸出 [-1, 4096],參數 16,781,312 Linear-39 輸出 [-1, 1000],參數 4,097,000 Total params: 138,357,544 Forward/backward pass size (MB): 96.93 Params size (MB): 527.79 Estimated Total Size (MB): 624.98 VGG16 層數深且結構規則,由多層卷積、池化及全連接層組成。根據 VGG16 的模型架構,下列敘述何者正確?

  1. AAdaptiveAvgPool2d 的輸出會被攤平後傳入第一個全連接層;由於前一層池化輸出空間為 4×4,所以第一個線性層的輸入維度是 512×4×4 = 8192
  2. BLinear-33(第一個全連接層)報出的 102,764,544 參數只包含權重,偏差(bias)沒有算在內
  3. C根據列出的「Estimated Total Size (MB) = 624.98」,表示訓練此模型只需大約 625MB 的 GPU 記憶體(包含所有 optimizer state 與梯度),所以一張 1GB 的 GPU 就足夠訓練
  4. DVGG16 包含 13 層卷積層(conv)與 3 層全連接層(FC),總參數數目約為 138,357,544(約 138.36M)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 VGG16 的「16」指 16 個具可學習權重的層:13 層卷積(Conv2d)加 3 層全連接(Linear);摘要表的 Total params 也印證總參數為 138,357,544(約 138.36M)。層數結構與參數總量兩個數字都與敘述吻合。 【為何其他選項錯了?】 - (A):展平後接進第一個全連接層的是 AdaptiveAvgPool2d 的輸出(512×7×7=25088 維),不是 MaxPool 的 4×4;驗算:25088×4096+4096=102,764,544,與表中參數完全吻合,8192 的說法錯誤。 - (B):由同一筆驗算可見,102,764,544 等於權重 25088×4096 再加上 4096 個偏差項——bias 已包含在參數統計內,並非只計權重。 - (C):624.98MB 只是單一樣本前向/反向傳遞加上參數本身的估計,不含優化器狀態、梯度緩衝與更大批次的啟動值;實際訓練所需記憶體遠高於此,1GB 的 GPU 不足以訓練 VGG16。 提示:VGG16=13 Conv+3 FC;torchsummary 的 Estimated Total Size 僅是單樣本推估,訓練所需記憶體遠高於該數字。

本題掛載於「CNN」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 45 題觀念複習:CNN

在實務應用中,我們常使用遷移學習(Transfer Learning)技巧:載入預訓練模型(如 VGG16),凍結部分層的參數,只針對特定任務重新訓練最後幾層,以節省訓練時間並提升模型效能。假設你要對 VGG16 進行遷移學習,希望凍結卷積層的參數,只訓練最後的全連接層(classifier)。下列四段程式碼(均已 import torch 與 import torchvision.models as models): 程式碼A: model = models.vgg16(pretrained=True) for param in model.parameters():  param.requires_grad = False model.classifier[6] = torch.nn.Linear(4096, 10) 程式碼B: model = models.vgg16(pretrained=True) for param in model.features.parameters():  param.requires_grad = False model.classifier[6] = torch.nn.Linear(4096, 10) 程式碼C: model = models.vgg16(pretrained=True) for param in model.classifier.parameters():  param.requires_grad = False model.classifier[6] = torch.nn.Linear(4096, 10) 程式碼D: model = models.vgg16(pretrained=True) model.requires_grad = False model.classifier[6] = torch.nn.Linear(4096, 10) 請問哪一段程式碼寫法正確?

  1. A程式碼A
  2. B程式碼B
  3. C程式碼C
  4. D程式碼D
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 torchvision 的 VGG16 結構分成 model.features(全部卷積與池化層)與 model.classifier(三層全連接)。程式碼B 只對 model.features.parameters() 逐一設 requires_grad=False,凍結卷積特徵抽取器,整個 classifier 保持可訓練,最後再把 classifier[6] 換成輸出 10 類的新層——完全符合「凍結卷積層、只訓練全連接分類頭」的需求。 【為何其他選項錯了?】 - (A):對 model.parameters() 全部凍結後才替換最後一層,結果只有新換上的 classifier[6] 可訓練,classifier 前兩層全連接仍被凍結,不符「訓練整個 classifier」的要求。 - (C):凍結對象錯誤——把 classifier 凍結,卷積層反而全部可訓練,與需求方向完全相反。 - (D):model.requires_grad = False 只是替 Module 物件新增一個自訂屬性,不會作用到任何參數;凍結必須逐一設定參數的 requires_grad(或使用 requires_grad_() 方法),這行實際上沒有凍結任何參數。 提示:凍結要落在 parameters() 上——要凍結哪一段,就迭代該段的 parameters 設 requires_grad=False。

本題掛載於「CNN」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 46 題觀念複習:PCA

研究人員使用 sklearn 內建手寫數字資料集 digits(每張影像 8×8 灰階、共 1797 筆、64 維特徵),並以以下程式碼加入雜訊: import numpy as np noisy = np.random.normal(digits.data, 4) 接著嘗試使用 PCA 對 noisy 進行降噪,程式碼如下(行末註解為程式碼編號): from sklearn.decomposition import PCA #程式碼A pca = PCA() #程式碼B pca.fit(noisy) #程式碼C components = pca.transform(noisy) #程式碼D filtered = pca.inverse_transform(components) #程式碼E 他們希望保留影像的主要特徵、去除雜訊,但程式執行後影像仍含明顯雜訊。請問哪一段程式碼需要修改,才能讓 PCA 對 noisy 影像有效去噪?

  1. A程式碼A
  2. B程式碼B
  3. C程式碼C
  4. D程式碼D
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 PCA 降噪的原理是只保留解釋變異量大的前幾個主成分來重建資料,將主要分布在小變異方向上的雜訊濾除。程式碼B 的 pca = PCA() 未指定 n_components,預設會保留全部 64 個主成分;此時 transform 再 inverse_transform 等於將原資料完整重建,雜訊完全不會被濾除。應改為 pca = PCA(n_components=k)(k 為較小的整數),或以解釋變異比例自動選取成分數(如 PCA(0.5)),降噪才會生效。 【為何其他選項錯了?】 - (A):import 敘述本身沒有問題,匯入的類別也正確。 - (C):pca.fit(noisy) 的用法正確;問題不在擬合這一步,而在建立模型時未限制成分數。 - (D):components = pca.transform(noisy) 是標準的投影寫法,本身無誤。 提示:PCA 降噪的關鍵在 n_components;主成分全數保留等於原樣重建,不具濾噪效果。

本題掛載於「PCA」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 47 題觀念複習:K-近鄰 (KNN)

研究人員對 sklearn 內建的手寫數字資料集 digits(1797 筆、64 維特徵、共 10 個類別)進行分類,決定使用 KNN 並搭配交叉驗證評估模型準確率。他們撰寫了四組程式碼(均已執行 from sklearn.model_selection import StratifiedKFold, cross_val_score、from sklearn.neighbors import KNeighborsClassifier,並設定 X, y = digits.data, digits.target): 程式碼A: model = KNeighborsClassifier(n_neighbors=3) cv = StratifiedKFold(n_splits=5, shuffle=True) scores = cross_val_score(model, X, y, cv=cv, scoring="accuracy") print(scores.mean()) 程式碼B: model = KNeighborsClassifier(n_neighbors=3) cv = StratifiedKFold(n_splits=5, shuffle=True) scores = cross_val_score(model, X, y, cv=cv, scoring="f1") print(scores.mean()) 程式碼C: model = KNeighborsClassifier(n_neighbors=3) scores = cross_val_score(model, X, y, cv=5, scoring="accuracy") print(scores.mean()) 程式碼D: model = KNeighborsClassifier(n_neighbors=3) scores = cross_val_score(model, X, y, cv=5, scoring="f1") print(scores.mean()) 請問哪幾組程式碼能正確使用 KNN 搭配交叉驗證,對 digits 資料集進行訓練並輸出準確率?

  1. A程式碼A、程式碼B、程式碼C、程式碼D
  2. B程式碼A、程式碼C
  3. C程式碼A、程式碼B
  4. D程式碼C、程式碼D
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 逐組檢查:程式碼A 以 StratifiedKFold(n_splits=5, shuffle=True) 搭配 scoring="accuracy",語法正確,輸出的是準確率。程式碼C 直接指定 cv=5,cross_val_score 對分類器預設即採用分層 K 折(Stratified KFold),搭配 scoring="accuracy" 同樣能正確輸出準確率。因此程式碼A 與程式碼C 皆能正確完成題目要求。 【為何其他選項錯了?】 - (A):程式碼B 與 D 使用 scoring="f1",而 digits 是 10 個類別的多元分類;"f1" 預設採 binary 平均,遇到多類別資料會直接拋出錯誤,必須改用 f1_macro、f1_micro 等指定平均方式;且 F1 分數也不是題目要求輸出的準確率。 - (C):包含程式碼B,其 scoring="f1" 在多類別資料上無法執行,理由同上。 - (D):程式碼D 同樣因 "f1" 設定而失敗,且此選項還遺漏了正確的程式碼A。 提示:多類別分類的 F1 必須指定平均方式(f1_macro/f1_micro);cv 給整數時,分類任務預設自動分層。

本題掛載於「K-近鄰 (KNN)」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 48 題觀念複習:標準化 / Robust

使用鐵達尼號(Titanic)資料集進行 MLP 分類預測,資料切分後以下列程式碼對特徵矩陣進行處理: X_train -= X_train.mean(axis=0) X_train /= X_train.std(axis=0) X_test -= X_test.mean(axis=0) X_test /= X_test.std(axis=0) 針對下列敘述: A:X_train -= X_train.mean(axis=0) 將每個訓練集特徵的平均值調整為 0 B:X_train /= X_train.std(axis=0) 將每個訓練集特徵的標準差調整為 0 C:X_train 處理結果會將資料壓縮到 0 和 1 之間 D:標準化結果防止梯度爆炸或消失 E:標準化是屬於特徵選擇(Feature Selection)方法 F:X_train 程式碼應修正為 X_train = X_train.std(axis=0),X_test 程式碼應修正為 X_test = X_test.std(axis=0) 請問下列何者正確?

  1. AA、B、C、D
  2. BA、E
  3. CA、D
  4. DA、C、F
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 這段程式碼執行的是 Z-score 標準化。敘述A正確:每個特徵減去自身平均值後,平均值變為 0。敘述D正確:標準化讓各特徵尺度一致、輸入分布穩定,能改善神經網路訓練的數值條件,降低梯度爆炸或梯度消失的風險。因此正確組合為 A、D。 【為何其他選項錯了?】 - (A):敘述B錯誤,除以標準差是把標準差調整為 1,不是 0;標準差為 0 代表資料完全沒有變異,並非標準化的結果。敘述C錯誤,壓縮到 0 與 1 之間是 Min-Max 正規化的效果,Z-score 的結果可正可負、沒有固定上下界。 - (B):敘述E錯誤,標準化屬於特徵縮放(Feature Scaling),不會刪減任何特徵,與特徵選擇是不同概念。 - (D):敘述F錯誤,改成 X_train = X_train.std(axis=0) 會把整個特徵矩陣覆蓋成「每欄一個標準差值」的向量,原始資料完全遺失,並非正確的修正方式。 提示:Z-score 標準化:減去均值使均值為 0、除以標準差使標準差為 1;要壓縮到 [0,1] 區間應使用 Min-Max 正規化。

本題掛載於「標準化 / Robust」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 49 題觀念複習:ANN / MLP

使用鐵達尼號資料集(前處理後 X_train 具有 9 個特徵欄位)建立 MLP 分類模型,程式碼與 model.summary() 輸出如下: model = Sequential() model.add(Input(shape=(X_train.shape[1],))) model.add(Dense(10, activation="relu")) model.add(Dense(10, activation="relu")) model.add(Dense(1, activation="sigmoid")) model.summary() model.compile(loss="binary_crossentropy", optimizer="adam", metrics=["accuracy"]) Model: "sequential" dense (Dense) 輸出 (None, 10) Param # = 空格1 dense_1 (Dense) 輸出 (None, 10) Param # = 空格2 dense_2 (Dense) 輸出 (None, 1) Param # = 11 參考上述執行結果,下列何者正確?

  1. Aactivation="relu" 其數學式為 f(x) = 1/(1+e^(-x))
  2. B空格1值為 110,空格 2值為 100
  3. C空格1值為 100,空格 2值為 110
  4. Dactivation="sigmoid" 一般用於多類別分類預測模型
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 Dense 層參數量公式為(輸入維度+1)×神經元數,其中 +1 來自每個神經元的偏差項(Bias)。第一層 dense:輸入為 9 個特徵,(9+1)×10 = 100,故空格1 = 100;第二層 dense_1:輸入為前一層的 10 個輸出,(10+1)×10 = 110,故空格2 = 110;以第三層 dense_2 驗算:(10+1)×1 = 11,與 summary 顯示的 11 吻合,推算無誤,選項 (C) 正確。 【為何其他選項錯了?】 - (A):f(x) = 1/(1+e^(-x)) 是 Sigmoid 的數學式;ReLU 的定義為 f(x) = max(0, x),兩者完全不同。 - (B):數值對調了:110 是第二層的參數量,100 才是第一層。 - (D):sigmoid 搭配 binary_crossentropy 用於二元分類(本題預測存活與否正是如此);多類別分類的輸出層慣用 softmax。 提示:Keras Dense 參數量=(輸入數+1)×神經元數;可由已知層(本題輸出層參數為 11)反推驗證偏差項的存在。

本題掛載於「ANN / MLP」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 50 題觀念複習:評估指標

鐵達尼號 MLP 模型訓練後,以下列程式碼繪製損失曲線: history = model.fit(X_train, y_train, validation_split=0.2, epochs=100, batch_size=10) loss, accuracy = model.evaluate(X_train, y_train, verbose=0) import matplotlib.pyplot as plt loss = history.history["loss"] epochs = range(1, len(loss)+1) val_loss = history.history["val_loss"] plt.plot(epochs, loss, 空格1, label="Training Loss") plt.plot(epochs, val_loss, 空格2, label="Validation Loss") plt.title("Training and Validation Loss") plt.xlabel("Epochs") plt.ylabel("Loss") plt.legend() plt.show() 執行後的圖形顯示:Training Loss 為藍色實線,自約 0.65 持續下降至約 0.40;Validation Loss 為紅色虛線,前期快速下降後,約自第 15 輪起在 0.45~0.46 附近震盪持平。針對下列敘述: A:空格1 須填入 "b-" B:空格2 須填入 "b--" C:空格1 須填入 "r-" D:空格2 須填入 "r--" E:驗證損失明顯較訓練損失減少更明顯 請問下列何者正確?

  1. AB、C
  2. BA、C、D
  3. CA、D
  4. DC、D、E
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 對照圖形:Training Loss 是「藍色實線」,對應第一個 plt.plot 的格式字串,空格1 須填 "b-"(b=blue,-=實線),敘述A正確;Validation Loss 是「紅色虛線」,空格2 須填 "r--"(r=red,--=虛線),敘述D正確。正確組合為 A、D。 【為何其他選項錯了?】 - (A):敘述B主張空格2填 "b--",但驗證損失是紅色虛線,顏色設定錯誤;敘述C主張空格1填 "r-",訓練損失是藍色而非紅色,兩條敘述皆錯誤。 - (B):混入錯誤的敘述C——空格1若填 "r-",訓練損失會變成紅線,與圖形不符,也與敘述A矛盾。 - (D):敘述C錯誤;敘述E亦錯——訓練損失持續下降至約 0.40,驗證損失自第 15 輪起停留在 0.45~0.46 附近,下降幅度明顯較小,「驗證損失減少更明顯」與圖形相反。 提示:matplotlib 格式字串=顏色字母+線型符號:"b-" 為藍色實線、"r--" 為紅色虛線;訓練與驗證損失走勢分岔即為過擬合的徵兆。

本題掛載於「評估指標」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。