iPAS 歷屆考題 · 中級
115年第一次中級AI應用規劃師 機器學習技術與應用
第三科 · 共 50 題 · 每題附正解與逐選項詳解,「觀念複習」直達對應教學節點。
50 題
中級第三科
建議先自行作答再展開詳解;每題可透過「觀念複習」回到掛載該題的知識節點。試題著作權屬原主辦單位,本站解析僅供考生學習之用。
某量化投資團隊需估算某投資組合未來 30 日的風險值。由於衍生性金融商品的定價模型過於複雜,無法以解析解直接求得,工程師因此採用隨機模擬方式,產生大量市場情境模擬並估計損失分布。此方法屬於下列哪一種技術框架?
A 馬可夫鏈(Markov Chain):以狀態轉移機率描述系統演變的隨機過程
B 梯度下降最佳化(Gradient Descent):透過迭代更新參數以最小化損失函數
C 蒙地卡羅方法(Monte Carlo Method):透過大量隨機抽樣近似機率分布或數值結果
D 貝氏推論(Bayesian Inference):結合先驗分布與資料更新後驗機率
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
蒙地卡羅方法(Monte Carlo Method)的核心是透過大量隨機抽樣,近似難以解析求解的機率分布或數值結果。題幹情境中,衍生性商品定價模型過於複雜、無法以解析解直接求得風險值,工程師因此產生大量隨機市場情境、模擬損失分布,再據以估計未來 30 日風險值(VaR),正是金融風險管理中蒙地卡羅模擬的典型應用,故 (C) 正確。
【為何其他選項錯了?】
- (A):馬可夫鏈描述「狀態依轉移機率演變」的隨機過程,重點在狀態轉移結構;題幹並未建模狀態轉移,而是直接以大量抽樣估計損失分布。兩者可結合為 MCMC,但本題考點是抽樣近似本身。
- (B):梯度下降是最佳化演算法,以迭代更新參數來最小化損失函數;其「損失函數」是模型訓練的目標函數,與估計投資損失分布是不同概念。
- (D):貝氏推論的核心是以先驗分布結合觀測資料更新後驗機率;題幹沒有先驗與後驗更新的流程。
提示:無解析解且以大量隨機抽樣近似,對應蒙地卡羅;狀態轉移對應馬可夫鏈;先驗更新對應貝氏推論。
本題掛載於「階段 4 大數據/ML 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某工程師在建立房價預測模型時,訓練資料中存在少數豪宅(成交價超過一般物件10倍以上)。若工程師希望模型對這些極端高價物件的預測誤差更敏感,並在訓練時產生較大的梯度更新影響,應優先選擇下列哪種損失函數?
A 平均絕對誤差(MAE):對誤差進行線性懲罰,對離群值較不敏感,梯度近似固定
B Huber 損失(Huber Loss):小誤差採平方懲罰,大誤差轉為線性懲罰,以降低離群值影響
C 均方誤差(MSE):對誤差進行平方處理,使大誤差產生更大的懲罰與梯度
D 交叉熵損失(Cross-Entropy Loss):用於分類問題的機率分布差異衡量
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
MSE 對誤差取平方,誤差越大、懲罰呈平方放大(誤差 10 倍、懲罰 100 倍),且反向傳播的梯度與誤差大小成正比,因此極端高價豪宅這類大誤差樣本會主導梯度更新。題目明確要求「對極端高價物件的預測誤差更敏感、訓練時產生較大梯度影響」,正對應 MSE 對離群值敏感的特性——此特性在多數場景被視為缺點,本題的需求恰好要利用它。
【為何其他選項錯了?】
- (A):MAE 對誤差線性懲罰、梯度大小近似固定(只反映正負方向),對離群值最不敏感,與題目需求完全相反。
- (B):Huber 損失的設計初衷就是「小誤差用平方、大誤差改線性」以降低離群值影響;選用它等於刻意壓低豪宅樣本對梯度的影響,與題目要求相反。
- (D):交叉熵是衡量機率分布差異的分類損失函數,房價預測是迴歸任務,並不適用。
提示:要放大離群值影響選 MSE;要抵抗離群值選 MAE 或 Huber;分類問題才使用交叉熵。
本題掛載於「損失函數 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某工程師在撰寫 Transformer 的 Attention 層時,需手動驗證矩陣維度是否相容。輸入矩陣 Q 已攤平成形狀為 (1, 10),Query 投影權重矩陣 W 形狀為 (10, 64)。執行 Q × W 後輸出的形狀為何?
A (1, 64)
B (10, 10)
C (64, 1)
D 維度不相容,無法相乘
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
矩陣乘法 (m, n) × (n, k) 的相容條件是前者的行數等於後者的列數,輸出形狀為 (m, k)。本題 Q 形狀為 (1, 10),W 形狀為 (10, 64),內側維度 10 相等,故可相乘,輸出形狀為 (1, 64)。語意上即是將一個 token 的 10 維輸入向量,經線性投影轉換為 64 維的 Query 向量,正是 Attention 中 Q/K/V 投影層的運算。
【為何其他選項錯了?】
- (B):(10, 10) 是誤將兩個內側維度相乘;矩陣乘法的輸出取外側維度 (1, 64),內側維度在相乘過程中消去,不會保留在結果中。
- (C):(64, 1) 是正確答案的轉置,相當於計算 Wᵀ × Qᵀ;矩陣乘法不具交換律,順序與轉置皆不可任意調換。
- (D):內側維度一致(10 對 10)即可相乘;僅當內側維度不相等,例如 (1, 10) × (64, 10),才會發生維度不相容。
提示:記住 (m, n) × (n, k) = (m, k):內側維度須相等且會消去,輸出保留外側維度。
本題掛載於「注意力機制 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某 AI 團隊同時開發多個影像辨識系統,並在訓練流程中統一加入資料擴增策略(包含隨機水平翻轉)以提升模型泛化能力。實驗後發現,部分任務的測試表現明顯下降。下列哪一項任務最可能因該資料擴增策略引入語意錯誤(Semantic Inconsistency),使同一樣本在翻轉後對應不同類別標籤,進而影響模型學習?
A 寵物監控中的貓狗分類
B 車輛辨識中的車型分類
C 手寫數字辨識
D 道路場景中的行人偵測
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
隨機水平翻轉的隱含假設是「鏡像後語意不變」。手寫數字的字形具有方向性:2、3、7 翻轉後筆畫方向顛倒、不再是合法寫法,部分字形鏡像後甚至更接近其他字元,但標籤仍是原本的類別——同一樣本翻轉後,影像語意與標籤已經對不上,模型等於被餵入標註錯誤的訓練資料,測試表現自然下降,這就是題目所稱的語意錯誤(Semantic Inconsistency)。
【為何其他選項錯了?】
- (A):貓翻轉後仍是貓、狗仍是狗,水平翻轉是貓狗分類最安全常用的增強手法之一。
- (B):車輛左右鏡像不會改變車型類別,車頭朝左或朝右都是同一款車。
- (D):行人偵測中,翻轉後行人仍是行人,只要邊界框座標一併翻轉即可,類別語意不受影響。
提示:對數字、字母、交通標誌等具方向性的符號類資料,鏡像增強可能改變語意,套用前須逐類檢視。
本題掛載於「電腦視覺 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某工程師完成多元線性迴歸模型後,繪製殘差圖(Residual Plot),發現殘差隨預測值增大而呈現擴散現象(右側明顯比左側分散)。此現象最可能代表什麼問題?
A 殘差之間存在關聯
B 特徵之間高度相關
C 殘差變異數不一致
D 殘差不符合常態分布
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
殘差圖中,殘差的散布幅度隨預測值增大而擴大(呈喇叭形、扇形),代表誤差的變異數不是常數,這就是異質變異數(Heteroscedasticity),違反線性迴歸「同質變異數」的基本假設。房價等金額型目標常見此現象(金額越大誤差越大),常用對策是對目標值做對數轉換,或改用加權最小平方法(WLS)。
【為何其他選項錯了?】
- (A):殘差之間存在關聯(自相關)多出現在時間序列資料,診斷依靠 Durbin-Watson 檢定或殘差對時間的圖形,而非「隨預測值擴散」的形狀。
- (B):特徵之間高度相關是多重共線性問題,診斷使用 VIF 或相關係數矩陣;殘差圖無法直接顯示共線性。
- (D):殘差是否符合常態分布應以 Q-Q 圖或直方圖檢視;喇叭形反映的是散布寬度隨預測值改變,是變異數問題,不是分布形狀問題。
提示:殘差圖喇叭形對應異質變異數;Q-Q 圖偏離對應非常態;DW 檢定對應自相關;VIF 對應共線性。
本題掛載於「線性回歸 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某資料科學家欲對 512維詞嵌入向量(共 10萬筆)進行視覺化以探索群集結構,同時另一工程師需將 200 個製程特徵降維後作為 XGBoost 的輸入特徵。關於 t- SNE與 PCA 選型,下列敘述何者最正確?
A t-SNE 保留全局線性結構,適合作為 XGBoost 的降維前處理
B t-SNE 保留局部鄰域結構,適合視覺化;但不保留全局結構,不適合作為模型輸入特徵
C PCA 為非線性降維方法,能保留複雜流形結構
D t-SNE 與PCA 皆可直接對新資料進行線性外推
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
t-SNE 透過機率化的鄰域關係將高維資料壓縮至 2 至 3 維,擅長保留局部鄰域結構,適合對 10 萬筆詞嵌入進行群集視覺化探索;但它不保留全局距離與密度資訊,座標軸沒有可解釋意義,且標準 t-SNE 沒有 transform 方法,無法將新資料一致地投影至既有空間,因此不適合作為 XGBoost 等下游模型的輸入特徵。需要降維後輸入模型的場景,應使用 PCA 這類可重複套用於新資料的方法。
【為何其他選項錯了?】
- (A):t-SNE 並不保留全局線性結構,將其作為梯度提升模型的降維前處理是典型誤用。
- (C):PCA 是線性降維方法(尋找變異最大的線性投影方向),無法保留複雜的非線性流形結構;此敘述將它說成非線性方法,正好相反。
- (D):PCA 可對新資料進行線性投影(transform),但 t-SNE 每次需對整批資料重新最佳化,無法對新資料線性外推,「皆可」不成立。
提示:t-SNE 用於視覺化探索,PCA 用於產生模型輸入特徵;要輸入下游模型的降維,選具 transform 能力的方法。
本題掛載於「t-SNE 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某金融團隊建立信貸風險模型,特徵工程後共產生 200個變數,其中「月收入」、「年收入」、「季收入」三者高度相關。模型上線後業務單位反映:每次重新訓練後,模型輸出的重要特徵清單在這些高度相關特徵間反覆變動,難以向審查單位解釋。請問下列何者為造成此現象最可能的原因?
A 模型使用 L2 正則化,導致所有特徵係數被壓縮至接近零,重要性難以區分
B 模型使用 L1正則化,面對高度相關特徵時隨機保留其中之一,導致每次訓練保留的特徵不穩定
C 模型未使用任何正則化,過擬合導致係數每次收斂至不同極值
D 特徵數量過多導致梯度消失,應優先進行 PCA 降維再套用正則化
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
L1(Lasso)正則化傾向產生稀疏解:面對「月收入、年收入、季收入」這種近乎完全共線的特徵群,L1 只需保留其中一個就能達到幾乎相同的損失;至於保留哪一個,取決於資料的微小擾動與求解路徑。因此每次重新訓練,被保留的特徵可能不同,重要特徵清單自然反覆變動。這是 L1 面對高度相關特徵的固有行為,但對需要穩定解釋的審查場景確實構成困擾。
【為何其他選項錯了?】
- (A):L2 會把相關特徵的權重分攤並全部保留、不歸零,係數估計反而穩定;「所有特徵係數被壓縮至接近零、重要性難以區分」並非 L2 的實際行為。
- (C):無正則化的過擬合會使係數數值不穩定,但不會出現「三者擇一、每次選擇不同」的稀疏選擇行為;題目現象正是稀疏選擇的典型表現。
- (D):梯度消失是深度神經網路的問題,與特徵數量無關;此選項的診斷與處方都不對應題目情境。
提示:高度相關特徵搭配 L1,保留對象具不確定性;需要穩定解釋用 L2,兼顧稀疏與穩定用 Elastic Net。
本題掛載於「Lasso (L1) 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某深度學習工程師訓練 ResNet 時,發現模型在前幾個 Epoch驗證損失快速下降,但從第 15 個 Epoch 起驗證損失開始上升,而訓練損失持續下降。工程師將學習率調高後,訓練損失反而開始明顯震盪。學習率過大最直接導致下列哪種現象?
A 梯度消失(Gradient Vanishing):梯度在反向傳播中逐層縮小趨近於零,底層無法學習
B 損失函數震盪或發散(Oscillation / Divergence):每次更新步伐過大,參數在最優點兩側反覆跳越,無法穩定收斂
C 過擬合(Overfitting):模型記憶訓練資料的雜訊,泛化能力下降
D 死亡 ReLU(Dying ReLU):大量神經元輸出永久為零,停止參與梯度更新
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
學習率決定每次參數更新的步伐大小。學習率過大時,每一步都跨過最優點,參數在損失谷底兩側來回跳躍,損失曲線呈現震盪;更嚴重時步伐越跳越遠,損失直接發散。題目中「將學習率調高後,訓練損失開始明顯震盪」正是這個最直接的因果關係。
【為何其他選項錯了?】
- (A):梯度消失是反向傳播時梯度逐層縮小所致,主因是網路深度與飽和型激活函數,與學習率過大無關;學習率過大造成的是更新過度,而非更新訊號不足。
- (C):過擬合是題目前段描述的現象(驗證損失回升、訓練損失續降),但問題問的是「學習率過大最直接導致什麼」,過擬合不是調大學習率的直接後果。
- (D):過大的學習率確實可能將 ReLU 神經元推入負區造成 Dying ReLU,但屬間接副作用;最直接、必然觀察到的是更新步伐過大造成的震盪與發散。
提示:學習率過大導致震盪或發散,過小導致收斂緩慢;調整學習率前先觀察損失曲線的形狀。
本題掛載於「梯度下降 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某工程師訓練深度神經網路時發現損失函數震盪嚴重且收斂速度慢,改用 Adam優化器後訓練變得穩定且收斂更快。下列何者為 Adam 能改善此問題的主要原因?
A 同時結合一階動量(Momentum)與自適應學習率(Adaptive Learning Rate),為每個參數調整更新步長
B 強制所有參數使用相同學習率(Learning Rate),避免梯度差異造成不穩定
C 透過批次正規化(Batch Normalization)重新分布輸入資料
D 將梯度裁剪為固定範圍以避免梯度爆炸(Gradient Explosion)
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
Adam 同時結合兩個機制:一階動量(梯度的指數移動平均,如同 Momentum,平滑更新方向、抑制震盪)與二階動量(梯度平方的移動平均,用來為每個參數自適應調整步長,精神同 RMSProp)。損失震盪嚴重代表梯度方向雜訊大,動量可以平滑;收斂慢常因各參數的梯度尺度差異大,自適應學習率讓每個參數以合適的步伐前進——因此改用 Adam 後訓練變得穩定且收斂更快。
【為何其他選項錯了?】
- (B):敘述與事實相反。Adam 的特點正是「每個參數擁有自己的有效學習率」,不是強制所有參數共用同一步長。
- (C):批次正規化(Batch Normalization)是網路架構中的一種層,用來正規化各層輸入分布;它不是優化器的內建機制,Adam 不會重新分布輸入資料。
- (D):把梯度裁剪到固定範圍是 Gradient Clipping,屬於防梯度爆炸的獨立技巧,可與各種優化器搭配,但不是 Adam 的核心原理。
提示:Adam=Momentum(方向平滑)+RMSProp(步長自適應),兩個機制同時作用,故兼顧穩定與收斂速度。
本題掛載於「梯度下降 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某工程師同時開發兩個模型:一個預測使用者「隔日 App使用時長(分鐘)」,另一個預測使用者「隔日是否流失(是/否)」。關於上述兩個任務,他應分別選擇哪種適當的損失函數?
A 使用時長預測:均方誤差(MSE);流失預測:二元交叉熵(Binary Cross- Entropy)
B 使用時長預測:交叉熵損失(Cross-Entropy);流失預測:均方誤差(MSE)
C 使用時長預測:Hinge 損失(Hinge Loss);流失預測:MAE(平均絕對誤差)
D 兩個任務均使用交叉熵損失,因為兩者的輸出都有不確定性
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
「隔日 App 使用時長(分鐘)」是連續數值,屬迴歸任務,均方誤差(MSE)是標準選擇;「隔日是否流失(是/否)」是二元分類,二元交叉熵(Binary Cross-Entropy)衡量預測機率與真實標籤的差異,是標準配置。損失函數必須依任務型態選擇,這是建模的基本原則。
【為何其他選項錯了?】
- (B):兩者剛好對調。交叉熵要求輸出是機率分布,用於擬合「幾分鐘」的連續數值並無意義;MSE 用在分類上則梯度性質差、學習訊號弱。
- (C):Hinge Loss 是 SVM 的分類損失,不能用於時長迴歸;MAE 是迴歸損失,不適合流失與否的二元分類——兩個任務的損失都放錯位置。
- (D):「輸出有不確定性」不是使用交叉熵的理由;迴歸任務的輸出不是機率分布,交叉熵無法定義。
提示:迴歸對應 MSE/MAE;二元分類對應 BCE;多類單標籤對應 Categorical CE。任務型態決定損失函數。
本題掛載於「損失函數 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某工程師在 A100 GPU 叢集上訓練大型語言模型,觀察到以下現象:全批次梯度下降時 GPU 利用率達 100%,但每次更新耗時 45 秒;隨機梯度下降(SGD)每次更新僅需 0.01秒,但梯度極不穩定、訓練曲線震盪劇烈。為兼顧梯度穩定性與GPU吞吐量(Throughput),應採用下列哪種策略?
A 全批次梯度下降(Full-batch GD):使用完整資料集計算梯度,更新穩定但每次更新耗時長
B 隨機梯度下降(SGD):每次只用一個樣本,速度快但梯度雜訊大,收斂不穩定
C 第二階梯度法(Newton's Method):利用 Hessian 矩陣精確估計曲率,大幅減少更新次數
D 小批次梯度下降(Mini-batch GD):以適當批次大小(如 256-2048)平衡梯度估計穩定性與GPU平行效率,是深度學習的業界標準
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
小批次(Mini-batch)梯度下降每次用一小批樣本(如 256~2048)估計梯度:批內平均使梯度雜訊遠小於單樣本 SGD,更新方向穩定;批次大小又足以充分利用 GPU 的平行計算單元,吞吐量高、單次更新遠快於全批次的 45 秒。它是「梯度穩定性」與「硬體效率」的折衷,也是深度學習實務的預設標準。
【為何其他選項錯了?】
- (A):全批次每次更新都要掃過整個資料集,更新頻率太低、整體訓練時間拉長;GPU 利用率 100% 不等於訓練有效率。
- (B):單樣本 SGD 更新雖快,但梯度雜訊大、曲線劇烈震盪,題目已明說這正是要解決的問題。
- (C):牛頓法需要計算並儲存 Hessian 矩陣(規模為參數數量的平方),大型語言模型參數動輒數十億,Hessian 的儲存與求逆遠超記憶體與運算的可行範圍。
提示:Full-batch 穩定但慢,單樣本 SGD 快但雜訊大;Mini-batch 兼顧梯度穩定與 GPU 效率,是深度學習實務標準。
本題掛載於「梯度下降 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某醫院導入肺癌篩檢模型,資料集中正常病例佔 99%、肺癌陽性僅佔 1%。模型上線後,系統報告整體準確率(Accuracy)為 99.1%。醫師對此數字感到疑慮,認為不足以評估臨床價值,在漏診風險上可能存在重大問題。請問在此情境下,僅以Accuracy 作為評估指標最嚴重的缺陷為何?
A Accuracy 對類別不平衡不敏感,可能無法反映模型對肺癌陽性的偵測能力
B Accuracy 的計算不包含模型對邊界樣本的分類結果,容易遺漏困難樣本
C Accuracy 無法處理多分類問題,在二元分類下需改用 AUC
D Accuracy 無法揭示模型的收斂速度,因此不適合用來選擇最終模型
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
類別極度不平衡(99:1)時,模型即使將所有病例判為正常,Accuracy 仍有 99%,卻可能完全未偵測到任何肺癌陽性。Accuracy 將 TP 與 TN 合併計算,對少數類的偵測能力不敏感;而臨床上最重視的正是漏診數量(FN)。因此僅以 Accuracy 評估的最嚴重缺陷,是無法反映模型對肺癌陽性的偵測能力,應改以 Recall(Sensitivity)、Precision、F1、PR-AUC 等針對少數類的指標評估,故 (A) 正確。
【為何其他選項錯了?】
- (B):Accuracy 的計算涵蓋所有樣本,不存在「不包含邊界樣本」的規則,此敘述與定義不符。
- (C):Accuracy 本可用於多分類問題;「二元分類必須改用 AUC」亦非正確規則,AUC 是補充視角而非強制替代。
- (D):評估指標本來就不負責反映收斂速度,此敘述既非 Accuracy 特有的缺陷,也與本情境的漏診風險無關。
提示:不平衡資料應優先檢視 Recall 與 Precision;高 Accuracy 可能僅是全數預測多數類的結果。
本題掛載於「模型評估 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某工程師訓練文本情感分類模型,訓練集 F1=0.96、驗證集 F1=0.71,落差明顯,顯示模型出現過擬合。下列哪一種策略能最直接從降低模型複雜度的角度緩解過擬合?
A 增加訓練 Epoch 數至200,讓模型充分學習訓練資料的所有細節
B 引入更多原始文本特徵(包括原始 URL、HTML 標籤),增加特徵多樣性
C 對Embedding 層與全連結層加入 L2權重衰減(Weight Decay),懲罰參數值
D 移除驗證集並將其併入訓練集,以增加模型可見的訓練樣本數
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
訓練集 F1=0.96 與驗證集 F1=0.71 的明顯落差是典型過擬合。L2 權重衰減(Weight Decay)在損失函數中加入參數平方懲罰項,迫使權重數值縮小、限制模型的有效自由度,是直接從「降低模型複雜度」著手的正則化手段;對 Embedding 層與全連結層這類參數量龐大的部位尤其有效,故 (C) 正確。
【為何其他選項錯了?】
- (A):將訓練 Epoch 增至 200 會讓模型更徹底記憶訓練資料的雜訊,過擬合更加嚴重,方向相反。
- (B):引入原始 URL、HTML 標籤等高雜訊特徵會擴大特徵空間、提高模型複雜度,同時引入無關訊號,對緩解過擬合有害無益。
- (D):移除驗證集併入訓練集後,將失去偵測過擬合的依據;過擬合問題依然存在,只是無法再被觀察到,並非解決方法。
提示:從降低複雜度緩解過擬合的常用手段:L1/L2 懲罰、Dropout、簡化架構;增加訓練輪數、增加雜訊特徵、移除驗證集皆為反向操作。
本題掛載於「模型訓練與調參 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某電商平台使用樸素貝氏分類器(Naive Bayes Classifier)建立垃圾郵件過濾模型。訓練集準確率(Accuracy)達 92%,但上線後發現,包含「限時優惠、立即下單享折扣」等關鍵字的正常促銷郵件,常被誤判為垃圾信。經分析發現,這些詞彙在訓練資料中多出現在垃圾郵件中,導致其類別條件機率偏高。請問造成此現象的最主要原因與較適當的改善方式為何?
A 應禁用 Naive Bayes,改用其他更先進演算法
B 模型過擬合於訓練資料,應增加 Epoch數以提升泛化能力
C 類別條件機率受訓練資料分布影響,導致促銷關鍵字被視為垃圾信特徵,應重新平衡資料或調整先驗機率
D 模型未進行特徵標準化(Feature Scaling),導致分類邊界偏移,應先進行正規化處理
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
樸素貝氏依「類別條件機率 P(詞|類別) × 先驗機率」進行判斷。訓練資料中「限時優惠、立即下單」等詞大多出現在垃圾郵件,使這些詞在垃圾類別的條件機率被推高;此後任何含這些詞的郵件,包括正常促銷信,都容易被判為垃圾郵件。這是訓練資料分布造成的系統性偏移,適當的改善方式是重新平衡資料(補充含促銷詞的正常郵件樣本)、調整先驗機率或平滑設定,使機率估計貼近實際分布。
【為何其他選項錯了?】
- (A):問題根源在訓練資料分布而非演算法本身;若訓練資料中促銷詞仍與垃圾郵件高度綁定,改用其他演算法仍會學到相同的偏差。
- (B):樸素貝氏以計數估計機率、具封閉解,沒有 Epoch 迭代訓練的概念,「增加 Epoch 數」無從實行;且此現象的成因是資料分布偏移,並非過擬合。
- (D):樸素貝氏使用詞頻機率,不涉及距離或尺度運算;特徵標準化與分類邊界偏移是距離型或梯度型模型才有的議題。
提示:貝氏分類器的判斷完全取決於訓練資料的詞頻分布;資料分布偏移,條件機率就跟著偏移。
本題掛載於「朴素貝氏 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某資料科學家將客戶資料進行分群,使用 K-means(K=5)後發現部分群集呈現半月形(非凸)結構,且資料中存在少數離群值(Outliers)。他同時觀察到每次執行結果略有不同。下列敘述何者最完整且準確地反映 K-means 在此情境中的已知限制?
A K-means 無法處理維度超過 10的資料,在高維空間中距離計算失效
B K-means 假設群集為高斯分佈,無法處理任何非球形群集
C K-means 對 K值敏感,但初始化不影響最終結果(演算法保證全局最優)
D K-means 需預先指定 K;以歐氏距離為基礎,難以處理非凸群集;對初始化與離群值敏感
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
選項 (D) 完整涵蓋 K-means 的四項已知限制,且與題幹觀察一一對應:需預先指定 K(題中 K = 5 為人工設定);以歐氏距離為基礎、偏好凸形(球形)群集,對半月形非凸結構無法正確分割;群中心以平均值計算,對離群值敏感,極端點會拉偏質心;初始質心隨機選取,不同初始化會收斂到不同的局部最優,因此每次執行結果略有差異。
【為何其他選項錯了?】
- (A):K-means 沒有「維度超過 10 即失效」的規則;高維空間的距離集中是另一類挑戰,此敘述過於絕對且未涵蓋題幹觀察到的現象。
- (B):假設群集服從高斯分布的是高斯混合模型(GMM)而非 K-means;「無法處理任何非球形群集」的說法過於絕對,且未提及初始化與離群值的問題。
- (C):前半正確、後半錯誤:K-means 只保證收斂到局部最優,初始化確實影響結果,k-means++ 等初始化改良方法正是為此而生。
提示:K-means 四項限制:需指定 K、偏好凸形群集、對離群值敏感、受初始化影響;非凸資料可改用 DBSCAN 或譜分群。
本題掛載於「K-Means 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某資料科學家在信用評分任務中使用 XGBoost 建立模型,發現模型在訓練集表現良好但驗證集出現過擬合跡象。他檢視其模型設計,發現 XGBoost 在目標函數(Objective Function)中引入額外的正則化機制以控制模型複雜度。相較於傳統梯度提升決策樹(GBDT),XGBoost 在其核心目標函數中加入了下列哪一種關鍵設計,使其具備更強的防過擬合能力?
A 加入樹的複雜度懲罰項(包含深度、葉節點數量與葉節點權重的 L2 正則化)
B 加入動態學習率(Dynamic Learning Rate)的強制衰減機制
C 加入卷積運算(Convolution)以萃取特徵間的空間關係;
D 強制所有決策樹深度為 1(Decision Stumps)
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
XGBoost 的目標函數為「訓練損失+Ω(樹複雜度懲罰)」,其中 Ω 包含葉節點數量懲罰(γT)與葉節點權重的 L2 正則化(½λ‖w‖²),並配合樹深限制,使每棵樹在「擬合殘差」與「維持簡單」之間取得平衡。這是 XGBoost 相較傳統 GBDT 更能防止過擬合的核心設計,另輔以二階泰勒展開、學習率收縮(Shrinkage)與行列抽樣等機制。
【為何其他選項錯了?】
- (B):XGBoost 提供 learning_rate(Shrinkage)超參數,但屬於外部訓練設定,並非目標函數內建的動態強制衰減機制,敘述與實際設計不符。
- (C):卷積運算是卷積神經網路(CNN)萃取空間特徵的操作,樹模型的建構過程不涉及卷積。
- (D):深度為 1 的決策樹樁(Decision Stump)是 AdaBoost 常用的弱學習器設定;XGBoost 的樹深是可調參數,並無強制深度為 1 的限制。
提示:XGBoost 防過擬合的關鍵在目標函數自帶複雜度懲罰 Ω(葉節點數 γ 與葉權重 L2),這是與傳統 GBDT 的主要分野。
本題掛載於「梯度提升樹 (GBDT) 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某醫療新創團隊將原有 3層CNN升級為16層架構以提升 CT影像腫瘤偵測率,但發現訓練損失反而高於 3層版本且收斂困難。工程師懷疑是網路深度造成的訓練問題,下列診斷與對策何者最正確?
A 網路層數增加導致參數量過多,應減少每層卷積濾波器(Filters)數量以降低模型複雜度
B 深層網路可能出現梯度消失問題,導致淺層權重難以更新;應採用 ResNet 的殘差連接(Skip Connection)以改善梯度傳遞
C 16層模型對 CT影像而言仍過淺,應進一步增加網路深度以學習更高階特徵
D 問題可能來自激活函數(Activation Function),將 ReLU改為Sigmoid 可改善梯度傳遞問題
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
從 3 層加深到 16 層後「訓練損失反而更高、收斂困難」,這是深層平原(plain)網路的退化與優化問題:反向傳播時梯度逐層縮小,淺層權重幾乎收不到有效的更新訊號。ResNet 的殘差連接讓區塊學習 F(x) 並輸出 F(x)+x,梯度可以沿著恆等捷徑直接回傳到淺層,大幅改善深層網路的可訓練性,是此症狀的對症解法。
【為何其他選項錯了?】
- (A):減少濾波器數量是處理過擬合(訓練好、驗證差)的手段;本題連訓練損失都比淺層版本高,屬「學不動」的優化問題而非「學過頭」的泛化問題,診斷方向錯誤。
- (C):問題正是深度帶來的優化困難,在沒有殘差結構的前提下繼續加深,退化只會更嚴重。
- (D):方向相反——Sigmoid 兩端飽和、梯度趨近於零,會加劇梯度消失;ReLU 正是為了改善此問題才成為主流,將 ReLU 改回 Sigmoid 只會使梯度傳遞更差。
提示:訓練損失降不下去屬優化問題(考慮殘差連接、BatchNorm);訓練低、驗證高屬過擬合(考慮正則化)。先診斷再處置。
本題掛載於「CNN 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某工程師設計用於醫療 X 光影像分類的 CNN,發現卷積層後直接接全連結層導致參數量高達 5,000 萬,訓練速度極慢。為降低模型參數量與計算成本,他在卷積層後加入池化層(Pooling Layer)。下列何者為池化層在此設計中最主要解決的問題?
A 降低特徵圖空間維度,減少參數與計算量
B 提供非線性表達能力,以提升模型學習複雜度
C 改善梯度消失問題,以強化反向傳播穩定性
D 提升模型泛化能力而不影響特徵維度
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
池化層(如 2×2 MaxPooling)對特徵圖做空間下採樣:長寬各減半,特徵圖元素數量即剩四分之一;經過幾層池化後,進入全連結層前的展平向量大幅縮短,全連結層的權重數與計算量隨之銳減——直接化解「卷積後直接接全連結導致 5,000 萬參數」的困境,同時帶來一定程度的平移不變性。
【為何其他選項錯了?】
- (B):非線性表達能力主要來自激活函數(如 ReLU);池化的設計目的不是提供非線性。
- (C):改善梯度消失依靠殘差連接、BatchNorm 與合適的激活函數;池化與反向傳播的梯度穩定性沒有直接關係。
- (D):「不影響特徵維度」與事實相反——池化正是在縮小空間維度,這也是它能節省參數的原因,此選項自相矛盾。
提示:卷積擷取特徵,池化縮減空間尺寸;參數量過大時優先考慮池化或全域平均池化(GAP)。
本題掛載於「CNN 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某團隊開發合約文件審查系統,需比對合約首頁的定義條款與第 20 頁的責任條款是否一致。工程師初版採用雙向長短期記憶(Bidirectional LSTM),但發現長文件的跨段落語義關聯捕捉效果不佳,且訓練時間隨文件長度明顯增加。改用Transformer架構後問題獲得改善,下列何者為最主要的原因?
A Transformer 參數量比 LSTM 少,因此訓練速度更快、不易過擬合
B Transformer 內建位置編碼,使模型天生理解文件的章節結構與段落順序
C LSTM 無法處理超過512個 token的輸入,Transformer無此硬性限制
D Transformer 的 Self-Attention 可讓任意 token 直接建立關聯,不受距離限制,且運算可平行化
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
Self-Attention 讓序列中任意兩個 token 直接計算關聯權重,資訊傳遞路徑長度為 O(1):首頁的定義條款與第 20 頁的責任條款可直接建立關聯,不必如 LSTM 般逐步傳遞而使訊息在途中衰減。同時注意力為矩陣運算,可對整個序列平行計算,不像 RNN 必須依時間順序逐步展開,長文件的訓練時間因此大幅縮短。此特性同時解決題幹的兩個痛點:跨段落語義關聯與訓練時間。
【為何其他選項錯了?】
- (A):Transformer 的參數量通常多於 LSTM;其速度優勢來自可平行化,而非參數較少,「不易過擬合」亦無根據。
- (B):位置編碼提供的是 token 的順序資訊,「天生理解章節結構與段落順序」屬過度延伸,文件的層級結構仍需模型自行學習。
- (C):512 token 是 BERT 等特定實作的設定,並非 LSTM 的硬性限制;LSTM 理論上可處理任意長度序列,問題在於長距離依賴的保留能力。
提示:題幹兩個線索「跨段落關聯不佳」與「訓練時間隨長度增加」,分別對應 Self-Attention 的 O(1) 關聯路徑與可平行化。
本題掛載於「Transformer 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
工程師在 PyTorch 中建構貓、狗、鳥三分類 CNN,並使用交叉熵損失函數(CrossEntropyLoss)作為訓練目標。由於此損失函數在內部已包含 Softmax 計算,輸出層的設計需特別注意。請問輸出層的激活函數(Activation Function)與輸出維度應如何設定?
A 使用 ReLU 作為激活函數,輸出維度設為 1,直接輸出單一數值作為預測結果;
B 使用 Sigmoid 作為激活函數,輸出維度設為 3,使每個類別獨立輸出 0到1的機率
C 不使用任何激活函數,直接輸出未經正規化的 logits,輸出維度設為 3 對應三個類別
D 使用 Softmax 作為激活函數,輸出維度設為 3,輸出為已正規化的機率分布
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
PyTorch 的 nn.CrossEntropyLoss 內部等於 LogSoftmax 加 NLLLoss,它期望的輸入是「未經正規化的 logits」。因此輸出層設 3 個神經元(對應貓、狗、鳥)、不加任何激活函數,直接把 logits 交給損失函數;推論階段若需要機率,再另外套用一層 Softmax 即可。
【為何其他選項錯了?】
- (A):三分類的輸出維度必須是 3,輸出單一數值無法表達三個類別的分數;ReLU 也無法產生類別機率所需的形式。
- (B):Sigmoid 搭配各類別獨立輸出 0~1 是「多標籤分類」(搭配 BCE)的設定;貓、狗、鳥三選一是互斥的單標籤問題,需要的是一個機率分布,而非三個獨立的二元輸出。
- (D):輸出層先做 Softmax 再輸入 CrossEntropyLoss,等於 Softmax 被計算兩次:梯度被壓縮、數值不穩定,訓練效果反而變差。
提示:PyTorch 的 CrossEntropyLoss 內含 Softmax——訓練時輸入 logits,推論需要機率時再套用 Softmax。
本題掛載於「損失函數 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某工程師將一個大型預訓練模型部署至資源受限的行動裝置,發現模型體積過大且推論效率不足。為降低模型大小並提升推論速度,他將原本 32-bit 浮點數權重轉換為8-bit 整數。在不重新訓練模型的前提下,請問此過程稱為何?
A 知識蒸餾(Knowledge Distillation)
B 權重剪枝(Pruning)
C 張量分解(Tensor Decomposition)
D 模型量化(Quantization)
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
將 32-bit 浮點權重轉換為 8-bit 整數表示,可使模型體積約降為四分之一,並利用整數運算加速推論,此過程即模型量化(Quantization)。題幹強調不重新訓練,對應訓練後量化(Post-Training Quantization, PTQ),是行動裝置與邊緣部署常用的模型壓縮手段,故 (D) 正確。
【為何其他選項錯了?】
- (A):知識蒸餾是訓練小型學生模型模仿大型教師模型的輸出,需要額外的訓練流程,改變的是模型結構與規模,而非數值精度。
- (B):權重剪枝是移除不重要的權重或通道,使網路稀疏化,更動的是連接數量,不是每個數值的位元寬度。
- (C):張量分解是將大型權重矩陣拆解為低秩因子的乘積以減少參數量,同樣不涉及數值精度的轉換。
提示:模型壓縮四類手法:量化改變數值精度、剪枝減少連接、蒸餾轉移知識、分解重組矩陣;題幹出現「FP32 轉 INT8、不重新訓練」即對應訓練後量化。
本題掛載於「模型優化 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某工程師建置企業內部知識問答的 RAG 系統,上線後發現部分問題檢索結果與查詢語意不符。分析後確認問題出在向量搜尋的語意匹配不準確。於檢索階段,採取下列哪種方法最能直接改善此問題?
A 將切片大小(Chunk Size)由 512tokens縮小至128tokens,以提升檢索精細度
B 調整向量相似度閾值(Similarity Threshold),以過濾低相關檢索結果
C 採用混合搜尋(Hybrid Search):結合語意向量搜尋與關鍵字搜尋(BM25),並以RRF(Reciprocal Rank Fusion)融合排序
D 將檢索結果隨機洗牌(Shuffle)後回傳給LLM,避免位置偏誤(Position Bias)
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
純向量搜尋擅長捕捉語意近似,但對專有名詞、產品代號與精確關鍵字的匹配常不穩定;BM25 關鍵字搜尋在字面精確匹配上恰好互補。混合搜尋(Hybrid Search)同時執行語意向量與關鍵字兩路檢索,再以 RRF(Reciprocal Rank Fusion)融合兩份排名產生最終排序,可直接提升檢索階段的相關性與穩健性,是針對「向量搜尋語意匹配不準確」最直接有效的主流改善手段。
【為何其他選項錯了?】
- (A):縮小切片有時能提升定位精細度,但也可能切碎語境使語意更難匹配,效果方向不確定,並非針對語意匹配不準的直接解方。
- (B):調整相似度閾值只是過濾低分結果;檢索本身不準確時,留下的結果仍然不準,屬治標不治本。
- (D):隨機洗牌是生成階段對抗位置偏誤的技巧,無法改變檢索結果本身的相關性,對題幹問題沒有幫助。
提示:語意靠向量、字面靠 BM25、排序靠 RRF 融合,是 RAG 檢索優化的標準組合。
本題掛載於「RAG 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某團隊開發法律文件生成系統,需根據合約前半段內容自動生成後半段條款。工程師分別使用 BERT與GPT-2 進行微調,但發現 BERT 的生成效果明顯較差,且即使增加訓練資料也無法改善。下列何者為最主要原因?
A BERT 缺乏法律領域知識,因此生成能力較差
B BERT 的分詞方式影響語意理解,導致生成效果不佳
C BERT 模型規模較小,因此生成能力不足
D BERT 無法根據前文逐步生成後續文字,較不適合此類任務
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
BERT 為 Encoder-only 架構,以雙向遮罩語言模型(MLM)訓練,擅長同時參考前後文進行填空式的理解,並無「根據前文逐步預測下一個 token」的自迴歸生成機制。合約後半段條款的生成屬於開放式的長文本續寫任務,架構特性決定了 BERT 難以勝任,因此增加訓練資料也無法改善。GPT-2 為 Decoder-only 自迴歸模型,逐 token 續寫正是其設計目標,微調後表現自然較佳。
【為何其他選項錯了?】
- (A):法律領域知識可透過微調注入;題幹指出增加資料仍無法改善,顯示問題出在生成機制,而非領域知識不足。
- (B):BERT 的 WordPiece 分詞在理解任務上表現良好,分詞方式並非生成效果不佳的主因。
- (C):相同規模下 GPT-2 的生成能力仍明顯優於 BERT;關鍵在於是否具備自迴歸生成機制,而非參數規模。
提示:任務與架構對應:理解型任務選 Encoder(BERT),生成型任務選 Decoder(GPT);「加資料也無效」暗示架構層面的限制。
本題掛載於「BERT 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某推薦系統工程師處理商品類別特徵,該特徵包含約 3,000 個不同商品項目,每一種商品或其規格皆視為一個獨立類別。請問在高基數(High Cardinality)的情境下,下列哪一種編碼方式最容易造成維度爆炸問題?
A 目標編碼(Target Encoding)
B 標籤編碼(Label Encoding)
C Embedding 層(Categorical Embedding)
D One-Hot編碼(One-Hot Encoding)
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
One-Hot 編碼為每一個類別開一個維度:3,000 個商品項目會直接變成 3,000 維的稀疏向量,幾乎全為 0 僅有一個 1;若再與其他特徵交叉,維度與記憶體開銷急遽膨脹,樣本相對變得稀疏,模型也更難學習,這就是高基數(High Cardinality)特徵的維度爆炸問題。
【為何其他選項錯了?】
- (A):目標編碼把每個類別映射成該類別的目標統計量(如平均成交率),輸出只有 1 維;其風險在目標洩漏,不在維度爆炸。
- (B):標籤編碼把類別映射成單一整數,同樣只有 1 維;副作用是引入不存在的大小順序關係,與維度爆炸無關。
- (C):Embedding 層把高基數類別壓縮成低維稠密向量(例如 16 至 64 維),正是高基數場景的建議解法,不會造成維度爆炸。
提示:高基數類別特徵避免 One-Hot,改用 Embedding 或 Target Encoding;低基數才適合 One-Hot。
本題掛載於「One-hot / Label 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某工程師建立房價預測模型,輸入特徵包含屋齡與距捷運站距離(公尺)。他發現距捷運站距離分布嚴重右偏,經對數(Log)轉換後模型表現明顯改善;但將同樣轉換套用於屋齡後,模型表現反而下降。下列何者為最可能的原因?
A 屋齡與房價若呈線性關係,Log轉換反而破壞此結構
B Log轉換會壓縮所有特徵的變異數,導致模型失去鑑別能力
C Log轉換不適用於有單位的連續變數,應改用 Box-Cox
D 兩特徵須套用相同轉換,否則尺度不一致導致梯度不穩定
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
對數轉換適用於右偏、跨數量級、與目標變數呈乘法或彈性關係的特徵;距捷運站距離嚴重右偏,取對數後模型表現改善屬合理結果。但若屋齡與房價原本大致呈線性關係,對數轉換會將等距的屋齡差壓縮為不等距,把原本的直線關係扭曲為曲線,模型反而更難擬合,表現下降是自然結果。轉換是否有益,取決於特徵與目標之間的關係形狀,故 (A) 為最可能的原因。
【為何其他選項錯了?】
- (B):對數轉換僅作用於被轉換的該特徵,不會壓縮「所有」特徵的變異數,也不必然使模型喪失鑑別能力,敘述過度延伸。
- (C):對數轉換對正值連續變數(距離、金額)完全適用;Box-Cox 只是把對數轉換納入其中的廣義轉換家族,「有單位就不能取對數」並非成立的規則。
- (D):並沒有「所有特徵必須套用相同轉換」的原則;尺度不一致的問題應以標準化處理,與各特徵各自採用何種轉換無關。
提示:轉換前先檢視特徵與目標的關係形狀:右偏且呈乘法關係適合取對數;原本已是線性關係的特徵,再轉換反而破壞結構。
本題掛載於「特徵工程 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在時間序列資料的特徵工程中,工程師常使用滑動窗口(Sliding Window)方法,將過去多個時間點的觀測值組合為模型輸入。下列何者為此方法的主要目的?
A 資料增強
B 去除資料雜訊
C 降低特徵維度
D 建立滯後特徵
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
滑動窗口(Sliding Window)將過去 k 個時間點的觀測值(t-1, t-2, …, t-k)排列為預測時刻 t 的輸入特徵,即建立滯後特徵(Lag Features),讓模型直接取得近期歷史的趨勢、慣性與週期型態。這是時間序列特徵工程最基本且重要的手法,可將時序預測問題轉換為一般表格式的監督式學習,供樹模型與線性模型使用,故 (D) 正確。
【為何其他選項錯了?】
- (A):資料增強是產生額外的訓練樣本(如影像翻轉、加入雜訊)以提升多樣性;滑動窗口是把既有觀測值重組為特徵,目的不同。
- (B):滑動窗口特徵保留原始觀測值,本身不做平滑或去噪;具去噪效果的是移動平均等聚合統計,且去噪並非此法的主要目的。
- (C):將 k 個歷史時間點展開為 k 個特徵是「增加」特徵維度,與降維方向相反。
提示:滑動窗口的本質是讓模型看得到過去:以 t-1 至 t-k 的觀測值作為特徵預測時刻 t,即滯後特徵。
本題掛載於「特徵工程 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某工程師建立零售商品銷量預測模型,初期以第 1 至 52 週資料作為訓練集、第53 週作為測試集(固定時間切分)。半年後重新評估,發現模型對最新資料(如第 80 週)的預測明顯衰退,推測為時間演進導致行為模式改變。若重新設計驗證策略,應採用下列哪種方法,使每次訓練皆基於最新時間區間資料?
A K-fold 交叉驗證(K-fold Cross-Validation)
B 分層 K-fold(Stratified K-fold)
C 滾動窗口驗證(Rolling Window Validation / Time Series Split)
D 留一驗證法(Leave-One-Out Cross-Validation)
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
消費行為隨時間演變會產生概念漂移(Concept Drift),驗證策略必須尊重時間順序。滾動窗口驗證(Rolling Window Validation / Time Series Split)每一輪皆以較早的區間訓練、緊接其後的區間測試,並隨時間向前滾動,確保每次訓練都基於最新時間區間的資料,評估情境貼近上線後的實際使用方式,正符合題目「使每次訓練皆基於最新時間區間資料」的要求。
【為何其他選項錯了?】
- (A):K-fold 隨機切分會將未來資料混入訓練集、以過去資料作測試,造成時間洩漏,評估結果過度樂觀,也無法反映行為模式的漂移。
- (B):分層 K-fold 僅在隨機切分上追加類別比例一致的機制,仍未處理時間順序錯亂的問題。
- (D):留一驗證法同樣未考量時間順序,且每保留一筆就需重新訓練一次模型,計算成本極高,不適合此情境。
提示:時間序列驗證原則是訓練資料必須在測試資料之前;需要反映最新行為時,採用隨時間滾動的驗證窗口。
本題掛載於「資料切分 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某房仲平台要預測物件成交價,資料集含 50 個特徵,其中部分特徵與房價呈非線性關係,且業務單位要求模型須能提供整體特徵重要性以供稽核。下列哪一種模型選擇策略最符合需求?
A 使用羅吉斯迴歸(Logistic Regression),透過線性係數解釋特徵影響,但無法有效建模非線性關係
B 使用隨機森林迴歸(Random Forest Regression),可處理非線性關係,並提供整體特徵重要性(Feature Importance)作為解釋依據
C 用K-means 分群(K-means Clustering)後分別建立迴歸模型,以提升預測準確度並間接提升可解釋性
D 使用支持向量迴歸(Support Vector Regression, SVR),透過核函數(Kernel Function)捕捉非線性關係,並以支持向量解釋模型決策
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
題幹有兩項需求:能建模非線性關係、能提供整體特徵重要性以供稽核。隨機森林迴歸(Random Forest Regression)以多棵決策樹集成,樹的分裂規則天生能捕捉非線性關係與特徵交互作用,毋須事先指定函數形式;同時可輸出整體特徵重要性(Feature Importance,如不純度減少量或 permutation importance),恰好滿足稽核所需的解釋依據。面對 50 個混合線性與非線性關係的特徵,隨機森林是最符合需求的選擇。
【為何其他選項錯了?】
- (A):羅吉斯迴歸是分類模型,不適用於預測成交價此類連續值的迴歸任務;且選項自述無法有效建模非線性關係,不符題幹條件。
- (C):先以 K-means 分群再對各群分別建立迴歸模型,流程複雜且群集邊界難以向稽核單位說明,也未提供明確的整體特徵重要性,無法滿足稽核需求。
- (D):支持向量迴歸經核函數映射後決策過程難以解讀,支持向量本身無法轉譯為特徵層級的影響力說明,也無法直接輸出整體特徵重要性清單。
提示:「非線性關係+整體特徵重要性」指向樹系集成模型(隨機森林、梯度提升樹);若需逐筆解釋,可再搭配 SHAP。
本題掛載於「決策樹/隨機森林 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某工廠設備監測系統需偵測馬達軸承的異常振動,但過去僅記錄了大量正常運作的振動時序資料,缺乏任何已確認故障的標註樣本。請問下列何種任務範疇最符合此情境下的異常偵測需求?
A 監督式二元分類(Supervised Binary Classification)
B 非監督或半監督異常偵測(Unsupervised / Semi-supervised Anomaly Detection)
C 強化學習(Reinforcement Learning)
D 自監督學習(Self-supervised Learning)
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
題幹條件是只有大量正常運作的振動時序資料,沒有任何已確認故障的標註樣本,因此無法訓練需要兩類標籤的監督式分類器。正確的任務範疇是異常偵測:以正常資料學習「正常模式的樣貌」,例如 One-Class SVM、Isolation Forest,或以 AutoEncoder 重建誤差判定,偏離正常分布者即視為異常。僅以正常樣本訓練屬於半監督式異常偵測,完全不使用標籤則屬非監督式,選項 (B) 涵蓋此情境的完整路線。
【為何其他選項錯了?】
- (A):監督式二元分類需要正常與故障兩類標註資料;題幹明言缺乏故障標註樣本,無法建立此類模型。
- (C):強化學習需要代理人與環境互動並取得獎勵訊號,與離線振動資料的異常偵測情境不符。
- (D):自監督學習是從無標籤資料自行建構前置任務(Pretext Task)以學習表徵,可作為特徵學習的前置技巧,但並非此需求對應的任務範疇本身。
提示:只有正常資料時走異常偵測(One-Class 思路);監督式分類必須先備齊兩類標籤。
本題掛載於「非監督式學習 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某信用風險模型:訓練AUC=0.97、驗證AUC=0.72、少數違約樣本預測波動極大及不同K-fold切分結果差異明顯。下列何者為最可能的問題?
A 高偏差
B 高變異
C 過擬合
D 資料漂移
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
高變異(High Variance)指模型對訓練資料的微小變動極度敏感。題目的三項症狀正是高變異的典型表現:訓練 AUC 0.97 與驗證 AUC 0.72 的巨大落差、少數違約樣本的預測波動極大、不同 K-fold 切分結果差異明顯。資料一經更換,模型行為即大幅改變,即為變異過高的定義;常見成因是模型過於複雜或少數類樣本過少,對應處置包括正則化、增加資料與集成學習。
【為何其他選項錯了?】
- (A):高偏差是模型過於簡單、連訓練集都無法學好;本題訓練 AUC 高達 0.97,顯然不屬於此類。
- (C):過擬合是高變異最常見的表現形式,兩者高度重疊;但題目額外強調切分敏感與預測波動大,對應的診斷術語是高變異,它同時涵蓋訓練與驗證落差以及對資料擾動的不穩定,是四個選項中最完整的答案。
- (D):資料漂移指上線後輸入分布隨時間改變;本題所有現象皆發生於訓練與驗證階段,與漂移無關。
提示:更換切分結果即大幅變動,對應高變異;連訓練集都學不好,對應高偏差;先確立診斷,再決定正則化、增加資料或集成等處置。
本題掛載於「模型訓練與調參 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某倉儲自動化公司以強化學習(Reinforcement Learning, RL)訓練機器手臂進行揀貨,獎勵函數設計為「每成功抓取一個貨品得+1 分」。部署後發現機器手臂學會反覆放開再抓取同一物品,以累積分數,但實際完成任務的效率極低。請問此現象的核心問題為何?應如何修正獎勵設計?
A 獎勵塑形(Reward Shaping):將獎勵改為「成功完成一次揀貨任務」而非單次抓取行為
B 策略退化(Policy Degradation):降低學習率以穩定訓練
C 信用分配問題(Credit Assignment Problem):引入優勢函數(Advantage Function)
D 災難性遺忘(Catastrophic Forgetting):加入經驗回放(Replay Buffer)
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
機器手臂學會反覆放開再抓取同一物品以累積分數,是典型的獎勵漏洞利用(Reward Hacking):獎勵函數獎勵的是「抓取動作」而非「完成任務」,代理人便忠實地最大化字面上的獎勵,而非設計者期望的目標。修正之道是獎勵塑形(Reward Shaping)或重新設計獎勵:將獎勵綁定於「成功完成一次揀貨任務」(例如物品放置到目標位置才計分),並可對重複無效動作施加時間或能耗懲罰,使獎勵與真實任務目標對齊。
【為何其他選項錯了?】
- (B):降低學習率只影響訓練的穩定性,無法改變錯誤的最佳化目標;獎勵定義錯誤時,訓練再穩定仍會收斂到相同的投機行為。
- (C):信用分配問題處理的是「長序列中哪個動作對最終結果有貢獻」;本例中代理人明確知道抓取動作可得分,問題在獎勵目標錯位,引入優勢函數無法修正。
- (D):災難性遺忘指學習新任務時喪失舊能力;本例代理人並未遺忘任何能力,而是精確地最佳化了設計不當的計分規則。
提示:獎勵函數決定代理人的行為方向;獎勵應綁定任務「結果」而非中間「動作」,以避免 Reward Hacking。
本題掛載於「強化學習 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某詐欺偵測模型需同時具備高精確率(Precision),以避免誤凍結正常帳號,並維持高召回率(Recall)表現,以確保不放過任何詐欺行為。然而工程師發現兩者之間存在取捨關係(Precision-Recall Tradeoff)。在此情境下,F1-score最能反映何種特性?
A F1-score = (Precision + Recall) / 2,為算術平均
B F1-score為Precision 的加權平均
C F1-score僅適用於類別平衡資料
D F1-score = 2 × (Precision×Recall)/(Precision+Recall),為調和平均,對較小值敏感
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
F1-score = 2 × (Precision × Recall) / (Precision + Recall),為兩者的調和平均。調和平均的關鍵性質是受較小值主導:任一方偏低,F1 即明顯下降,唯有兩者皆高,F1 才會高。此特性正適合詐欺偵測這類必須同時兼顧精確率(避免誤凍結正常帳號)與召回率(不放過詐欺行為)的場景,可防止模型以犧牲一方換取另一方的高分,故 (D) 正確。
【為何其他選項錯了?】
- (A):(P+R)/2 是算術平均;算術平均會掩蓋短板,例如一方 0.99、另一方 0.2 時平均值仍接近 0.6,F1 並非算術平均。
- (B):F1 不是 Precision 的加權平均;若需調整兩者的相對重要性,應使用 Fβ 分數(β>1 時偏重 Recall),其加權作用於調和平均的結構,而非對 Precision 加權。
- (C):F1 並非僅適用於類別平衡資料;相反地,它在不平衡資料上遠比 Accuracy 具參考價值,這正是其主要用途之一。
提示:調和平均由較低的一方決定整體水準;需偏重 Precision 或 Recall 時,改用 Fβ 分數。
本題掛載於「模型評估 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某工程師的多元線性迴歸模型包含 150個特徵,其中許多特徵高度相關(如「建坪」與「總面積」)。他同時希望控制過擬合且保留所有特徵的解釋能力,不讓任何特徵係數歸零,下列哪一項正則化方案最適當?
A Lasso 迴歸(L1 正則化):透過絕對值懲罰使部分係數歸零,具有特徵選擇效果
B Ridge 迴歸(L2 正則化):透過平方懲罰縮小所有係數,在共線性下穩定估計且不歸零
C Elastic Net(L1+L2):結合稀疏性與穩定性,但部分係數仍可能被壓為 0
D 無正則化的 OLS 迴歸:不控制過擬合,在共線性下係數估計不穩定
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
題目的需求有三:控制過擬合、保留全部 150 個特徵的解釋能力、不讓任何係數歸零。Ridge(L2)以平方懲罰把所有係數整體縮小但不會壓到恰好為零,且在「建坪」與「總面積」這類高度共線的情況下能穩定係數估計、降低估計變異,三個條件全部符合。
【為何其他選項錯了?】
- (A):Lasso 的稀疏性會把部分係數直接歸零,違反「不讓任何特徵係數歸零」的明確需求;共線性下它還會在相關特徵間擇一保留,係數清單不穩定。
- (C):Elastic Net 含 L1 成分,部分係數仍可能被壓為 0,選項描述本身已說明不符合題目條件。
- (D):無正則化的 OLS 既不控制過擬合,在共線性下係數估計的變異數也會急遽放大,兩項需求皆無法滿足。
提示:全部特徵都要保留用 Ridge;需要自動篩選特徵用 Lasso;Elastic Net 折衷但仍可能歸零,本題不適用。
本題掛載於「Ridge (L2) 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某工程師使用 XGBoost 模型進行調參,需對以下超參數進行網格搜尋(Grid Search):learning_rate(3 個候選值)、max_depth(4 個)、n_estimators(5 個)、subsample(3 個)、colsample_bytree(3 個)。每組參數組合皆需完整進行 5-Fold交叉驗證。請問總共需要訓練幾個模型?
A 3 + 4 + 5 + 3 + 3 = 18 個
B 5 × 5 = 25個
C max(3,4,5,3,3) × 5 = 25 個
D 3 × 4 × 5 × 3 × 3 × 5 = 2,700 個
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
網格搜尋嘗試的是各超參數候選值的笛卡兒積:3(learning_rate)× 4(max_depth)× 5(n_estimators)× 3(subsample)× 3(colsample_bytree)= 540 種參數組合;每種組合皆需完整執行 5-Fold 交叉驗證,即各訓練 5 個模型,總計 540 × 5 = 2,700 個模型。組合數隨參數個數呈乘積成長,這也是參數較多時實務上改採隨機搜尋或貝氏優化的原因。
【為何其他選項錯了?】
- (A):將各參數候選數相加是對網格搜尋的誤解;網格搜尋逐一嘗試所有組合,而非每個參數獨立測試後即結束。
- (B):5 × 5 = 25 與任何正確的計算邏輯皆不對應,屬干擾選項。
- (C):取最大候選數再乘以折數沒有依據;網格搜尋涵蓋完整的組合空間,不是僅沿單一參數的候選值進行。
提示:網格搜尋的訓練模型總數 = 各參數候選數連乘 × 交叉驗證折數;每增加一個參數,總數即乘上其候選值個數。
本題掛載於「模型訓練與調參 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某團隊使用 LoRA微調大型語言模型進行法律摘要任務,發現模型在複雜條款的摘要上常出現內容遺漏,但 GPU 顯存已接近上限。下列哪種調整方式最能在不明顯增加記憶體使用的前提下改善模型表現?
A 提高 LoRA rank 以增強模型表達能力
B 改用完整微調(Full Fine-tuning)以學習更多細節
C 降低 LoRA rank以釋放記憶體並增加 Batch Size
D 降低 LoRA rank 但套用到更多層,保持 trainable總參數不變
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
LoRA 的可訓練參數量約與「rank 乘以掛載層數」成正比,GPU 記憶體壓力主要來自可訓練參數及其優化器狀態。降低單層 rank、同時把 LoRA 套用到更多層(例如同時覆蓋注意力的 Q、K、V、O 投影與 FFN 層),可在可訓練參數總量不變、記憶體不明顯增加的前提下,讓適配訊號注入模型更多位置。對「複雜條款摘要遺漏」這類能力面不足的問題,擴大適配的覆蓋廣度通常比單點加深更有效,故 (D) 是符合記憶體限制又能改善表現的調整方式。
【為何其他選項錯了?】
- (A):直接提高 rank 會增加可訓練參數與優化器狀態,記憶體用量隨之上升;GPU 記憶體已接近上限,此法不可行。
- (B):完整微調需為全部參數保存梯度與優化器狀態,記憶體需求較 LoRA 高出數倍,在題幹的資源條件下無法採用。
- (C):降低 rank 換取更大批次雖可釋放記憶體,但模型適配容量下降,內容遺漏問題可能惡化,與改善表現的目標相反。
提示:LoRA 容量有兩個旋鈕:rank(單層深度)與套用層數(覆蓋廣度);記憶體吃緊時,以降 rank 換多層覆蓋是常見策略。
本題掛載於「GPT 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某金融機構的 AI 信用評分模型需上傳至第三方雲端服務商進行推論。法務部門要求:在不解密資料的前提下,由單一雲端服務商直接對加密資料進行模型運算。下列哪種隱私保護技術最符合此需求?
A 聯邦學習(Federated Learning)
B 同態加密(Homomorphic Encryption)
C 差分隱私(Differential Privacy)
D 安全多方計算(Secure Multi-Party Computation, MPC)
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
同態加密(Homomorphic Encryption)允許直接對「密文」執行運算,運算結果解密後與對明文運算的結果一致。流程恰好對應題目條件:金融機構將資料加密後上傳,雲端服務商全程不解密,直接對加密資料執行模型推論,結果回傳後由機構自行解密。「單一服務商、不解密、直接運算」三項條件全部符合,故 (B) 正確。
【為何其他選項錯了?】
- (A):聯邦學習的核心是「資料不出本地」,各方在本地訓練、只交換模型參數或梯度;題目情境是將資料上傳至雲端運算,前提不同。
- (C):差分隱私是對資料或查詢輸出加入雜訊,防止個體被重新識別;運算時資料仍為明文形式,不符「不解密之下運算」的要求。
- (D):安全多方計算需要多個參與方分持秘密份額協同計算;題目明定由單一雲端服務商執行運算,不符合 MPC 的參與架構。
提示:密文直接運算對應同態加密;資料不出本地對應聯邦學習;輸出加噪對應差分隱私;多方分持對應 MPC。
本題掛載於「隱私保護技術 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某銀行導入 AI 貸款審核系統,監管要求每筆被拒絕的申請須提供可理解的拒絕原因。技術主管評估以下方案,哪一種最能實現個別預測的局部可解釋性(Local Explainability)?
A SHAP(SHapley Additive exPlanations)值:計算每個特徵對單筆預測的貢獻
B 全域特徵重要性(Global Feature Importance):說明整體特徵影響,無法解釋單一個案
C Grad-CAM(Gradient-weighted Class Activation Mapping):以熱力圖解釋影像模型
D 混淆矩陣(Confusion Matrix):呈現整體分類表現
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
SHAP 基於博弈論的 Shapley 值,為「單筆預測」計算每個特徵的貢獻:例如這位申請人的負債比率拉低多少分、收入穩定度增加多少分,各特徵貢獻加總即可重建該筆預測與基準值的差距。這正是「每筆被拒申請都要提供可理解原因」所需的局部可解釋性(Local Explainability),輸出可直接轉換為逐案的拒絕理由說明,符合監管要求,故 (A) 正確。
【為何其他選項錯了?】
- (B):全域特徵重要性描述模型整體行為,選項本身即說明「無法解釋單一個案」,不符合逐案說明的需求。
- (C):Grad-CAM 是針對 CNN 影像模型產生類別關注熱力圖的方法;信貸審核處理的是表格資料,方法與資料型態不匹配。
- (D):混淆矩陣呈現整體分類表現(TP、FP、TN、FN 統計),屬於模型評估工具,無法說明個別申請被拒絕的原因。
提示:單筆解釋(局部)對應 SHAP、LIME;整體趨勢(全域)對應特徵重要性;影像模型對應 Grad-CAM。
本題掛載於「可解釋 AI (XAI) 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某公司導入 AI 履歷篩選系統,用於自動決定是否進入面試。模型對男性應徵者的面試通過率為 55%,對女性應徵者為 30%。在其他條件不變的情況下,工程師需評估模型是否符合統計均等(Statistical Parity)的公平性定義。下列何者最正確?
A 符合統計均等,因為模型未使用性別作為輸入特徵
B 符合統計均等,因為兩個族群皆有部分應徵者被錄取
C 不符合統計均等,因為不同群體的正向決策比例(通過率)存在明顯差異
D 不符合統計均等,因為女性族群的預測準確率較低
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
統計均等(Statistical Parity,亦稱 Demographic Parity)的定義是:各群體獲得「正向決策的比例」應相等,即 P(通過|男性) 應等於 P(通過|女性)。本題通過率 55% 對 30%,差距達 25 個百分點,明顯違反統計均等,故 (C) 正確。此指標只看結果比例,不問成因,也不管模型是否使用性別欄位。
【為何其他選項錯了?】
- (A):「未使用性別特徵」不代表統計均等成立:科系、工作年資等特徵可能是性別的代理變數,結果仍會失衡;且統計均等的判準是結果比例,不是輸入特徵清單。
- (B):統計均等要求各群體的正向決策比例相等,不是「比例不為零」;兩個族群皆有人錄取不構成符合的依據。
- (D):結論方向雖同,理由錯誤:準確率差異對應 Equalized Odds、校準等其他公平性定義;統計均等只看通過率,不看準確率。
提示:Statistical Parity 只檢驗各群體的正向決策比例是否相等;55% 對 30% 顯然不相等。
本題掛載於「公平性與去偏見 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某銀行信貸模型上線後稽核發現,女性申請者中「實際具有還款能力卻被模型拒絕」的比例顯著高於男性,但法務限制不允許在推論階段使用性別欄位調整輸出。下列去偏策略何者在此限制下仍可執行?
A 訓練中(In-processing):在損失函數加入公平性懲罰項,降低不同群體的錯誤拒絕比例差異
B 前處理(Pre-processing):僅於訓練資料進行重新採樣,無法直接修正既有模型在推論階段的偏誤
C 後處理(Post-processing):依性別分組調整決策門檻,使不同群體的錯誤拒絕比例一致
D 改用人口統計均等指標(Demographic Parity),錯誤拒絕比例差異將自動消失
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
法務限制是「推論階段不得使用性別欄位調整輸出」。訓練中(In-processing)去偏是在訓練時於損失函數加入公平性懲罰項,例如縮小各群體錯誤拒絕率的差異;模型訓練完成後,推論時只讀取一般特徵,完全不需接觸性別欄位。此方案既遵守限制,又直接針對「實際具還款能力卻被拒絕」的錯誤拒絕率差異進行優化,是此限制下可執行的方案,故 (A) 正確。
【為何其他選項錯了?】
- (B):選項自述「僅於訓練資料重新採樣,無法直接修正既有模型在推論階段的偏誤」;重採樣後仍需重新訓練,且對錯誤拒絕率差異的矯正較間接,依選項描述即非可行解。
- (C):後處理依性別分組設定不同決策門檻,正是在推論階段使用性別欄位調整輸出,直接牴觸法務限制,無法執行。
- (D):更換衡量指標不會改變模型行為;群體間的錯誤拒絕率差異依然存在,不會因改用其他指標而消失。
提示:去偏三階段:前處理改資料、訓練中改損失函數、後處理改決策門檻;推論階段不得使用敏感屬性時,後處理方案首先排除。
本題掛載於「公平性與去偏見 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
分析師準備建立一個能將手寫數字圖片(28x28 像素展平為 784 維度)分為 0~9 共 10 個類別的多層感知機(MLP),且標籤已轉為 One-Hot 編碼(One-Hot Encoding)。為符合 10 個類別的單標籤分類需求,以下程式碼中 (A) 與 (B) 的函數應填入何者?
from tensorflow.keras import Sequential
from tensorflow.keras.layers import Dense
model = Sequential([
Dense(64, activation='relu', input_shape=(784,)),
Dense(10, activation='___(A)___')
])
model.compile(loss='___(B)___', optimizer='adam')
A sigmoid,mean_squared_error
B softmax,categorical_crossentropy
C relu,binary_crossentropy
D tanh,sparse_categorical_crossentropy
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
10 類單標籤分類、標籤已 One-Hot:輸出層應使用 softmax,把 10 個神經元的輸出轉成總和為 1 的機率分布,對應「十選一」的互斥語意;損失函數搭配 categorical_crossentropy,衡量預測分布與 One-Hot 標籤分布的差異。softmax 搭配 categorical crossentropy 是 Keras 多類單標籤分類的標準組合。
【為何其他選項錯了?】
- (A):sigmoid 讓每個類別獨立輸出 0~1、總和不為 1,語意是多標籤而非十選一;mean_squared_error 用於分類則梯度訊號差、收斂慢,等於把分類當迴歸處理。
- (C):relu 輸出無上界、也不是機率;binary_crossentropy 是二元或多標籤分類的損失,與 10 類單標籤不匹配。
- (D):sparse_categorical_crossentropy 適用於整數標籤(0~9 直接作為標籤),題目已說明標籤轉成 One-Hot,格式不符;tanh 輸出 -1~1,同樣不是機率。
提示:單標籤多類分類:輸出層固定 softmax,損失看標籤格式——One-Hot 配 categorical CE,整數標籤配 sparse categorical CE。
本題掛載於「ANN / MLP 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
工程師使用 PyTorch 建立 OCR 訓練 pipeline,並對手寫字母資料集套用以下程式進行資料增強(Transform):
import torchvision.transforms as transforms
transform = transforms.Compose([
transforms.RandomHorizontalFlip(p=0.5),
transforms.RandomRotation(15),
transforms.ColorJitter(brightness=0.3),
transforms.ToTensor(),
])
模型在訓練過程中顯示驗證損失(Validation Loss)持續下降,但實際部署後,系統在辨識「b/d/p/q」類字母錯誤率異常偏高。下列何者為最可能的根本原因?
A RandomRotation(15) 角度過大導致特徵變形,應降至 5 度以內
B RandomHorizontalFlip 破壞字母方向語義,使模型以 50% 機率學到鏡像錯誤標籤
C ColorJitter 改變筆畫灰階,導致邊緣偵測特徵失真
D ToTensor( ) 應放在所有幾何變換之前才能保持座標對應正確
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
RandomHorizontalFlip(p=0.5) 對字母資料具破壞性:b 水平翻轉後字形即為 d、p 翻轉後即為 q(反之亦然),但標籤沒有跟著改變——等於有一半機率餵給模型「字形是 d 卻標成 b」的矛盾樣本。訓練中模型被迫在鏡像混淆中折衷;且只要驗證資料也經過同一套增強流程,驗證損失仍會持續下降,問題因此被掩蓋。一到真實部署,b/d/p/q 這組互為鏡像的字母錯誤率便顯著偏高,與題目症狀完全吻合。
【為何其他選項錯了?】
- (A):±15 度旋轉是手寫辨識的常規增強範圍,能增加字形多樣性,不會專門造成互為鏡像的字母對混淆。
- (C):ColorJitter 只調整亮度等灰階屬性,不改變字形的左右方向,與 b/d、p/q 的混淆機制無關。
- (D):慣例上 ToTensor 本來就放在幾何變換之後(先在 PIL 影像上做幾何變換、最後轉為張量),不存在座標對應錯誤的問題,此敘述與實務慣例不符。
提示:套用增強前先檢視:該變換是否會使某一類樣本變成另一類?字母與數字對鏡像翻轉尤其敏感。
本題掛載於「OCR 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
以下為使用 ResNet 進行遷移學習(Transfer Learning)的 Python 程式片段:
import torch
import torch.nn as nn
import torchvision
model = torchvision.models.resnet50(pretrained=True)
for param in model.parameters():
param.requires_grad = False # 行(A)
model.fc = nn.Linear(2048, 2)
optimizer = torch.optim.Adam(model.fc.parameters(), lr=1e-4)
觀察程式中行(A)將所有既有權重的梯度計算關閉,這在遷移學習中屬於哪一種標準策略?
A 全面微調(Full Fine-Tuning)
B 零樣本學習(Zero-shot Learning)
C 特徵萃取(Feature Extraction)
D 知識蒸餾(Knowledge Distillation)
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
行(A) 把所有預訓練參數的 requires_grad 設為 False,凍結整個 ResNet50 骨幹,反向傳播不再更新它們;接著換上新的全連結層 model.fc,優化器也只註冊 model.fc.parameters()。凍結的骨幹成為固定的特徵抽取器,只訓練新的分類頭——這正是遷移學習中的特徵萃取(Feature Extraction)策略,適合目標資料量小、且與預訓練領域相近的場景。
【為何其他選項錯了?】
- (A):全面微調是所有層一起解凍、全部參數都更新;與凍結全部骨幹恰為兩個極端。
- (B):零樣本學習是不經任何訓練、直接對新類別推論;此程式仍訓練了新的 fc 層,不屬零樣本。
- (D):知識蒸餾需要教師與學生兩個模型,以教師輸出作為軟標籤訓練學生;程式中僅有單一模型,不存在教師-學生配置。
提示:凍結骨幹、只訓練新分類頭=特徵萃取;全部解凍以小學習率更新=全面微調;教師-學生雙模型=知識蒸餾。
本題掛載於「CNN 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在進行遷移學習微調(Fine-Tuning)時,通常會將優化器的學習率(Learning Rate)設得非常小(如 1e-4),下列何者為主要的原因?
A 為了避免記憶體耗盡(OOM)
B 為了加速模型整體的收斂時間
C 為了讓損失函數強制歸零
D 為了避免更新步伐過大,破壞預訓練模型原本已學好的良好特徵表示
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
預訓練模型的權重已蘊含大量通用特徵(邊緣、紋理、語意結構),是微調的價值所在。微調時若學習率過大,每步更新幅度大,會大幅覆寫這些已學好的特徵表示(即災難性遺忘,Catastrophic Forgetting),使遷移學習失去意義。將學習率設得非常小(如 1e-4),讓權重在既有基礎上小步、溫和地適應新任務,才能既保留預訓練知識、又完成任務轉移。
【為何其他選項錯了?】
- (A):學習率只影響每步更新的幅度,不影響記憶體占用;避免 OOM 須靠縮小 batch size、混合精度、梯度累積等手段。
- (B):小學習率通常使收斂更慢而非更快;選擇小學習率是為了穩定,不是為了速度。
- (C):訓練目標是泛化能力,不是把損失強制歸零;損失趨近於零反而常是過擬合的警訊,學習率也無法「強制」達成此事。
提示:微調的原則是小步更新:學習率過大會破壞預訓練特徵,失去遷移學習的意義。
本題掛載於「CNN 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
Iris 資料集包含三種鳶尾花(Iris setosa、Iris versicolor、Iris virginica)各 50 筆資料,每筆有四個特徵(花萼長度、花萼寬度、花瓣長度、花瓣寬度)。研究人員先用線性判別分析(LDA)降維,接著使用 K 最近鄰(KNN)分類,並以交叉驗證評估準確率,程式如下:
from sklearn.model_selection import cross_val_score
from sklearn.neighbors import KNeighborsClassifier
from sklearn.discriminant_analysis import LinearDiscriminantAnalysis
lda = LinearDiscriminantAnalysis()
X_new = lda.fit_transform(X, y)
model = KNeighborsClassifier(n_neighbors=3)
scores = cross_val_score(model, X_new, y, cv=5, scoring="accuracy")
scores.mean() # 輸出 0.9733
程式先以整體資料進行 LDA 降維,再用 KNN 分類並以交叉驗證評估準確率。請問下列敘述何者正確?
A 此寫法完全正確,因為先以整體資料進行 LDA降維,再以交叉驗證測試 KNN,是標準流程
B 此寫法存在資料洩漏(Data Leakage)問題,應將 LDA納入交叉驗證流程中一併進行
C 雖然流程不夠嚴謹,但結果仍然能夠代表模型真實的泛化能力
D 如果只想驗證 KNN 的分類效果,可以直接跳過 LDA步驟,以簡化流程
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
程式在交叉驗證之前,即以整份資料執行 lda.fit_transform(X, y)。LDA 是監督式降維,擬合時使用了全部樣本的特徵與標籤,包括之後每一輪交叉驗證中理應未見過的測試折;測試資料的資訊因此提前滲入降維轉換,再以轉換後的資料執行交叉驗證,準確率 0.9733 即被系統性高估,此即資料洩漏(Data Leakage)。正確做法是將 LDA 與 KNN 封裝為 Pipeline 後交給 cross_val_score,使每一輪僅以該輪的訓練折擬合 LDA,測試折只做轉換。
【為何其他選項錯了?】
- (A):「先以全體資料降維、再交叉驗證」並非標準流程,而是典型的資料洩漏寫法,將其描述為完全正確會嚴重誤導評估結論。
- (C):洩漏會使估計值系統性偏高,該結果無法代表真實泛化能力,「不嚴謹但結果仍可信」的說法不成立。
- (D):題目要評估的是 LDA 加 KNN 的組合流程,跳過 LDA 是迴避問題;正確解法是將 LDA 納入交叉驗證流程,而非移除。
提示:交叉驗證原則:所有需要擬合的步驟(降維、標準化、特徵選擇)只能使用訓練折;以 Pipeline 封裝可確保流程正確。
本題掛載於「資料切分 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
研究人員在以下程式中使用 cross_val_score 對 Iris 資料集(三類別、每類 50 筆)進行 KNN 交叉驗證,但目前尚未設定 cv 參數:
from sklearn.model_selection import cross_val_score
from sklearn.neighbors import KNeighborsClassifier
from sklearn.discriminant_analysis import LinearDiscriminantAnalysis
model = KNeighborsClassifier(n_neighbors=3)
# 填入程式碼
scores = cross_val_score(model, X, y, cv=cv, scoring="accuracy")
scores.mean()
他們希望確保在每次資料分割時,訓練集與測試集的類別比例與原始資料一致,以免影響模型的準確率估計。目前有以下幾段候選程式碼可供選擇:
程式碼 A:cv = KFold(n_splits=5, shuffle=True)
程式碼 B:cv = StratifiedKFold(n_splits=5, shuffle=True)
程式碼 C:cv = 5
程式碼 D:cv = RepeatedStratifiedKFold(n_splits=5, n_repeats=2)
請問為了確保交叉驗證時每個分割中的類別比例與原始資料一致,哪幾段程式碼插入在 [# 填入程式碼] 的部分比較合適?
A 程式碼 B、程式碼 C、程式碼 D
B 程式碼 A、程式碼 C
C 程式碼 A、程式碼 B、程式碼 D
D 程式碼 C、程式碼 D
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
要使每個分割的類別比例與原始資料一致,需要分層(Stratified)抽樣。程式碼 B 的 StratifiedKFold 直接進行分層切分;程式碼 D 的 RepeatedStratifiedKFold 是分層 K 折再重複多輪,同樣具備分層性質;程式碼 C 的 cv=5 亦符合,因為 sklearn 的 cross_val_score 在收到整數且估計器為分類器時,預設即採用 StratifiedKFold。三者皆滿足分層要求,正確組合為程式碼 B、C、D,故選 (A)。
【為何其他選項錯了?】
- (B):包含程式碼 A,而 KFold 是純隨機切分、不做分層,無法保證各折類別比例;同時遺漏了符合條件的 B 與 D。
- (C):程式碼 A 的 KFold 不具分層機制,任何包含它的組合皆不成立。
- (D):程式碼 C 與 D 正確,但遺漏了最直接的分層寫法程式碼 B,組合不完整。
提示:分類器搭配 cv=整數時,cross_val_score 預設使用 StratifiedKFold;需要明確分層可寫 StratifiedKFold,需要更穩定的估計可用 Repeated 版本。
本題掛載於「資料切分 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
使用 CIFAR-10 資料集建立 CNN 進行彩色影像分類:共 10 個類別、60000 張 32×32 像素的 RGB 影像(訓練集 50000 張、測試集 10000 張),像素值為 0~255 的整數,標籤 y 為 0~9 的整數。資料處理程式如下:
x_train, x_test = x_train / 255.0, x_test / 255.0
y_train = tf.keras.utils.to_categorical(y_train, 10)
y_test = tf.keras.utils.to_categorical(y_test, 10)
描述 A:x_train, x_test 將影像範圍壓縮到 0~31 範圍
描述 B:可以增加模型的泛化能力
描述 C:x_train, x_test 資料轉換結果相當於 z-score 標準化
描述 D:資料轉換目的是避免梯度爆炸或梯度消失
描述 E:y_train 將 label 轉換為獨熱編碼(One-hot Encoding)
描述 F:y_train 適合輸出層使用 softmax 函數
下列哪一項描述組合正確?
A 描述 A、描述 C、描述 F
B 描述 B、描述 D、描述 E、描述 F
C 描述 B、描述 C、描述 E、描述 F
D 描述 A、描述 B、描述 D、描述 E、描述 F
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
逐一檢核六個描述:描述 B 正確——輸入縮放讓數值尺度一致、訓練更穩定,有助模型泛化;描述 D 正確——把 0~255 壓縮到 0~1,可避免大數值輸入造成梯度爆炸或消失等數值不穩定;描述 E 正確——to_categorical 就是把整數標籤轉成獨熱編碼(One-Hot Encoding);描述 F 正確——One-Hot 標籤搭配輸出層 softmax(配 categorical crossentropy)是多類分類的標準組合。正確組合即 B、D、E、F。
【為何其他選項錯了?】
- (A):包含描述 A——除以 255.0 是把像素從 0~255 縮放到 0~1,不是 0~31;也包含錯誤的描述 C。
- (C):包含描述 C——除以 255 屬 min-max 式縮放,z-score 標準化是 (x−μ)/σ、結果以 0 為中心,兩者公式與分布皆不同。
- (D):四個正確描述都在,卻多納入錯誤的描述 A;組合中只要含一個錯誤描述,整個選項即不成立。
提示:除以 255 是 0~1 縮放,(x−μ)/σ 是 z-score,to_categorical 是 One-Hot;釐清三者即可逐一檢核描述。
本題掛載於「CNN 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
使用 CIFAR-10 資料集(32×32 RGB、10 類)以下列程式建立 CNN 模型,程式分為區塊 1~4:
model = models.Sequential([
# 區塊 1
layers.Input(shape=(32, 32, 3)),
layers.Conv2D(32, kernel_size=(3,3), padding="same", activation="relu"),
layers.BatchNormalization(),
layers.Conv2D(32, (3,3), activation='relu', padding='same'),
layers.BatchNormalization(),
layers.MaxPooling2D((2,2)),
layers.Dropout(0.25),
# 區塊 2
layers.Conv2D(64, (3,3), activation='relu', padding='same'),
layers.BatchNormalization(),
layers.Conv2D(64, (3,3), activation='relu', padding='same'),
layers.BatchNormalization(),
layers.MaxPooling2D((2,2)),
layers.Dropout(0.25),
# 區塊 3
layers.Conv2D(128, (3,3), activation='relu', padding='same'),
layers.BatchNormalization(),
layers.Conv2D(128, (3,3), activation='relu', padding='same'),
layers.BatchNormalization(),
layers.MaxPooling2D((2,2)),
layers.Dropout(0.25),
# 區塊 4
layers.Flatten(),
layers.Dense(256, activation='relu'),
layers.BatchNormalization(),
layers.Dropout(0.5),
layers.Dense(10, activation='softmax')
])
描述 A:區塊 1 layers.Input(shape=(32, 32, 3)) 主要目的是進行資料標準化
描述 B:區塊 1 layers.Conv2D(32, kernel_size=(3,3), padding="same", activation="relu") 考慮輸入為 (32,32,3),則輸出 shape 為 (32,32,3)
描述 C:區塊 1 layers.BatchNormalization() 放在 Conv2D 之後可以減少梯度消失或爆炸
描述 D:區塊 2 layers.Dropout(0.25) 可以隨機將 25% 神經元輸出設定為 1
描述 E:區塊 3 layers.Dropout(0.25) 可以減少過度擬合(Overfitting)
描述 F:區塊 4 Flatten 層的作用是將 3D 特徵圖展開為 1D 向量
下列哪一項描述組合正確?
A 描述 A、描述 C
B 描述 C、描述 E、描述 F
C 描述 A、描述 D、描述 E
D 描述 D、描述 E、描述 F
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
描述 C 正確:BatchNormalization 接在 Conv2D 之後,正規化各通道的輸出分布,穩定訓練並緩解梯度消失或爆炸;描述 E 正確:Dropout(0.25) 隨機丟棄部分神經元輸出,是對抗過擬合的正則化手段;描述 F 正確:Flatten 把 (高, 寬, 通道) 的 3D 特徵圖展平成 1D 向量,銜接後面的全連結層。故正確組合為 C、E、F。
【為何其他選項錯了?】
- (A):描述 A 錯誤——layers.Input 只是宣告輸入張量的形狀,不做任何資料標準化(除以 255 是在資料前處理完成);含描述 A 的組合不成立。
- (C):描述 A 錯誤之外,描述 D 也錯——Dropout 是把被選中的神經元輸出「設為 0」(丟棄),不是設為 1;訓練時還會對保留的輸出做縮放補償。另描述 B 亦錯:32 個濾波器加 same padding 的輸出是 (32,32,32),通道數等於濾波器數,不是 (32,32,3)。
- (D):描述 D 錯誤(同上),含錯誤描述的組合不成立。
提示:same padding 維持長寬、輸出通道數等於濾波器數;Dropout 將輸出設為 0 而非 1;Flatten 將 3D 特徵圖展平為 1D。
本題掛載於「CNN 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
以 CIFAR-10 訓練 CNN 後,繪製訓練與驗證準確率曲線(Training and Validation Accuracy):訓練曲線隨 Epoch 穩定上升,驗證曲線雖上升但出現明顯波動。當 Epochs=6 時,訓練曲線值(0.81)明顯大於驗證曲線值(0.72),下列何者為最可能的原因?
A 學習率(Learning Rate)太低
B 批次大小(Batch Size)設定太大
C 模型低度擬合(Underfitting)
D 模型過擬合(Overfitting)
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
訓練準確率(0.81)明顯高於驗證準確率(0.72),且訓練曲線持續穩定上升、驗證曲線波動且改善有限,兩條曲線的差距逐漸擴大。模型對訓練資料的擬合越來越好,對未見資料的表現卻停滯,是過擬合的典型徵兆:模型開始記憶訓練資料的細節與雜訊,泛化能力受限。此時應考慮更強的正則化(Dropout、權重衰減)、資料增強或早期停止。
【為何其他選項錯了?】
- (A):學習率太低的症狀是訓練與驗證兩條曲線皆上升緩慢,不會單獨造成訓練與驗證之間的落差。
- (B):批次大小過大主要影響收斂行為與泛化的細節,並非「訓練高、驗證低」這種差距的最直接典型解釋。
- (C):低度擬合是訓練與驗證表現皆偏低、連訓練集都學不好;訓練準確率已達 0.81 且持續上升,不符合此描述。
提示:判讀學習曲線:兩線皆低為欠擬合;訓練高、驗證低且差距擴大為過擬合。
本題掛載於「模型訓練與調參 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
若團隊需要建立一個超過50層的深層神經網路,以捕捉晶圓表面細微的劃傷特徵,但又擔心傳統深層網路常見的梯度消失(Vanishing Gradient)問題,則下列哪一種經典架構最適合優先考慮?
A VGG(Visual Geometry Group):透過重複堆疊3×3卷積層與池化層來維持梯度穩定;
B GoogLeNet:透過 Inception 模塊並行使用不同大小的卷積核,以避免深層網路的梯度問題
C ResNet(Residual Network):透過殘差連接(Residual Connection / Skip Connection),使梯度能跨層傳遞並降低深層訓練困難
D Vision Transformer(ViT):完全捨棄卷積,因此不會出現任何深層模型的訓練問題
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
ResNet 的殘差連接讓每個區塊學習殘差 F(x) 並輸出 F(x)+x:恆等捷徑(Skip Connection)為梯度提供直達淺層的傳遞路徑,有效緩解深層網路的梯度消失與退化問題,使 50 層以上的架構(ResNet-50/101/152)得以穩定訓練——正是「要堆疊超過 50 層、又擔心梯度消失」時的首選,適合晶圓表面細微劃傷這類需要深層特徵的檢測任務。
【為何其他選項錯了?】
- (A):VGG 只是反覆堆疊 3×3 卷積與池化,沒有任何跨層捷徑;層數加深後正是梯度消失的高風險架構,「維持梯度穩定」的敘述與事實相反。
- (B):GoogLeNet 的 Inception 模塊解決的是多尺度特徵萃取與計算效率,其訓練還需借助輔助分類器協助梯度傳遞,並非以解決深層梯度問題著稱。
- (D):ViT 沒有卷積不代表沒有訓練難題——它需要大量資料與強正則化才能穩定訓練,「不會出現任何深層模型的訓練問題」的絕對化敘述並不成立。
提示:超過 50 層的深層網路優先考慮殘差連接;Skip Connection 讓梯度可跨層直達淺層。
本題掛載於「CNN 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某 AOI 晶圓瑕疵檢測專案在使用深層 CNN 訓練時,Loss 曲線震盪劇烈,甚至偶爾出現數值溢出(NaN)。為了修復訓練過程中 Loss 突然變成 NaN 的問題,工程師考慮在 PyTorch 訓練迴圈中加入梯度裁剪(Gradient Clipping)機制,例如 torch.nn.utils.clip_grad_norm_。訓練迴圈如下:
for images, labels in train_loader:
optimizer.zero_grad() # 位置 1
outputs = model(images) # 位置 2
loss = criterion(outputs, labels) # 位置 3
loss.backward() # 位置 4
optimizer.step() # 位置 5
若要正確加入梯度裁剪,最適合插入於哪個位置?其主要作用為何?
A 插入於位置 3與位置4之間;用以限制 Loss 數值大小,避免梯度消失
B 插入於位置 4與位置5之間;用以限制梯度範數過大,避免更新步幅失控導致數值不穩
C 插入於位置 5之後;用以將更新後的權重強制壓縮回正常範圍
D 插入於位置 1與位置2之間;用以對輸入影像進行批次標準化
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
訓練迴圈的因果順序:zero_grad 清空舊梯度 → 前向傳播 → 計算損失 → loss.backward() 計算出各參數的梯度 → optimizer.step() 用梯度更新權重。梯度裁剪處理的對象是「已經算出、但尚未用於更新」的梯度,因此必須插在位置 4 與位置 5 之間:當整體梯度範數超過閾值時,等比例縮小所有梯度,限制單步更新幅度,避免梯度爆炸把權重推向極端、造成 Loss 震盪甚至 NaN。
【為何其他選項錯了?】
- (A):位置 3 與 4 之間 backward 尚未執行,梯度還不存在,無梯度可裁剪;且裁剪的對象是梯度而非 Loss 數值,目的是防梯度爆炸,不是防梯度消失。
- (C):位置 5 之後權重已被異常梯度更新完畢,再處理為時已晚;梯度裁剪也不是「把權重壓縮回正常範圍」的機制。
- (D):位置 1 與 2 之間前向傳播尚未開始,與梯度無關;梯度裁剪更不負責對輸入影像做批次標準化。
提示:backward 之後、step 之前才有梯度可裁剪;裁剪對象是梯度範數,目的是維持數值穩定。
本題掛載於「梯度下降 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。