iPAS 歷屆考題 · 中級

115年第一次中級AI應用規劃師
大數據處理分析與應用

第二科 · 共 50 題 · 每題附正解與逐選項詳解,「觀念複習」直達對應教學節點。

50 中級第二科
開啟互動地圖 其他卷別

建議先自行作答再展開詳解;每題可透過「觀念複習」回到掛載該題的知識節點。試題著作權屬原主辦單位,本站解析僅供考生學習之用。

第 1 題觀念複習:分佈 / 偏態

工程師使用盒鬚圖(Box Plot)比較三個城市的房價分布,觀察到城市A的盒子很短但鬚很長,城市 B 的盒子很長且對稱,城市 C 的中位數位置明顯偏向盒子下方。依統計圖形判讀原則,下列敘述何者正確?

  1. A城市A中段房價集中但存在極端值;城市 C 中位數偏低,資料呈右偏分布
  2. B城市A房價集中且離群值少;城市 C 資料呈左偏分布
  3. C城市B 的盒子較長代表房價變異較大;城市 C 呈左偏分布
  4. D盒鬚圖無法判斷偏態,需搭配直方圖才能得出以上結論
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 盒鬚圖的盒子涵蓋第一四分位數(Q1)到第三四分位數(Q3),盒子短代表中間 50% 的房價集中;鬚很長代表資料整體範圍大、尾端存在遠離主體的極端值,城市A正是「中段集中但有極端值」的型態。城市C的中位數線靠近盒子下緣,表示下半部資料較密集、上半部延伸較開,屬於右偏(正偏)分布;此時平均數通常會被高價個案拉得比中位數高。 【為何其他選項錯了?】 - (B):「房價集中」只描述了盒子短的部分;鬚很長正暗示存在極端值或範圍大,「離群值少」與圖形特徵矛盾,且把城市C判為左偏也弄反了方向。 - (C):城市B盒子長代表變異大,此句正確;但城市C中位數偏向盒子下方屬右偏而非左偏,選項只要有一處錯誤即不成立。 - (D):盒鬚圖透過中位數在盒中的位置與上下鬚的長短即可判讀偏態方向,不需搭配直方圖;「無法判斷偏態」的敘述錯誤。 提示:中位數偏盒子下緣、上尾拉長為右偏;偏態方向依「長尾指向哪一側」判讀。

本題掛載於「分佈 / 偏態」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 2 題觀念複習:決策樹/隨機森林

吉尼不純度(Gini Impurity)的計算公式為:G = 1 − Σᵢ₌₁ᵏ pᵢ²(即 1 減去各類別 pᵢ 的平方總和,i 從 1 加總到 k)。在決策樹(Decision Tree)中,吉尼不純度用於評估節點分裂的品質。關於吉尼不純度,下列敘述何者不正確?

  1. A公式中的 pᵢ代表第 i 類在該節點中的樣本數,並直接帶入公式計算
  2. B公式中的 k代表節點內資料的類別數量
  3. C吉尼不純度用於衡量節點內資料的類別混雜程度,數值越高代表越混雜
  4. D當節點內所有樣本屬於同一類別時(完全純淨),吉尼不純度為 0
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 公式 G = 1 − Σpᵢ² 中的 pᵢ 是「第 i 類樣本在該節點中所占的比例」,為介於 0 與 1 之間的相對次數,而非樣本數。若直接以樣本數代入,平方總和會遠大於 1,G 將成為絕對值極大的負數,完全失去「不純度介於 0 至 1 − 1/k」的意義。決策樹分裂時,即是比較分裂前後的加權吉尼不純度,選擇能使不純度下降最多的切分方式。本題要求選出不正確的敘述,(A) 將比例誤述為樣本數,正是錯誤選項。 【為何其他選項錯了?】 - (B):此為正確敘述,故非本題答案。k 代表該節點內的類別數量,例如二元分類 k = 2、三類別 k = 3。 - (C):此為正確敘述,故非本題答案。吉尼不純度衡量節點內類別的混雜程度,數值越高越混雜;二元分類時兩類各半最混雜,G = 0.5。 - (D):此為正確敘述,故非本題答案。節點內樣本全屬同一類時,該類 pᵢ = 1、其餘為 0,G = 1 − 1 = 0,代表完全純淨。 提示:吉尼公式代入的是類別「比例」而非「樣本數」;純淨節點 G = 0,越混雜 G 越大。

本題掛載於「決策樹/隨機森林」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 3 題觀念複習:分佈 / 偏態

某物流平台要預測「每小時客服來電數量」,資料顯示平均每小時 12 通,且來電事件彼此獨立,並在固定時間區間內發生率穩定。工程師在選擇機率模型時,應優先考慮哪個分布?若實際資料的變異數明顯大於平均數,應如何調整?

  1. A使用常態分布(Normal Distribution);變異數偏大時改用 t 分布
  2. B使用卜瓦松分布(Poisson Distribution);變異數>平均數時改用負二項分布(Negative Binomial)
  3. C使用卜瓦松分布(Poisson Distribution);變異數偏大時增加樣本數即可修正
  4. D使用二項分布(Binomial Distribution);變異數偏大時改用卜瓦松分布(Poisson Dstribution)
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 「固定時間區間內的事件發生次數」、事件彼此獨立、發生率穩定,正是卜瓦松分布的三個經典假設,因此每小時來電數應優先以 Poisson(λ=12) 建模。卜瓦松分布有一項固定性質:平均數等於變異數(皆為 λ)。當實際資料的變異數明顯大於平均數,即出現過度離散(Overdispersion),表示卜瓦松假設不成立,標準做法是改用多一個離散參數的負二項分布(Negative Binomial)來吸收多出的變異。 【為何其他選項錯了?】 - (A):常態分布是連續分布,來電「次數」是非負整數的計數資料,分布型態的選擇即不正確;t 分布用於小樣本平均數推論,與過度離散問題無關。 - (C):前半句正確,但「增加樣本數」只會讓參數估計更精準,無法改變母體變異數大於平均數的事實;分布假設錯誤時,增加資料量並不能修正。 - (D):二項分布需要「固定試驗次數 n 與成功機率 p」,每小時來電數沒有天然的試驗次數上限;且修正方向顛倒,卜瓦松分布本身無法處理過度離散。 提示:計數資料優先考慮卜瓦松分布;變異數大於平均數(過度離散)時改用負二項分布。

本題掛載於「分佈 / 偏態」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 4 題觀念複習:假設檢定

某工程師使用 MLflow 進行實驗追蹤,評估三種不同學習率(0.001、0.01、0.1)對同一模型在驗證資料集上的損失表現。每種學習率皆以不同隨機種子重複訓練 10次,形成三組彼此獨立的樣本資料。經檢查後,這些資料近似常態分布且變異數相近。工程師希望判斷三組平均損失是否存在顯著差異,同時避免因進行多次兩兩比較而提高第一類型錯誤率。請問下列何者為最適合採用的統計方法?

  1. A單因子變異數分析(One-Way ANOVA)
  2. B獨立樣本 t 檢定(Independent Samples t-test)
  3. C卡方獨立性檢定(Chi-Square Test);
  4. DWilcoxon 符號等級檢定(Wilcoxon Signed-Rank Test)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 要同時比較「三組以上」獨立樣本的平均數是否有顯著差異,且資料近似常態、變異數相近,標準方法即為單因子變異數分析(One-Way ANOVA)。ANOVA 以一次 F 檢定回答「是否至少有一組平均數不同」,避免進行 3 次兩兩 t 檢定造成型一錯誤率膨脹(3 次檢定的整體偽陽性率約 1 − 0.95³ ≈ 14%)。題幹的條件(三組、常態、變異數相近、要求控制多重比較)完整對應 ANOVA 的適用情境。 【為何其他選項錯了?】 - (B):獨立樣本 t 檢定一次只能比較兩組;三組需檢定三次,正是題目明言要避免的「多次兩兩比較推高型一錯誤率」。 - (C):卡方獨立性檢定處理的是兩個類別變數之間的關聯(列聯表),損失值是連續數值,方法與資料型態不符。 - (D):Wilcoxon 符號等級檢定是「成對或單一樣本」的無母數方法,適用於資料不符常態的配對情境;本題為三組獨立且近似常態,應採用母數方法的 ANOVA。 提示:兩組獨立比較用 t 檢定,三組以上比較平均數用 ANOVA;整體顯著後再以事後檢定確認差異來源。

本題掛載於「假設檢定」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 5 題觀念複習:離群值偵測

某 AI 團隊在模型上線後,透過監控系統持續追蹤輸入特徵的分布變化,系統使用 Z- score(Z)作為異常判斷依據,並設定當|Z| ≥ 2時需觸發警示。假設該特徵近似常態分布,某次監控中發現某特徵值的 Z-score為-2,請問就實務判讀而言,此數值最可能代表什麼意義?

  1. A該特徵值低於該特徵歷史平均值 2個標準差
  2. B該特徵值高於該特徵歷史平均值 2個標準差
  3. C該特徵值等於該特徵的歷史平均值
  4. DZ-score為負值代表該數值位於母體分布之外,無法以常態分布解釋
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 Z-score 的定義為 Z = (觀測值 − 平均值) ÷ 標準差,衡量觀測值偏離平均值幾個標準差。Z = −2 代表該特徵值低於歷史平均值 2 個標準差:負號表示方向在平均值以下,絕對值 2 表示偏離幅度達兩個標準差。在 |Z| ≥ 2 的警示規則下,這筆資料屬於偏低方向的異常候選,常態分布下單尾機率約 2.3%,應觸發警示供人工檢視。 【為何其他選項錯了?】 - (B):方向判讀相反,高於平均值 2 個標準差對應的 Z-score 是 +2;Z-score 的正負號承載方向資訊,不可忽略。 - (C):特徵值等於平均值時 Z = 0;Z = −2 與「等於平均值」相差兩個標準差,並不相符。 - (D):Z-score 為負只代表觀測值低於平均值,完全在常態分布的解釋範圍內,常態分布中低於平均值的所有觀測值 Z 皆為負;「負值即位於母體分布之外」是錯誤理解。 提示:Z = (x − μ)/σ,正負號看方向、絕對值看偏離幾個標準差;|Z| ≥ 2 約落在分布最極端的 5% 之內。

本題掛載於「離群值偵測」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 6 題觀念複習:假設檢定

在 AI 模型評估的假說檢定框架中,「女士品茶」實驗是理解型一/型二錯誤的經典案例。實驗中某女士宣稱能分辨 8 杯奶茶中哪4杯先加牛奶,若以顯著水準 α=0.05進行假說檢定,下列敘述何者不正確?

  1. A虛無假說(H₀)為「女士無此能力(隨機猜測)」,對立假說(H₁)為「女士確實有此能力」
  2. B在α=0.05 下,若女士完全答對(8選4全對),其p 值約為1/70≈0.014,小於顯著水準,可達統計顯著
  3. C若女士完全答對且 p值<α,則拒絕虛無假說,統計上支持女士有此能力
  4. D若女士未完全答對,則「接受虛無假說」,代表確認女士無此能力
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 本題選「不正確」的敘述。假說檢定的邏輯是:證據不足以推翻 H₀ 時,只能說「不拒絕(fail to reject)虛無假說」,而非「接受並確認 H₀ 為真」。未達顯著可能只是樣本太小、檢定力不足,不能反過來當成「證明女士沒有此能力」。選項 (D) 把「接受虛無假說」解讀為「確認女士無此能力」,把證據不足誤當成反向證明,是不正確的敘述,即為本題答案。 【為何其他選項錯了?】 - (A):此敘述正確:H₀ 設為「無此能力(隨機猜測)」、H₁ 為「有此能力」,正是 Fisher 女士品茶實驗的標準設定。 - (B):此敘述正確:8 杯選 4 杯的組合數為 C(8,4) = 70,全對的機率為 1/70 ≈ 0.014,小於 0.05,達到統計顯著。 - (C):此敘述正確:p 值小於 α 時拒絕 H₀,統計上支持該女士確實具有分辨能力,推論程序無誤。 提示:檢定結論只有「拒絕」與「不拒絕」H₀,沒有「證明 H₀ 為真」;不顯著不等於沒有效果,可能只是樣本數不足、檢定力不夠。

本題掛載於「假設檢定」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 7 題觀念複習:假設檢定

某醫療AI研究團隊開發了一套個人化用藥劑量推薦系統,並設計實驗評估其效果。研究團隊招募 40 名高血壓患者,分別在導入 AI 推薦系統前後各測量一次收縮壓,且資料近似常態分布。研究目標是判斷同一批患者在依據 AI推薦調整用藥劑量前後,血壓是否有顯著差異。請問此研究情境應選用哪種統計檢定方法?

  1. A獨立樣本 t 檢定(Independent Samples t-test)
  2. B成對樣本 t 檢定(Paired Samples t-test)
  3. C單因子變異數分析(One-Way ANOVA)
  4. D魏克遜符號等級檢定(Wilcoxon Signed-Rank Test)
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 關鍵條件是「同一批 40 名患者、導入前後各測量一次」:同一受試者的前後測資料屬於成對(相依)樣本,應使用成對樣本 t 檢定。它先計算每位患者「前測 − 後測」的差值,再檢定差值的平均是否顯著異於 0,能扣除患者之間基準血壓的個體差異,統計檢定力高於把前後測視為兩組獨立資料的做法;資料近似常態也滿足 t 檢定的前提。 【為何其他選項錯了?】 - (A):獨立樣本 t 檢定假設兩組彼此無關;同一人的前後測高度相關,若視為獨立樣本,個體差異會混入誤差項,降低檢定力。 - (C):單因子 ANOVA 用於三組以上「獨立」組別的平均數比較;本題只有前後兩個相依時點,不適用。 - (D):Wilcoxon 符號等級檢定確實適用於成對設計,但它是資料「不符常態」時的無母數替代方案;題目已言明資料近似常態,首選仍是母數方法的成對 t 檢定。 提示:同一人前後測用成對 t 檢定;不同人分兩組用獨立 t 檢定;常態假設不成立時才改用 Wilcoxon。

本題掛載於「假設檢定」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 8 題觀念複習:假設檢定

某咖啡店聲稱其平均外送時間為 36 分鐘,母體標準差為 16 分鐘。顧客保護團體抽樣 9 筆訂單,發現平均外送時間為 40 分鐘。若採用右尾 Z 檢定(H₁: μ > 36),顯著水準 α = 0.05(臨界值 Z₀.₀₅ = 1.645),參考公式:Z = (x̄ − μ₀) / (σ / √n)。請問 Z 值與檢定結果為何?

  1. AZ ≈ 0.08,拒絕虛無假說
  2. BZ ≈ 0.08,不拒絕虛無假說
  3. CZ ≈ 0.75,拒絕虛無假說
  4. DZ ≈ 0.75,不拒絕虛無假說
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 代入公式 Z = (x̄ − μ₀) / (σ / √n):分子 = 40 − 36 = 4;分母 = 16 / √9 = 16 / 3 ≈ 5.33,故 Z = 4 ÷ 5.33 ≈ 0.75。右尾檢定的決策規則是 Z 大於臨界值才拒絕 H₀;0.75 < 1.645,落在不拒絕區,因此沒有足夠證據支持平均外送時間超過 36 分鐘。在僅抽樣 9 筆、母體標準差高達 16 分鐘的情況下,多出的 4 分鐘很可能只是抽樣波動。 【為何其他選項錯了?】 - (A):Z ≈ 0.08 是分母誤算的結果(如誤算成 4/48 ≈ 0.08);且即使 Z = 0.08 也遠小於 1.645,「拒絕」的結論同樣不成立。 - (B):Z 值計算錯誤,正確標準誤是 σ/√n = 16/3 ≈ 5.33,而非 48;雖然「不拒絕」的結論方向相同,但 Z 值錯誤即非正確選項。 - (C):Z ≈ 0.75 計算正確,但 0.75 小於臨界值 1.645,應為「不拒絕」;此選項在決策步驟判斷錯誤。 提示:標準誤是 σ/√n(除以根號 n);右尾檢定須 Z 大於臨界值才拒絕 H₀。

本題掛載於「假設檢定」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 9 題觀念複習:假設檢定

某生技公司正在進行新型 AI 輔助新藥篩選的臨床試驗,並將顯著水準由 α=0.05 降低至α=0.01。在新藥療效安全試驗的情境下,此調整對統計檢定的直接影響為何?

  1. A降低型二錯誤(Type II Error/β)的發生機率,減少未能偵測到有效藥物的風險
  2. B降低型一錯誤(Type I Error/α,偽陽性)的發生機率,減少將無效藥物誤判為有效並進入後續高成本試驗的風險
  3. C增加樣本數以提升統計功效(Statistical Power),進而改善估計精度
  4. D降低統計計算過程中的數值誤差,提高 p值的精確度
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 顯著水準 α 的定義就是「型一錯誤的機率上限」:在虛無假說為真(藥物其實無效)時,誤判為有效的機率。把 α 從 0.05 降至 0.01,直接效果是把偽陽性風險從 5% 壓低到 1%,降低「無效藥物被誤判有效、進入後續高成本試驗甚至危害病患」的機率。在新藥安全情境中,這是常見的保守設定,以更嚴格的門檻防止假療效通過檢定。 【為何其他選項錯了?】 - (A):方向相反。在樣本數不變的情況下,α 調小會使拒絕 H₀ 變難,型二錯誤 β 反而上升,更容易遺漏真正有效的藥物;α 與 β 存在此消彼長的抵換關係。 - (C):調整 α 本身不會自動增加樣本數;要在較小的 α 下維持統計功效,必須另外加大樣本數,那是研究設計的配套措施,不是降低 α 的直接影響。 - (D):α 是決策門檻,與數值計算精度或 p 值的準確性無關;p 值的計算結果不變,只是與更嚴格的門檻比較。 提示:α 是型一錯誤(偽陽性)上限;α 調小則偽陽性減少、但 β(偽陰性)上升,兩者為抵換關係。

本題掛載於「假設檢定」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 10 題觀念複習:資料切分

某團隊為職業籃球隊建立球員受傷風險預測模型,原始特徵 280 個。初始模型訓練集AUC 為0.94、測試集僅0.68,顯示嚴重過擬合。為改善模型,團隊進行以下處理步驟:第一步於全體資料(含測試集)上計算特徵間線性相關係數並移除高度相關特徵;第二步依模型重要性篩選特徵後重新訓練模型。最終測試集 AUC 提升至0.81。關於上述調整流程,下列敘述何者最為正確?

  1. A使用相關係數進行特徵篩選方向正確,主要問題在於相關係數門檻設定過高
  2. B在全體資料(含測試集)上進行特徵篩選會造成資料洩漏,且線性相關無法捕捉非線性關係
  3. C特徵篩選後需重新對測試集進行標準化,否則會影響模型表現
  4. D測試集表現提升代表過擬合已解決,流程可直接部署
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 此流程有兩項根本問題。第一,特徵篩選屬於「從資料學到的決策」,在包含測試集的全體資料上計算相關係數並篩選特徵,測試集的資訊即滲入建模流程,構成資料洩漏(Data Leakage),其後的測試集 AUC 0.81 已不是乾淨的泛化估計。第二,線性相關係數僅能偵測線性關係,特徵間的非線性冗餘或與目標變數的非線性關聯皆無法捕捉。正確做法是將特徵篩選納入僅使用訓練資料(或交叉驗證訓練折)的建模管線。 【為何其他選項錯了?】 - (A):問題不在門檻高低,而在於使用了不應參與建模的測試集;無論門檻如何設定,資料洩漏依然存在。 - (C):標準化的正確原則是以訓練集擬合轉換參數後套用至測試集,並非特徵篩選後須對測試集重新標準化;此敘述未指出流程真正的缺陷。 - (D):測試集分數的提升可能部分來自洩漏造成的樂觀偏誤;以受污染的評估結果直接部署,上線後實際表現往往低於預期。 提示:凡是從資料學來的步驟(篩選、編碼、縮放)都只能在訓練集上擬合;測試集僅供最終評估,不得參與任何建模決策。

本題掛載於「資料切分」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 11 題觀念複習:One-hot / Label

某團隊為電信公司建立用戶月租方案續約預測模型,資料集包含兩個類別特徵:「客服評價」共有 5 個等級(非常不滿意至非常滿意),具明確順序關係;「居住縣市」共有22個不同類別,類別之間無順序關係。團隊計劃分別以 Logistic Regression 與XGBoost訓練模型,並對上述特徵進行編碼。請問下列哪個編碼方案最適當?

  1. A兩模型皆將「客服評價」與「居住縣市」進行 One-Hot Encoding,保留全部欄位並使用相同特徵矩陣訓練模型
  2. BLogistic Regression 將「客服評價」做 Ordinal Encoding、「居住縣市」以歷史續約率進行編碼且於資料切分前計算;XGBoost 對兩個特徵皆採 Ordinal Encoding 處理
  3. CLogistic Regression 將「客服評價」做 Ordinal Encoding、「居住縣市」進行 One-Hot Encoding 並採 Drop First;XGBoost 將「客服評價」採 Ordinal Encoding,「居住縣市」以類別型態輸入並啟用 enable_categorical
  4. D兩個模型均將「客服評價」以平均續約率進行編碼,「居住縣市」先做 One-Hot Encoding 再以 PCA 降維,並統一作為兩模型輸入特徵
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 「客服評價」五等級有明確順序,用 Ordinal Encoding 保留次序資訊最合適。「居住縣市」22 類且無順序:對線性模型(Logistic Regression)應以 One-Hot 展開,並 Drop First 一欄避免虛擬變數陷阱(完全共線性);對 XGBoost 這類樹模型,可將縣市以類別型態直接輸入並啟用 enable_categorical,由樹自行尋找最佳切分,不必展開成 22 欄。(C) 對兩種模型都採用了各自最合適的編碼,是唯一全對的組合。 【為何其他選項錯了?】 - (A):把有序的客服評價 One-Hot 會遺失順序資訊;且兩模型硬共用同一特徵矩陣,放棄了 XGBoost 原生處理類別的優勢。 - (B):「居住縣市以歷史續約率編碼且於資料切分前計算」是標準的目標洩漏(Target Leakage),使用了含測試集的目標值資訊;對 XGBoost 把無序縣市做 Ordinal,也會憑空引入 22 個縣市的大小順序。 - (D):對有序特徵改用平均續約率編碼同樣有洩漏疑慮;One-Hot 後再 PCA 會把類別語意混合成難以解釋的成分,對樹模型並無必要。 提示:有序類別用 Ordinal;無序少類用 One-Hot(線性模型記得 Drop First);樹模型可用原生類別;目標編碼必須在切分後只用訓練集計算。

本題掛載於「One-hot / Label」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 12 題觀念複習:ETL / ELT

某資料工程師在建構 AI 訓練資料處理流程時,需要處理一個 50GB 的 CSV 檔案,其大小遠超過系統可用記憶體。他使用 Python 的 Pandas 進行資料前處理,但直接呼叫pd.read_csv()時出現記憶體溢位(Out of Memory, OOM)錯誤。在不改用其他分散式框架的前提下,下列哪個參數最能有效解決此問題?

  1. Anrows=10000:限制僅讀取前 N筆資料以避免記憶體溢位
  2. Busecols=0.5:隨機載入 50%的資料欄位,以減半記憶體使用量
  3. Cchunksize=10000:分批讀取資料並逐批處理,避免一次載入整個檔案
  4. Ddtype:指定欄位資料型別以降低記憶體使用量
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 pd.read_csv(chunksize=10000) 會回傳迭代器,每次僅載入 1 萬列資料,處理完畢再讀取下一批,讓 50GB 檔案以「分批串流」方式通過有限的記憶體;搭配逐批聚合或逐批寫出,即可在不更換分散式框架的前提下完成前處理,是單機 Pandas 處理超出記憶體資料量的正規作法,故 (C) 正確。 【為何其他選項錯了?】 - (A):nrows=10000 只讀取前 1 萬筆,其餘資料完全未被處理;雖可避免記憶體溢位,但訓練資料嚴重殘缺,未達成處理整份檔案的目標。 - (B):usecols 參數接受的是欄位名稱或索引清單,不存在「傳入 0.5 即隨機載入一半欄位」的用法,語法即不成立;隨機捨棄欄位對需要完整欄位的前處理也不合理。 - (D):指定 dtype(如 float64 降為 float32、字串轉 category)確實能降低記憶體用量,是良好習慣;但檔案大小「遠超」可用記憶體時,節省比例有限仍無法完整載入,故不是最能有效解決的選項。 提示:單機處理超大檔案的首選是 chunksize 分批處理;dtype 屬輔助手段,資料量更大時再考慮 Dask、Spark 等框架。

本題掛載於「ETL / ELT」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 13 題觀念複習:DB / API

某電商平台正在重構商品資料架構,需同時支援三個系統:商品管理後台需處理結構化與半結構化資料(如巢狀庫存與不同類別商品欄位差異),並支援複雜條件查詢;AI推薦系統需儲存高維向量(1,536 維)並進行高效相似度搜尋(高 QPS);即時庫存服務則要求ACID且延遲低於 10ms,以避免超賣。在此情境下,哪種資料庫架構最適合?

  1. A全部使用關聯式資料庫,透過 JSON 欄位儲存巢狀資料,並以延伸套件支援向量搜尋,同時以資料列鎖(Row-level Lock)處理庫存扣減
  2. B商品資料使用文件型資料庫,向量搜尋使用專用向量資料庫,庫存服務使用關聯式資料庫,各系統依需求選擇最適合的資料庫
  3. C全部使用文件型資料庫,同時處理商品資料、向量搜尋與庫存服務,以統一技術棧降低維運複雜度
  4. D商品與向量資料使用搜尋引擎型資料庫,並以文件更新機制處理庫存扣減
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 三個系統的工作負載性質差異極大:商品管理需處理巢狀、欄位異質的半結構化資料並支援複雜條件查詢,文件型資料庫(如 MongoDB)最適合;推薦系統需對 1,536 維向量進行高 QPS 相似度搜尋,專用向量資料庫具備 HNSW 等近似最近鄰索引與水平擴展設計;庫存扣減要求 ACID 交易與 10ms 以內延遲,關聯式資料庫的交易保證最可靠。依工作負載選型、各司其職,正是多元持久化(Polyglot Persistence)的設計原則,故 (B) 正確。 【為何其他選項錯了?】 - (A):關聯式資料庫以 JSON 欄位與向量延伸套件雖然「都能做到」,但巢狀查詢彈性與高 QPS 向量檢索的效能上限不如專用引擎,單一資料庫承擔三種負載也容易互相干擾。 - (C):文件型資料庫的多文件交易與隔離保證相對較弱,以其承擔「不得超賣」的庫存扣減,一致性風險過高;統一技術棧的維運便利無法彌補交易正確性的缺口。 - (D):搜尋引擎型資料庫(如 Elasticsearch)為近即時架構且預設最終一致,文件更新機制不具嚴格 ACID 保證,不適合作為庫存扣減的權威資料來源。 提示:依負載選型:半結構化與複雜查詢用文件型、向量檢索用向量資料庫、強一致交易用關聯式;單一資料庫難以同時滿足三種極端需求。

本題掛載於「DB / API」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 14 題觀念複習:DB / API

某AI平台的資料量已達 PB 級,單一資料庫節點已無法負荷,決定採用分片(Sharding)策略。下列何者為 Sharding設計的主要目的?

  1. A增加資料備份數量以提升安全性
  2. B將查詢結果預先計算以降低延遲
  3. C將資料水平分割以提升擴展性與負載均衡
  4. D將資料壓縮以減少儲存成本
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 分片(Sharding)是把同一份大型資料集依分片鍵(Shard Key)「水平分割」成多個子集,分散存放於多個節點,各節點只負責自身資料子集的儲存與讀寫。目的有二:突破單機容量與吞吐上限,達成水平擴展(Scale-out);並將查詢與寫入流量分散到多個節點,實現負載均衡。PB 級資料超出單節點負荷時,分片是標準解法,故 (C) 正確。 【為何其他選項錯了?】 - (A):增加備份數量、提升資料安全性與可用性是複製(Replication)的目的;分片是把資料切割分散,每個分片預設只有一份,兩種機制常搭配使用但目的不同。 - (B):預先計算查詢結果屬於物化視圖(Materialized View)或快取策略,與水平分割資料是不同層次的優化手段。 - (D):壓縮儲存依靠儲存格式與編碼技術(如列式儲存、壓縮演算法);分片只是將資料分散到不同節點,資料總量並未減少。 提示:Sharding 是水平切割以擴展與分流;Replication 是多副本以高可用,兩者目的不同,不可混淆。

本題掛載於「DB / API」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 15 題觀念複習:模型訓練與調參

某資料工程師在建構大規模影像資料處理流程時,需要處理數千萬筆訓練影像,並發現模型出現嚴重的過度擬合(Overfitting):訓練集準確率達 99%,但驗證集僅有 72%。在不改變模型架構的前提下,下列哪一項「資料處理層面」的調整最無法有效改善過度擬合,甚至可能使問題惡化?

  1. A在資料處理流程中加入資料增強(Data Augmentation),於訓練時動態生成多樣化影像樣本
  2. B擴充資料來源,收集更多不同場景與條件的影像,以提升訓練資料分布的多樣性
  3. C為了提升資料處理吞吐量(Throughput),預先將影像轉為固定特徵並快取(Cache),反覆使用相同訓練資料以加速訓練流程
  4. D在資料前處理階段進行資料清理,移除標註錯誤或品質不佳的影像資料
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 從資料處理層面改善過度擬合,核心是增加訓練資料的多樣性,降低模型記憶固定樣本的機會。選項 (C) 反其道而行:將影像預先轉為固定特徵並快取後,每個訓練週期反覆使用完全相同的資料,等於關閉了資料增強等隨機變化,模型更容易記憶這批固定樣本。此做法雖提升吞吐量,卻無助於改善過度擬合,甚至可能使其惡化,故為本題所問的選項。 【為何其他選項錯了?】 - (A):資料增強在訓練時動態產生翻轉、裁切、色彩擾動等變化,同一影像每個週期呈現不同樣貌,是改善影像過度擬合的常用有效手段,故非答案。 - (B):擴充不同場景與條件的資料來源,直接增加訓練分布的涵蓋面,可提升模型泛化能力,屬有效作法。 - (D):移除標註錯誤與品質不佳的影像,可減少模型記憶錯誤標籤與雜訊的機會,有助於泛化,同樣屬有效作法。 提示:資料層面防過擬合的方向是多樣化(增強、擴充來源)與乾淨化(清理標註);使模型反覆讀取同一份固定資料的加速手段,須留意過擬合副作用。

本題掛載於「模型訓練與調參」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 16 題觀念複習:降維

某工程師在建立推薦系統時,評估使用奇異值分解(Singular Value Decomposition, SVD)對使用者-商品評分矩陣進行潛在語意分析(Latent Semantic Analysis, LSA)。關於SVD的數學性質,下列何者不正確?

  1. ASVD只能分解方陣(Square Matrix),無法應用於行列數不相等的長方形矩陣
  2. BSVD常用於降維(Dimensionality Reduction),透過保留最大的 k個奇異值來近似原始矩陣(截斷 SVD)
  3. CSVD比PCA更一般化,因為PCA可視為對資料的共變異數矩陣(Covariance Matrix)進行的特殊 SVD運算
  4. DLSA 是 SVD 在文字-文件矩陣上的應用,透過截斷 SVD 捕捉詞語與文件的潛在語意關係
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 SVD 的重要性質正是適用於「任意 m×n 長方形矩陣」:A = UΣVᵀ,其中 U、V 為正交矩陣、Σ 為奇異值構成的對角矩陣,對行列數不相等的矩陣同樣成立。推薦系統的使用者×商品評分矩陣幾乎不會是方陣,正因 SVD 不限矩陣形狀,才能應用於 LSA 與矩陣分解。「只能分解方陣」是特徵值分解(Eigendecomposition)的限制,不是 SVD 的性質;題目要求選出不正確者,(A) 即為答案。 【為何其他選項錯了?】 - (B):此為正確敘述,故非本題答案。截斷 SVD(Truncated SVD)保留最大的 k 個奇異值與對應向量,可得到原矩陣的最佳低秩近似,是經典的降維手法。 - (C):此為正確敘述,故非本題答案。PCA 可視為對中心化資料的共變異數矩陣做特徵分解,等價於對中心化資料矩陣做 SVD;SVD 不需先中心化、不限方陣,確實更一般化。 - (D):此為正確敘述,故非本題答案。LSA 即是對詞與文件矩陣進行截斷 SVD,萃取潛在語意維度,使語意相近的詞在低維空間中距離更近。 提示:SVD 可分解任意形狀的矩陣;「僅限方陣」的是特徵值分解。LSA=詞文件矩陣+截斷 SVD。

本題掛載於「降維」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 17 題觀念複習:資料清洗

某醫院欲建立一套加護病房(ICU)敗血症預測模型,資料來自 120位病患之生命徵象(如心率、血壓、體溫等),每 5 分鐘記錄一次。資料中敗血症相關樣本僅佔 3.2%,屬於高度不平衡資料。在資料檢查過程中發現數項問題,包括血氧資料會出現 10 至 30分鐘的連續缺失、部分血壓感測器隨使用時間產生系統性偏高(感測器漂移)、敗血症標註時間存在約±2小時誤差,以及不同病患之正常生命徵象基準差異甚大。請問下列何種資料處理與建模方式最為適當?

  1. A將缺失值以整體平均填補,未額外處理感測器漂移,並將敗血症標註區間由 6小時擴大至8小時以涵蓋時間誤差,模型評估採用 ROC-AUC 作為主要指標
  2. B對缺失值進行線性插值,若連續缺失時間過長則刪除該段資料,並以 Z-score 標準化處理感測器漂移,交叉驗證採隨機切分,未避免同一病患資料同時出現在訓練與測試集中
  3. C刪除所有含缺失值之資料,對資料進行 Min-Max 正規化處理,未考慮病患間差異直接建模,並以 Accuracy 作為評估指標,交叉驗證採分層 K-Fold 方式進行
  4. D對缺失值採前向填補並加入缺失指標特徵,利用感測器 72 小時滾動中位數進行漂移校正,並處理標註雜訊,同時以個別病患基準建模,交叉驗證採病患分組,評估採PR-AUC 與 Recall 指標
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 選項 (D) 對題幹列出的每項資料問題都給出對症處理:血氧連續缺失採前向填補並加入缺失指標特徵,保留「缺失本身可能是臨床訊號」的資訊;感測器漂移以 72 小時滾動中位數校正,可吸收隨時間累積的系統性偏移;敗血症標註時間誤差納入處理;病患間基準差異大,則以個別病患基準建模;交叉驗證採病患分組(Group K-Fold),避免同一病患資料同時出現於訓練與測試集造成洩漏;在 3.2% 的高度不平衡下改以 PR-AUC 與 Recall 評估,較 ROC-AUC 更能反映少數類別的偵測能力,故 (D) 最為適當。 【為何其他選項錯了?】 - (A):以整體平均填補會抹平病患間差異,且完全未處理感測器漂移;將標註區間擴大只是把標註雜訊的範圍拉寬,並非校正。 - (B):最嚴重的缺陷是隨機切分且未避免同一病患資料跨訓練與測試集;時間序列與同病患資料高度相關,如此切分會造成資料洩漏,離線評估虛高;Z-score 標準化也無法校正隨時間累積的漂移。 - (C):刪除所有含缺失值的資料,會大量損失 10 至 30 分鐘連續缺失的片段,樣本折損嚴重;高度不平衡資料以 Accuracy 評估更是典型陷阱。 提示:醫療時序資料三原則:缺失加指標、病患分組切分、不平衡改看 PR-AUC 與 Recall;隨機切分是資料洩漏的高發區。

本題掛載於「資料清洗」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 18 題觀念複習:相關 / 關聯

某零售企業的 AI工程師正在用關聯規則學習(Association Rule Learning)分析購物籃資料,評估商品 A 跟商品 B 之間同時購買的關係。關於「支援度(Support)」、「信賴度(Confidence)」、「提升度(Lift)」三個指標,下列敘述何者正確?

  1. A信賴度=P(A∩B),即A與B 同時出現的機率,範圍[0,1]
  2. B支援度=P(B|A),即 A出現時 B 也出現的條件機率,範圍[0,1]
  3. C提升度=P(A∩B) / [P(A)×P(B)],範圍固定在[0,1]之間
  4. D提升度=1 表示 A 與 B 獨立(無關聯),<1 表示負相關,>1 表示正向關聯,因此提升度並非數值愈大即代表關聯愈強
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 提升度 Lift(A→B) = P(A∩B) / [P(A)×P(B)] = Confidence(A→B) / P(B),衡量「A 出現後 B 出現的機率」相對於「B 本身出現機率」的放大倍數。Lift = 1 代表 A 與 B 統計獨立;大於 1 為正向關聯;小於 1 為負相關。但 Lift 高不必然代表關聯強而可靠:當支援度極低(例如兩件冷門商品偶然同時購買一次)時,Lift 可能極高卻無商業意義,因此實務上須將 Support、Confidence、Lift 三個指標合併判讀,選項 (D) 的敘述完整且正確。 【為何其他選項錯了?】 - (A):P(A∩B) 是「支援度」的定義;信賴度是條件機率 P(B|A),此選項把兩個指標的定義互換了。 - (B):P(B|A) 是「信賴度」的定義;支援度才是 A 與 B 同時出現的比例,與選項 (A) 同樣是定義對調的錯誤。 - (C):提升度的範圍是 [0, ∞),不是 [0,1];它是機率比值,大於 1 是常見情形,「固定在 0 到 1 之間」的敘述錯誤。 提示:Support 為同現比例、Confidence 為 P(B|A)、Lift 為相對獨立情形的放大倍率(= 1 表獨立);Lift 高還需 Support 足夠才有實務意義。

本題掛載於「相關 / 關聯」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 19 題觀念複習:相關 / 關聯

某電商平台某時段的交易紀錄共 8 筆訂單,各單購買產品如下:單號1:{A, B, E};單號2:{C, D};單號3:{B, D, E};單號4:{A, B, E};單號5:{B, C, E};單號6:{A, D};單號7:{A};單號8:{A, D}。對此資料執行 Apriori 演算法,設定最低支援度(出現次數)為 3。請問最終保留下來的最大頻繁項目集為何?

  1. A{A}
  2. B{A, D}
  3. C{A, B, E}
  4. D{B, E}
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 先計算單項出現次數:A 出現於單號 1、4、6、7、8 共 5 次;B 於 1、3、4、5 共 4 次;C 於 2、5 共 2 次;D 於 2、3、6、8 共 4 次;E 於 1、3、4、5 共 4 次。C 未達 3 次先遭淘汰,頻繁 1-項集為 {A}{B}{D}{E}。再組 2-項集並計數:{A,B}=2(單號1、4)、{A,D}=2(單號6、8)、{A,E}=2(單號1、4)、{B,D}=1(單號3)、{B,E}=4(單號1、3、4、5)、{D,E}=1(單號3)。只有 {B,E} 達到門檻 3;頻繁 2-項集僅剩一個,無法再組 3-項集,演算法終止,最大頻繁項目集即為 {B, E}。 【為何其他選項錯了?】 - (A):{A} 支援度 5 確實頻繁,但它只是 1-項集;既然存在頻繁的 2-項集 {B,E},最大頻繁項目集就不會是 {A}。 - (B):{A, D} 僅同時出現於單號 6、8,支援度 2,未達門檻 3,於 2-項集階段即被淘汰。 - (C):{A, B, E} 僅出現於單號 1、4,支援度 2;且其子集 {A,B} 與 {A,E} 皆不頻繁,依 Apriori 性質根本不會成為候選。 提示:Apriori 反單調性:頻繁項目集的所有子集必為頻繁;逐層淘汰後,保留下來的最長項目集即為最大頻繁項目集。

本題掛載於「相關 / 關聯」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 20 題觀念複習:樣本不平衡

某電信公司的 AI 反詐欺模型在正常交易佔 99.5%、詐欺交易僅佔 0.5%的類別嚴重不平衡資料集上訓練。若工程師僅以整體準確率(Accuracy)作為模型選擇的唯一指標,最可能產生什麼嚴重問題?

  1. A模型訓練時間會因類別不平衡而大幅增加
  2. B一個永遠預測為正常交易的模型即可達到 99.5%準確率,但對詐欺交易的召回率為0%,使準確率失去判別能力
  3. C類別不平衡會導致模型訓練過程出現梯度爆炸
  4. D類別不平衡會直接導致模型過擬合,使測試集表現下降
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 當正常交易占 99.5% 時,一個永遠預測「正常」的模型準確率就有 99.5%,但它對詐欺的召回率是 0%,一筆詐欺都無法攔截。Accuracy 在極度不平衡資料上會被多數類推高,失去鑑別模型好壞的能力;應改看少數類的 Recall、Precision、F1、PR-AUC 等指標。這是反詐欺、罕病篩檢等場景評估設計的基本原則。 【為何其他選項錯了?】 - (A):訓練時間主要取決於資料量與模型複雜度,類別比例本身不會使訓練時間大幅增加。 - (C):梯度爆炸是深度網路中梯度連乘放大的數值問題,成因在網路結構、初始化與學習率,與類別不平衡沒有因果關係。 - (D):不平衡本身不必然導致過擬合;它造成的是模型偏向多數類、少數類學習不足,而過擬合指訓練集與測試集表現落差,兩者是不同的問題。 提示:不平衡資料不可只看 Accuracy;檢視混淆矩陣、Recall 與 PR-AUC,才能確認少數類是否被正確偵測。

本題掛載於「樣本不平衡」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 21 題觀念複習:3. 資料管線

某AI平台的資料工程師需要在 Apache Spark 叢集上,對包含 10億筆使用者行為紀錄的RDD/DataFrame 計算整體標準差(Standard Deviation)。請問下列哪種策略在分散式環境中最正確且有效率?

  1. A呼叫 collect()將所有資料傳回 Driver 節點的本機記憶體後,再使用 Python 的statistics.stdev()計算
  2. B先對資料進行全域排序(sortBy),再取中間值計算變異數
  3. C將資料輸出為 CSV,再以Excel 的STDEV函數計算
  4. D使用 DataFrame.agg({'col': 'stddev'})或 RDD.aggregate()等分散式統計方法,由各Executor計算局部統計量後再進行彙總
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 分散式計算的基本原則是「把運算送往資料所在的節點,而不是把資料集中回單一機器」。DataFrame.agg({'col':'stddev'}) 或 RDD.aggregate() 會讓各 Executor 先在本地計算局部統計量(筆數、總和、平方和),再由 Spark 彙總為全域標準差;網路只需傳遞少量中間值,10 億筆資料也能有效處理,這是 Map 端聚合再 Reduce 彙總的標準模式,故 (D) 正確。 【為何其他選項錯了?】 - (A):collect() 會把 10 億筆資料全部拉回 Driver 節點的記憶體,幾乎必然造成記憶體不足(OOM);若資料能以單機處理,一開始就不需要 Spark 叢集。 - (B):標準差的計算與排序、中位數無關;全域排序(sortBy)是分散式環境中最昂貴的 shuffle 操作之一,徒增成本而對目標毫無幫助。 - (C):Excel 單一工作表僅約 104 萬列,遠不足以容納 10 億筆資料;此作法也完全放棄了分散式運算能力。 提示:Spark 聚合統計的正確模式是各節點計算局部量再彙總;看到 collect() 全量回收資料即應警覺記憶體風險。

本題掛載於「3. 資料管線」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 22 題觀念複習:資料切分

某連鎖便利商店集團欲建立門市未來 14 天每日銷售額預測模型(500 間門市、3 年歷史資料)。資料具有明顯的週期性(週末較高)、年度季節性(暑假與年末高峰)及長期成長趨勢,並包含已知節日與不定期事件(如颱風)。在此情境下,關於資料切分與建模策略,何者最適當?

  1. A採隨機切分(80/20),使用傳統時間序列模型建模,刪除節日資料避免極端值影響,並以均方根誤差(RMSE)評估
  2. B依時間順序切分(最後 90天為測試集),使用具季節性建模能力的時間序列模型並加入節日資訊,不處理不定期事件,以平均絕對百分比誤差(MAPE)評估
  3. C依時間順序切分並採前進式驗證(Walk-Forward Validation),結合時間序列分解與機器學習模型,加入時間特徵、滯後與滾動統計特徵,並納入節日與不定期事件資訊,使用均方根誤差(RMSE)與平均絕對百分比誤差(MAPE)評估
  4. D依時間順序切分,直接使用深度學習模型建模,不進行特徵工程,所有門市共用模型,以平均絕對誤差(MAE)評估
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 時間序列預測的驗證必須尊重時間先後:依時間切分並採前進式驗證(Walk-Forward Validation),每輪皆以過去資料訓練、對其後區間驗證,模擬真實上線情形。特徵面結合時間序列分解與機器學習模型,加入星期、月份等時間特徵,以及滯後(Lag)與滾動統計特徵,並納入已知節日與颱風等不定期事件資訊,才能同時捕捉週期性、季節性、長期趨勢與突發效應。評估同時採用 RMSE(對大誤差較敏感)與 MAPE(跨門市可比較的相對誤差),(C) 是涵蓋最完整的方案。 【為何其他選項錯了?】 - (A):隨機切分會使未來資料混入訓練集,造成時間洩漏,違反時間序列建模的基本原則;刪除節日資料更會捨棄營收高峰這類關鍵樣態。 - (B):切分方式與季節性建模正確,但明確不處理颱風等不定期事件,遇突發事件時預測誤差將顯著擴大,方案不完整。 - (D):不進行特徵工程且 500 間門市共用單一深度模型,忽略門市間的異質性;深度學習仍需適當的特徵與事件資訊,否則難以達到可用精度。 提示:時間序列建模三原則:依時間切分、前進式驗證、納入滯後與事件特徵;隨機切分等同於使用未來資訊。

本題掛載於「資料切分」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 23 題觀念複習:模型評估

Receiver Operating Characteristic(ROC)曲線係由單一分類模型在不同決策閾值下形成,並以真陽率(True Positive Rate, TPR)為縱軸、假陽率(False Positive Rate, FPR)為橫軸。圖中有四條由 (0,0) 附近延伸至 (1,1) 的線:水平線A——沿著 TPR=1 的高度自左上角水平延伸到右上角 (1,1);曲線B——自原點快速上升後趨緩、整體凸向左上角的圓弧(典型良好分類器形狀);曲線C——自原點上升後中段「先下降再回升」,TPR 隨 FPR 增加出現波浪狀起伏,最後到達 (1,1);斜直線D——自 (0,0) 到 (1,1) 的 45 度對角線。請問四條線中,何者最不可能是 ROC 曲線?

  1. A水平線A
  2. B曲線B
  3. C曲線C
  4. D斜直線D
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 ROC 曲線是將決策閾值由高至低掃描繪出的軌跡:閾值每降低一級,被判為陽性的樣本數只會增加或持平,因此 TPR 與 FPR 皆單調不減,曲線只能向右上方延伸,不可能回頭下降。曲線C中段出現 TPR 隨 FPR 增加而下降的波浪狀起伏,違反此數學性質,因此最不可能是 ROC 曲線。 【為何其他選項錯了?】 - (A):沿 TPR=1 延伸的水平線是近乎完美分類器的 ROC:先將所有正例全數辨識(TPR=1),其後閾值再降僅使 FPR 增加,曲線沿頂端水平前進,AUC 趨近 1,屬合法形狀,故非答案。 - (B):凸向左上角的圓弧是典型良好分類器的 ROC,AUC 介於 0.5 與 1 之間,為教科書標準形狀。 - (D):45 度對角線是隨機猜測的 ROC,AUC = 0.5;它代表模型無鑑別力,但屬合法且常作為基準線的 ROC。 提示:ROC 曲線必為單調不減;對角線代表隨機,貼近左上角代表優秀,出現回頭下降的曲線必非 ROC。

本題掛載於「模型評估」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 24 題觀念複習:相關 / 關聯

某AI工程師評估客戶滿意度評分(1–5分,含有明顯離群值)與退款率(連續型比例變數)之間的相關性,考慮使用皮爾森(Pearson)、斯皮爾曼(Spearman)或肯德爾(Kendall)相關係數。關於三者的特性比較,下列敘述何者不正確?

  1. A皮爾森衡量兩個連續變數間的線性關係強度;斯皮爾曼與肯德爾基於排名(Rank)計算,對非線性單調關係也適用
  2. B斯皮爾曼相關係數的計算公式等價於皮爾森,只是將原始數值替換為其排名後代入計算
  3. C與肯德爾相比,斯皮爾曼對離群值的穩健度更強
  4. D三者的數值範圍(相關係數區間)皆相同,均在[-1, 1]之間
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 本題選「不正確」的敘述。一般認定與選項 (C) 恰好相反:肯德爾(Kendall's tau)比斯皮爾曼(Spearman's rho)更穩健。Kendall 只計算配對之間的一致與不一致(concordant/discordant pairs),單一離群值只影響它所參與配對的方向;Spearman 雖然也使用排名,但公式含有「排名差的平方」,極端值造成的大排名差會被平方放大,對離群值與誤差相對敏感。因此「斯皮爾曼比肯德爾更穩健」是不正確的敘述,即為本題答案。 【為何其他選項錯了?】 - (A):此敘述正確:Pearson 衡量線性關係;Spearman 與 Kendall 基於排名,凡單調關係(不必線性)皆能捕捉,對含離群值的滿意度評分較合適,故不是本題要選的錯誤敘述。 - (B):此敘述正確:Spearman 的定義就是「將原始數值換成排名後計算 Pearson 相關係數」,兩者公式等價。 - (D):此敘述正確:三者的取值範圍皆為 [-1, 1],正負代表方向、絕對值代表強度。 提示:離群值多時採用排名相關;穩健度排序為 Kendall ≥ Spearman > Pearson;Spearman 等於排名版的 Pearson。

本題掛載於「相關 / 關聯」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 25 題觀念複習:樣本不平衡

某金融機構導入 AI模型進行信用卡詐欺偵測,由於詐欺交易極為稀少(約佔全部交易0.3%),因此模型在測試階段得到 99.6%準確率(Accuracy),被初步認定為「高效模型」。然而在實際上線後,風控部門發現模型幾乎無法攔截詐欺交易,且大量誤判正常交易。經進一步檢查,發現資料極度不平衡,但模型仍以 Accuracy 作為主要優化與評估指標。在此情境下,下列何者最適當的改善方向?

  1. A持續優化 Accuracy 指標以提升整體分類正確率
  2. B改用精確率(Precision)作為主要評估指標以降低誤報
  3. C引入Class Weight 或Cost-sensitive Learning 調整損失函數
  4. D移除少數類資料以提升模型穩定性與收斂速度
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 問題根源是:0.3% 的極度不平衡下,訓練與評估都以 Accuracy 為準,使「全判正常」被視為好成績。治本方向是讓訓練目標本身重視少數類:引入 Class Weight 或成本敏感學習(Cost-sensitive Learning),在損失函數中調高「漏判詐欺」的代價,迫使模型確實學習少數類的模式;再搭配 Recall、F1、PR-AUC 等指標評估。這是從優化目標著手的正規改善方向。 【為何其他選項錯了?】 - (A):Accuracy 在此場景已證明無法反映攔截能力,繼續以它為優化目標,只會持續獎勵全判正常的模型行為。 - (B):只追求 Precision 會使模型僅在極有把握時才判定詐欺,誤報減少但漏判增加;風控場景漏抓詐欺的代價通常遠高於誤報,方向不正確。 - (D):詐欺樣本僅佔 0.3%,移除少數類資料等於刪除偵測目標本身,模型將完全失去辨識詐欺的能力,是最不可行的作法。 提示:不平衡改善三路線:調整權重或成本敏感學習、重抽樣、改用合適指標;少數類樣本不可刪除。

本題掛載於「樣本不平衡」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 26 題觀念複習:特徵工程

某電商推薦系統的資料工程師在建構模型特徵時,將使用者的訂單 UNIX時間戳記(連續數值)轉換為「早晨(6–12時)、下午(12–18時)、夜晚(18–6時)」三個區間類別,以讓推薦模型更容易學習消費時段規律。在資料前處理中,這種將連續數值轉換為有序類別的操作最精確的名稱為何?

  1. A特徵離散化(Feature Discretization)
  2. B特徵縮放(Feature Scaling)
  3. C數據降維(Dimensionality Reduction)
  4. DOne-Hot 編碼(One-Hot Encoding)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 將連續數值(UNIX 時間戳記)依區間切分為「早晨、下午、夜晚」等有限個有序類別,正是特徵離散化(Feature Discretization),常見實作亦稱分箱(Binning)。離散化能把連續變數中的非線性規律(如消費時段效應)轉為模型容易學習的類別訊號,並提升對雜訊與極端值的穩健性,是資料前處理的常見手法,故 (A) 為最精確的名稱。 【為何其他選項錯了?】 - (B):特徵縮放(如標準化、Min-Max)只改變數值的尺度與範圍,結果仍是連續數值,並未轉換為類別。 - (C):降維是減少特徵欄位數(如 PCA 將 100 維壓縮至 10 維);本操作是單一欄位內的值域轉換,欄位數不變,概念不同。 - (D):One-Hot 編碼是將「已經是類別」的欄位展開為 0/1 向量,屬離散化之後可能接續的步驟;題目問的是連續值轉為區間類別的動作本身,名稱應為離散化。 提示:連續轉類別=離散化(分箱);類別轉 0/1 向量=One-Hot;改尺度不改型態=縮放。流程上常是先離散化再編碼。

本題掛載於「特徵工程」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 27 題觀念複習:視覺化

某AI產品的商業分析師在準備月度報告時,需要在單一頁面上同時呈現 1,000 位使用者的留存率、活躍程度與付費轉換率三項指標,以讓決策層快速掌握整體趨勢。若依據Edward Tufte 的資料視覺化原則中資料密度(Data Density)的概念,下列何者最符合此原則的設計方向?

  1. A將1,000 筆資料分散至多張圖表(每張顯示約 100 筆),避免單一圖表資訊過載
  2. B移除所有圖例、軸標籤與輔助線等非資料墨水(Non-data Ink),使版面最簡潔
  3. C在圖表中加入大量裝飾性元素(如色塊、陰影、3D 效果),使視覺效果更豐富
  4. D在有限頁面空間中呈現盡可能多的有效資料資訊,同時維持可讀性與清楚的視覺層次
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 Tufte 的資料密度(Data Density)指圖表面積內承載的有效資料量,他主張在維持可讀性的前提下盡量提高單位面積的資訊量,讓讀者快速掌握大量事實;搭配高資料墨水比(Data-ink Ratio)與去除圖表垃圾(Chartjunk),構成其精簡高效的視覺化原則。要在單一頁面同時呈現 1,000 位使用者的三項指標供決策層速讀,正應提高資料密度並維持清楚的視覺層次,選項 (D) 完全對應。 【為何其他選項錯了?】 - (A):把資料拆成多張各 100 筆的圖表,單位面積資訊量反而下降,決策層必須翻頁自行整合,與提高資料密度的方向相反。 - (B):Tufte 主張刪除的是「非資料墨水」中無意義的部分;圖例與軸標籤是理解資料必需的資訊載體,全部移除會使圖表無法判讀,精簡不等於移除必要標註。 - (C):色塊、陰影、3D 效果正是 Tufte 批判的 Chartjunk,裝飾越多、資料墨水比越低,與資料密度原則完全相反。 提示:Tufte 三原則:高資料密度、高資料墨水比、去除圖表垃圾;版面應保留給資料本身而非裝飾。

本題掛載於「視覺化」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 28 題觀念複習:視覺化

行銷團隊比較三種廣告投放管道(A/B/C)的轉換率差異,原始數據如下,A:3.2%、B:3.8%、C:4.0%。若設計圖表時將 y 軸刻意截斷(不從 0 開始),造成視覺差異放大。此做法最可能產生的問題為何?

  1. A提升資料解析效率並減少認知負擔
  2. B增強小幅差異的可視化辨識能力
  3. C造成視覺誤導並放大實際差異感
  4. D提升圖表計算準確性與數據正確性
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 三個管道的轉換率僅相差 0.8 個百分點(3.2%、3.8%、4.0%),若 y 軸不從 0 開始、只顯示 3% 至 4.1% 的區間,長條的視覺高度差會被放大數倍,讀者容易誤以為管道間成效差距懸殊。這是典型的截斷 y 軸(Truncated Axis)視覺誤導:數值本身沒有造假,但視覺比例失真,屬於圖形誠信(Graphical Integrity)問題,Tufte 以謊言因子(Lie Factor)偏高描述此類圖表。 【為何其他選項錯了?】 - (A):截斷 y 軸並未提升資料解析效率或降低認知負擔,反而使讀者對差異幅度形成錯誤印象,增加誤判風險。 - (B):在特定分析場景中放大顯示差異或有其用途,但前提是明確標示斷軸;題幹描述的是「刻意截斷造成視覺差異放大」,核心影響是誤導而非輔助辨識,不能視為正面效果。 - (D):圖表的繪製方式不會改變數據計算的正確性;截斷軸影響的是視覺觀感,與計算準確性無關,此選項答非所問。 提示:長條圖比較量值時 y 軸原則上從 0 開始;非零起點必須明確標示斷軸,否則即構成視覺誤導。

本題掛載於「視覺化」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 29 題觀念複習:視覺化

某 AI 系統的維運工程師需要在儀表板上呈現「模型推論延遲(ms)隨時間的變化趨勢」,以便即時監控 服務水準協議(Service Level Agreement, SLA)是否達標(P99<200 ms)。在資料視覺化的圖表類型選擇上,下列哪種圖表最適合呈現連續數值隨時間變化的趨勢?

  1. A面積圖(Area Chart)
  2. B散佈圖(Scatter Plot)
  3. C長條圖(Bar Chart)
  4. D折線圖(Line Plot)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 「連續數值隨時間變化的趨勢」正是折線圖的典型用途:x 軸放時間、y 軸放延遲毫秒數,點與點之間以線相連,上升、下降、震盪與尖峰皆可直接判讀;監控儀表板還能疊加 P99 與 200ms 的 SLA 水平參考線,超標時一眼可見。時間序列趨勢監控以折線圖為首選,是視覺化圖表選擇的基本原則。 【為何其他選項錯了?】 - (A):面積圖本質是折線圖下方填色,適合強調量體大小或堆疊組成;對延遲指標而言,填色未增加資訊,多序列(如 P50/P95/P99)堆疊時還會互相遮擋。 - (B):散佈圖用於觀察兩個變數之間的關係(如延遲與請求量),點與點不相連,趨勢的連續性與時間順序不易判讀。 - (C):長條圖適合離散類別間的量值比較;用於每分鐘延遲會形成大量緊密相鄰的柱狀,趨勢反而難以辨識。 提示:看趨勢用折線、比類別用長條、看關係用散佈、看組成用面積或堆疊;先確認資料要回答的問題再選圖表。

本題掛載於「視覺化」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 30 題觀念複習:模型訓練與調參

訓練資料共 5,000萬筆,工程師比較 Batch Size=32 與 Batch Size = 4096 的訓練表現,發現大批次(Large Batch)雖然訓練較快,但模型泛化能力較差。從最佳化理論角度,下列何者為此現象最合理的解釋?

  1. A大批次(Large Batch)計算量過大,GPU無法有效處理
  2. B大批次(Large Batch)梯度估計更穩定,但容易收斂至局部極小值(Local Minima),導致泛化能力較差
  3. C小批次(Small Batch)因隨機性高,更容易發生梯度爆炸(Gradient Explosion)
  4. D批次大小(Batch Size)與泛化能力無關,問題出在學習率(Learning Rate)設定
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 大批次的梯度是對更多樣本平均的結果,估計更穩定、雜訊更小;但最佳化理論與實證研究(如 Keskar 等人的研究)指出,低雜訊的更新使模型容易收斂至尖銳極小值(Sharp Minima)一類泛化較差的解;小批次的梯度雜訊則具有類似退火的作用,能使參數跳出狹窄的極小值區域,較常收斂至平坦極小值(Flat Minima),對未見資料的表現較穩健。這是「大批次訓練快但泛化較差」的主流理論解釋,(B) 的描述最為貼近。 【為何其他選項錯了?】 - (A):大批次正是為了充分利用 GPU 平行運算而設計,吞吐量通常更高;題幹亦說明大批次訓練較快,可見 GPU 處理並無困難,此敘述與題設矛盾。 - (C):梯度爆炸的主因是網路深度、初始化與學習率設定,並非批次較小;且題目問的是大批次泛化較差的原因,此選項答非所問。 - (D):批次大小影響梯度雜訊尺度與收斂解的平坦程度,與泛化能力關係密切;學習率固然須隨批次調整(如線性縮放法則),但宣稱兩者無關即否定了實驗觀察到的現象。 提示:大批次梯度穩定、易收斂至尖銳極小值、泛化較差;小批次雜訊較大、傾向平坦極小值、泛化較佳;放大批次時應同步調整學習率。

本題掛載於「模型訓練與調參」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 31 題觀念複習:MLOps

某公司中,A團隊負責信用評分模型,B 團隊負責詐欺偵測模型,兩團隊皆需要「使用者過去30天交易行為」資料,但各自會進行特徵工程與後續工作。以公司整體管理角度,下列何者為導入統一管理與共用特徵的主要目的?

  1. A模型推論延遲過高,導致線上服務回應時間不符合系統即時性需求與使用體驗要求
  2. B降低跨團隊重複開發的維護成本
  3. C訓練資料儲存空間不足,造成歷史資料保存與批次訓練流程效率下降問題
  4. D模型版本管理混亂,導致不同模型部署與回溯分析困難並增加維運複雜度
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 兩個團隊都需要「使用者過去 30 天交易行為」特徵,若各自擷取資料、各寫一套特徵工程,同一特徵會存在兩份程式碼與兩條管線,計算口徑可能不一致,且每次資料源變動都須修改兩處。導入統一管理與共用特徵(即特徵平台或 Feature Store 的概念),讓特徵一次開發、多團隊重用,主要目的正是降低跨團隊重複開發與維護成本,並附帶確保特徵口徑一致。題目問公司整體管理角度,重點即在成本與重工,故 (B) 正確。 【為何其他選項錯了?】 - (A):推論延遲屬模型服務與基礎設施的效能議題;線上特徵庫或許間接有助於延遲,但不是導入共用特徵的主要動機。 - (C):儲存空間不足屬容量規劃問題,應以擴充儲存或資料生命週期管理解決,與特徵共用的目的無關。 - (D):模型版本管理混亂應以模型註冊庫(Model Registry)與 MLOps 流程解決;特徵共用處理的是特徵層,不是模型版本問題。 提示:Feature Store 的核心價值:特徵一次定義、跨團隊重用、訓練與線上口徑一致,節省重複開發與維護成本。

本題掛載於「MLOps」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 32 題觀念複習:樣本不平衡

某銀行建置貸款違約預測模型,資料共 50,000 筆,其中違約樣本僅 800 筆(佔 1.6%)。在模型建置流程中,先對整體資料使用 SMOTE 對少數類進行過採樣,之後再進行訓練/測試切分,並訓練輕量梯度提升機(LightGBM)模型,並以 AUC-ROC 評估模型表現。模型在測試集的AUC-ROC 達到0.91,團隊認為模型表現良好,準備上線部署。在模型審查過程中,下列何者為使測試集評估結果失真的主要原因?

  1. ASMOTE 不適合用於金融違約預測場景,此類高風險業務應一律採用 class_weight 調整損失函數,而非對資料本身進行過採樣
  2. BSMOTE 的過採樣操作在訓練/測試切分之前即對全體資料執行,導致合成樣本資訊洩漏至測試集,使 AUC-ROC 0.91 虛高而不可信
  3. CAUC-ROC 在1.6%的不平衡場景下過度樂觀,應改用 PR-AUC 作為評估指標,其餘流程均正確
  4. DLightGBM 本身已內建處理不平衡的機制,與 SMOTE 同時使用會造成少數類過度補償,導致過多誤判
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 關鍵錯誤在流程順序:SMOTE 在「切分之前」對全體資料執行。SMOTE 以少數類樣本間的內插生成合成樣本,先過採樣再切分,會使由同一筆原始樣本合成出來的鄰近點分別落入訓練集與測試集;測試集中因此存在與訓練樣本高度相似的合成點,評估等同於用近乎已見過的資料計分,AUC-ROC 0.91 因而虛高失真。正確做法是先切分,SMOTE 只對訓練集(或交叉驗證中的訓練折)執行,測試集始終保持原始分布。 【為何其他選項錯了?】 - (A):SMOTE 用於金融違約並非禁忌,class_weight 也只是另一種可行手段;「一律採用」的說法過於絕對,且未指出本題真正的洩漏問題。 - (C):1.6% 不平衡下 PR-AUC 確實比 AUC-ROC 更能反映少數類表現,這是合理建議;但「其餘流程均正確」的說法忽略了切分前執行 SMOTE 的洩漏錯誤。 - (D):LightGBM 的不平衡處理參數與 SMOTE 並用是否過度補償,屬於可調校的超參數議題,不是評估結果失真的原因;失真根源在資訊洩漏。 提示:重抽樣(SMOTE、過採樣、欠採樣)一律在切分之後、只作用於訓練集;測試集必須維持真實分布。

本題掛載於「樣本不平衡」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 33 題觀念複習:邏輯斯回歸

某線上書店希望建立一個多類別書籍推薦模型,根據讀者的「年齡、性別、過去購書類別偏好評分」等特徵,預測讀者下次最可能購買的書籍主題(共 8類)。資料已完整標註,且資料量達數十萬筆。在模型選型上,除了預測準確率外,也需考量模型訓練效率、可擴充性,並需支援快速訓練與線上部署。請問下列哪種方法最適合此情境?

  1. A多類別羅吉斯迴歸(Multinomial Logistic Regression)
  2. B支援向量機(SVM)搭配One-vs-One
  3. CK-means 分群後將群集標籤作為分類結果
  4. D主成分分析(PCA)後再以最大主成分作為分類依據
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 本題是「多類別分類+數十萬筆資料+要求訓練快、可擴充、易部署」的組合。多類別羅吉斯迴歸(Multinomial Logistic Regression,即 Softmax 迴歸)原生支援多類別,以單一模型輸出 8 類機率;訓練屬凸優化,可用 SGD 等方法擴展到大規模資料;模型輕巧,推論僅需一次矩陣運算,線上部署負擔極低,完全符合題目的所有需求。 【為何其他選項錯了?】 - (B):SVM 搭配 One-vs-One 需訓練 C(8,2)=28 個分類器,核方法在數十萬筆資料上訓練成本高,預測時還需多模型投票,訓練效率與部署便利性皆不利。 - (C):K-means 是非監督分群,群集標籤與「書籍主題」類別沒有對應保證;已有完整標註仍改用分群,等於放棄監督訊號,方法選擇錯誤。 - (D):PCA 是降維工具而非分類器,「以最大主成分作為分類依據」缺乏監督訊號,無法對應 8 個主題類別,方法論不成立。 提示:大量標註資料的多類別問題,先考慮 Softmax 迴歸這類線性基準:快、穩、易部署;有標籤時不以非監督方法替代分類器。

本題掛載於「邏輯斯回歸」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 34 題觀念複習:邏輯斯回歸

某電商平台希望建立二元分類模型,根據商品的「價格區間、品牌、顏色、材質」等特徵,將商品分類為「高銷量(1)」或「低銷量(0)」。同時希望模型輸出具備可解釋的機率(如P=0.73 表示73%機率為高銷量)。請問下列哪種方法最適合?

  1. AK-means 分群(K-means Clustering)
  2. B決策樹迴歸(Decision Tree Regression)
  3. C羅吉斯迴歸(Logistic Regression)
  4. D線性迴歸(Linear Regression)
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 需求有兩個:二元分類(高銷量/低銷量)與可解釋的機率輸出。羅吉斯迴歸把特徵的線性組合經 Sigmoid 函數映射到 (0,1),輸出天然就是 P(y=1) 的機率估計(如 P=0.73);係數並可解讀為對數勝算(Log-odds)的影響方向與大小,兩項需求同時滿足,是最標準的選擇。 【為何其他選項錯了?】 - (A):K-means 是非監督分群,不使用「高/低銷量」標籤,分群結果與銷量類別沒有保證對應,也不輸出類別機率。 - (B):決策樹迴歸預測的是連續數值,不是二元類別;即使改用分類樹,單棵樹以葉節點比例估計的機率通常粗糙且不平滑,機率品質不如羅吉斯迴歸。 - (D):線性迴歸輸出無界的連續值,可能產生大於 1 或小於 0 的結果,無法解讀為機率;直接套用於 0/1 目標也違反其誤差假設。 提示:「類別+可解釋機率」對應羅吉斯迴歸(Sigmoid 輸出 0 到 1);線性迴歸輸出連續值,不是機率。

本題掛載於「邏輯斯回歸」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 35 題觀念複習:Transformer

某工程師在開發一個以 Transformer為基礎的文本分類模型時,發現模型對於詞語順序的變化不夠敏感,影響語意判斷效果。請問在 Transformer 架構中,位置編碼(Positional Encoding)的主要作用為何?

  1. A在詞嵌入(Embedding)中加入隨機擾動,以提升模型對輸入變化的泛化能力
  2. B在注意力機制中加入遮罩(Mask),限制模型只能關注部分詞語
  3. C將輸入序列轉換為可同時運算的向量表示,以提升計算效率
  4. D在詞的向量表示中加入位置資訊,使模型能區分序列中不同位置的詞語
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 自注意力機制對輸入順序具有排列不變性:將句中詞語打亂,注意力計算出的關聯集合不變,模型本身無法區分詞序差異。位置編碼(Positional Encoding)將每個位置的資訊(以正弦、餘弦函數或可學習向量表示)加入對應詞的嵌入向量,使模型能區分同一詞語出現在不同位置的差異,恢復對詞序的感知能力,正是題幹「對詞語順序不敏感」問題的對應解方。 【為何其他選項錯了?】 - (A):在嵌入中加入隨機擾動屬於資料增強或正則化手法;位置編碼是確定性的位置訊號,並非雜訊,目的也不是提升泛化能力。 - (B):注意力遮罩(Mask)的功能是遮蔽不應關注的位置,例如解碼時的未來詞或 Padding,與編碼位置資訊是兩個不同機制。 - (C):將序列轉為可平行運算的向量表示是嵌入層與自注意力架構本身的特性;位置編碼的目的不是計算效率,而是補回平行化所犧牲的順序資訊。 提示:自注意力天生不含順序資訊,位置編碼負責注入位置訊號;遮罩管的是「哪些位置不可看」,兩者勿混淆。

本題掛載於「Transformer」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 36 題觀念複習:AI Agent

某AI系統架構師正在為一個電子商務資料湖(Data Lake)設計系統。該資料湖儲存數百億筆使用者點擊紀錄,並作為企業主要的分析資料來源。系統需讓非技術背景的行銷人員能以自然語言查詢數據洞察(如:上個月台北市購買 3C 產品的女性轉換率為何?),同時滿足高精確性、可擴展性,支援資料庫層級的權限控管與查詢審計,並確保查詢結果可由資料庫引擎精確執行。在此情境下,下列何者為最適合的系統架構?

  1. A協同過濾(Collaborative Filtering):根據歷史查詢推薦相似問題的答案,無法執行新問題的即時計算
  2. B檢索增強生成(RAG):讓LLM 檢索相關資料後生成回答,但無法可靠執行大規模數值聚合與精確統計查詢
  3. C生成對抗網路(GAN):用於生成合成資料或模擬數據分佈,可用於資料擴增,但不適合即時查詢與資料庫聚合運算
  4. DText-to-SQL Agent:由 LLM 將自然語言轉換為 SQL 查詢,交由分散式資料庫執行,兼顧自然語言彈性與資料查詢精確性
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 需求可拆解為:自然語言介面供非技術行銷人員使用、數百億筆資料的精確聚合運算、資料庫層級的權限控管與查詢審計、查詢結果須由資料庫引擎精確執行。Text-to-SQL Agent 讓 LLM 只負責把自然語言轉換為 SQL,實際計算交由分散式資料庫引擎執行:數值精確性由資料庫保證,規模擴展沿用資料庫架構,權限與審計沿用資料庫既有機制。LLM 的語言彈性與資料庫的精確執行各司其職,完全符合情境。 【為何其他選項錯了?】 - (A):協同過濾是推薦系統技術,只能依歷史查詢推薦相似問題的答案,無法對新問題執行即時計算,更無法產出轉換率等精確統計值。 - (B):RAG 檢索文件片段後由 LLM 生成回答,對數百億筆資料的數值聚合無法保證精確,生成的統計數字也不具資料庫層級的權限控管與可稽核性。 - (C):GAN 用於生成合成資料與模擬資料分佈,屬資料擴增工具,與自然語言查詢及資料庫聚合運算的需求無關。 提示:「自然語言提問、數字必須精確、需權限與審計」的組合指向 Text-to-SQL:LLM 負責翻譯,資料庫負責計算。

本題掛載於「AI Agent」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 37 題觀念複習:隱私保護技術

某金融機構將訓練好的信用評分模型開放 API 供合作夥伴查詢。資安團隊警告此設計可能遭受成員推斷攻擊(Membership Inference Attack)。下列何者最準確說明攻擊原理與對應防禦?

  1. A利用模型對訓練樣本的高信心輸出判斷其是否屬於訓練集;以差分隱私或降低輸出信心防禦
  2. B利用查詢次數與回應頻率差異判斷資料是否在訓練集中;以限制查詢次數防禦
  3. C透過模型輸出推測輸入的敏感特徵;以限制輸出資訊防禦
  4. D透過大量查詢建立替代模型模擬目標模型;以限制模型存取防禦
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 成員推斷攻擊(Membership Inference Attack, MIA)利用模型對「訓練時見過的樣本」往往輸出異常高信心的現象(過擬合的痕跡):攻擊者以某筆資料查詢 API,觀察輸出信心分佈,推斷該筆資料是否屬於訓練集。在金融、醫療場景,「某人存在於該資料集」本身就是敏感資訊。對應防禦包括:訓練時採用差分隱私(如 DP-SGD)以雜訊掩蓋單一樣本的影響,或於部署時降低輸出資訊量(僅回傳標籤、截斷信心分數)。(A) 對攻擊原理與防禦的描述皆正確。 【為何其他選項錯了?】 - (B):查詢次數與回應頻率和樣本是否屬於訓練集無關;限制查詢次數是防濫用的通用手段,無法防止單次查詢即可觀察信心分佈的 MIA。 - (C):由模型輸出推測輸入的敏感特徵屬於屬性推斷或模型反演攻擊(Model Inversion),攻擊對象是特徵值,不是訓練集成員資格。 - (D):以大量查詢建立替代模型屬於模型萃取攻擊(Model Extraction),竊取的是模型功能本身,不是訓練資料的成員資訊。 提示:MIA 的特徵是利用模型對訓練樣本的過高信心;防禦組合為差分隱私訓練加上限制輸出資訊量。

本題掛載於「隱私保護技術」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 38 題觀念複習:差分隱私

某 AI 平台的資料治理工程師正在評估三種去識別化技術的適用場景與強度:K 匿名(K-anonymity)、差分隱私合成資料(Differential Privacy Synthetic Data)、亂數回應機制(Randomized Response)。下列敘述何者不正確?

  1. AK匿名主要應用於表格型資料,確保每筆記錄在準識別符(Quasi-identifier)組合上至少與K-1 筆其他記錄相同,防止個體被唯一識別
  2. B差分隱私合成資料是在發布統計查詢結果或訓練模型時直接對原始資料加入雜訊,以確保單一個體的加入或移除不會顯著改變輸出
  3. C亂數回應機制讓受訪者以機率性方式回答敏感問題(如:您是否曾逃稅?),賦予個人對答案的可否認性(Plausible Deniability)
  4. D三種技術中,只有差分隱私提供可組合且可量化的隱私保證,而 K 匿名與亂數回應在面對背景知識攻擊或多次查詢時保護能力有限
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 本題要挑出「不正確」的敘述。(B) 把兩種機制混為一談:「發布統計查詢結果或訓練模型時直接對原始資料或輸出加入校準雜訊」是傳統差分隱私機制(如 Laplace 機制、高斯機制、DP-SGD)的描述;而「差分隱私合成資料」是另一種作法:先以滿足差分隱私的方式訓練生成模型(雜訊加在生成模型的學習過程),再由該模型產生整份可自由使用的合成資料集,對外發布的是合成資料本身,不是逐次查詢的加噪結果。(B) 的描述張冠李戴,故為本題答案。 【為何其他選項錯了?】 - (A):此敘述正確,故非本題答案。K 匿名確保每筆記錄在準識別符組合上至少與 K-1 筆其他記錄相同,是表格型資料防止唯一識別的經典手法。 - (C):此敘述正確,故非本題答案。亂數回應讓受訪者依機率決定誠實回答或隨機回答敏感問題,個人保有可否認性,統計上仍可估計母體比例。 - (D):此敘述正確,故非本題答案。差分隱私具備可組合性(隱私預算 ε 可累計)與可量化保證;K 匿名易受背景知識與同質性攻擊,亂數回應在多次重複詢問下保護力會被稀釋。 提示:差分隱私合成資料的雜訊加在生成模型的訓練過程,發布的是合成資料;直接對查詢輸出加噪是傳統 DP 機制,兩者不可混淆。

本題掛載於「差分隱私」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 39 題觀念複習:4. 資料清理

在建構自動化資料清洗管線時,工程師撰寫一個用於補齊缺失欄位的 Python 函式,程式碼如下: def process_record(record, tags=[]):  tags.append("checked")  record['tags'] = tags  return record row1 = process_record({"id": 1}) row2 = process_record({"id": 2}) 當此函式連續處理兩筆獨立的資料(row1 與 row2)後,請問第二筆資料 row2['tags'] 的內容會為何?

  1. A["checked", "tags"]
  2. B[]
  3. C["checked", "checked"]
  4. D拋出 KeyError 錯誤,因為字典中沒有 tags 鍵值
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 本題考 Python 的可變預設參數(Mutable Default Argument)特性:預設值 tags=[] 只在「函式定義時」建立一次,之後所有未傳入 tags 的呼叫都共用同一個 list 物件。第一次呼叫 append 後該 list 成為 ["checked"];第二次呼叫取得的仍是同一個 list,再 append 一次即成為 ["checked", "checked"],並被指派給 row2['tags'],故 (C) 正確。此外 row1['tags'] 指向同一物件,內容也會同步變成兩個元素;兩筆獨立資料因共用同一 list 而互相影響,在資料清洗管線中是典型的資料汙染來源。 【為何其他選項錯了?】 - (A):程式僅曾 append 字串 "checked",從未將字串 "tags" 加入 list,此內容不可能出現。 - (B):若預設值於每次呼叫時重新建立,結果會是 ["checked"] 而非空列表;實際上預設 list 只建立一次且持續被 append,更不可能為空。 - (D):record['tags'] = tags 是「指派」操作,鍵不存在時會直接新增鍵值對,不會拋出 KeyError;KeyError 只發生在「讀取」不存在的鍵時。 提示:Python 預設參數只在 def 時評估一次;可變預設值應寫成 tags=None,並於函式內以 if tags is None: tags = [] 初始化。

本題掛載於「4. 資料清理」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 40 題觀念複習:K-近鄰 (KNN)

以下為一段分類演算法的 pseudocode: 輸入:  - train_data:訓練資料集,每筆包含特徵和標籤  - test_point:要預測的資料點  - X:要考慮的最近鄰個數 輸出:  - 預測的分類標籤 演算法: 1. 初始化一個空列表 distances 2. 對於每個訓練資料中的樣本 sample:  a. 計算 sample 與 test_point 的距離 distance  b. 把 (distance, sample 的標籤) 加到 distances 中 3. 按照距離對 distances 升序排序 4. 取出前 X 個距離最小的項目,記錄它們的標籤 5. 統計這 X 個標籤中出現次數最多的那個標籤 6. 返回該標籤作為 test_point 的預測結果 請問此 pseudocode 最可能對應下列哪一種演算法?

  1. AK-近鄰(K-Nearest Neighbors, KNN)
  2. BK-means 分群(K-means Clustering)
  3. C支援向量機(Support Vector Machine, SVM)
  4. D隨機森林分類器(Random Forest Classifier)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 此 pseudocode 的流程完全對應 KNN:對測試點計算它與每一筆訓練樣本的距離,依距離升序排序後取最近的 X(即 K)個鄰居,再以多數決投票決定預測類別。KNN 屬於懶惰學習(Lazy Learning):沒有顯式的訓練階段,預測時才進行距離計算,pseudocode 中「不建立模型、直接計算距離加投票」的結構正是其典型寫法。 【為何其他選項錯了?】 - (B):K-means 是非監督式分群,流程為「初始化 K 個群心、指派樣本、更新群心、迭代至收斂」,不使用標籤也沒有投票機制,與本流程不符。 - (C):SVM 的訓練是求解最大間隔超平面,預測時計算樣本落在超平面哪一側,沒有「尋找最近鄰加多數決」的步驟。 - (D):隨機森林需先訓練多棵決策樹,預測時由各樹投票;雖有投票概念,但投票主體是樹而非鄰居,且此 pseudocode 中沒有任何建樹流程。 提示:看到「計算所有距離、取前 K 近、多數決」即為 KNN;K-means 是無標籤分群,KNN 是以鄰居投票的分類。

本題掛載於「K-近鄰 (KNN)」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 41 題觀念複習:缺失值處理

某共享乘車平台整理出司機每日營運資料檔 driver_daily_stats.csv,其中 daily_earnings 欄位為司機日總收入(美元)。資料分析師使用 Python 檢視該欄位的基本統計量,執行以下程式碼(Pandas 2 以上版本): import pandas as pd df = pd.read_csv('driver_daily_stats.csv') print(df['daily_earnings'].describe()[['mean', '50%', 'max']]) 輸出結果如下:mean:223.411306、50%:128.552462、max:4500.000000。若團隊進一步發現 daily_earnings 欄位約有 5% 的遺失值,且目前規劃先建立線性迴歸(Linear Regression)模型來預測未來收入。為盡可能保留該欄位原有分布特性,並降低因補值造成的偏差,請問下列哪一種處理方式最為合理?

  1. Adf['daily_earnings'].fillna(df['daily_earnings'].mean(), inplace=True)
  2. Bdf['daily_earnings'].fillna(df['daily_earnings'].median(), inplace=True)
  3. Cdf['daily_earnings'].fillna(df['daily_earnings'].max(), inplace=True)
  4. D直接刪除所有遺失資料,因數值型欄位不適合進行補值處理
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 先判讀統計量:平均數 223.4 遠大於中位數 128.6,最大值高達 4500,是典型的右偏分布,少數極高收入日把平均值明顯拉高。對右偏且含極端值的欄位,中位數是位置量數中最穩健的代表值:以中位數補值不受 4500 這類極端值影響,補入的數值落在資料的典型區間,對原有分布形狀的扭曲最小,符合題目「保留分布特性、降低補值偏差」的要求。 【為何其他選項錯了?】 - (A):平均數 223.4 已被右尾極端值拉高,高於半數以上司機的實際日收入;以其填補 5% 的缺失值,會系統性高估這些日子的收入,加深偏差。 - (C):以最大值 4500 填補,等於把所有缺失紀錄都設為極端高收入,會在分布右尾製造人為的集中點,嚴重扭曲分布並影響迴歸模型的估計。 - (D):缺失比例僅 5% 即整列刪除,會損失可觀樣本;若缺失非完全隨機,還會引入選擇偏差。且「數值型欄位不適合補值」的說法本身錯誤,數值欄位正是補值方法最成熟的類型。 提示:mean 遠大於 median 代表右偏;右偏加極端值的欄位,補值優先使用中位數,平均數在偏態資料中代表性不足。

本題掛載於「缺失值處理」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 42 題觀念複習:One-hot / Label

某共享乘車平台以司機每日營運資料建立線性迴歸(Linear Regression)模型預測司機未來收入,特徵包含 region(註冊營運區域,原始值為字串 A、B、C)。團隊在建模前將 region 轉換為整數 1、2、3,即採用標籤編碼(Label Encoding)。模型上線測試後發現,線性迴歸模型對於 C 區(編碼為 3)的預測收入出現明顯高估,顯示模型可能將編碼值誤解為具有線性大小關係。若主管要求不得修改原有的特徵編碼方式,必須維持 1、2、3 的整數表示,但希望從演算法層面降低此類誤解風險,則下列何者最適合作為替代模型?

  1. A羅吉斯迴歸(Logistic Regression)
  2. BRidge迴歸(Ridge Regression)
  3. C支援向量機(Support Vector Machine, SVM)搭配線性核函數
  4. D隨機森林(Random Forest)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 線性迴歸把 region 的 1、2、3 當成連續數值,等於強行假設各區效果沿編碼值等距線性變化,才造成 C 區被高估。隨機森林由決策樹組成,樹對數值特徵只做門檻切分(如 region ≤ 1.5、region ≤ 2.5),實際上是把 1、2、3 切成三個互不牽連的組別,各組各自估計,不假設任何線性大小關係;在不能更改編碼的前提下,從演算法面化解標籤編碼被當成大小關係的風險,樹系模型是最合適的選擇。 【為何其他選項錯了?】 - (A):羅吉斯迴歸是分類模型,輸出的是機率;預測「收入」這種連續值屬於工具誤用,且它對特徵同樣採線性假設。 - (B):Ridge 只是加了 L2 正則化的線性迴歸,係數受到收縮,但「region 每加 1、收入等距變動」的線性假設原封不動,C 區仍會被線性外推。 - (C):線性核 SVM(SVR)本質仍是線性模型,對 1、2、3 的解讀與線性迴歸相同,無法化解編碼被誤讀的問題。 提示:標籤編碼搭配線性模型會替類別引入距離假設;不能改編碼時改用樹模型,樹僅依門檻分組、不假設數值距離。

本題掛載於「One-hot / Label」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 43 題觀念複習:模型評估

某共享乘車平台安全部門發現,僅有極少數司機(約占總體 0.05%)會利用外掛程式竄改 GPS 回傳資料(gps_ping_rate),以騙取里程補貼。某新進資料科學家訓練了一個二元分類模型,並在報告中指出:「模型整體準確率(Accuracy)高達 99.95%,因此可直接上線攔截可疑帳號。」報告附上的分類報告(classification report)如下(數值為四捨五入後結果): 類別 0(正常):precision 1.00、recall 1.00、f1-score 1.00 類別 1(外掛):precision 1.00、recall 1.00、f1-score 1.00 accuracy:1.00 macro avg:precision 1.00、recall 1.00、f1-score 1.00 weighted avg:precision 1.00、recall 1.00、f1-score 1.00 然而,資深工程師檢視後認為,僅憑上述結果仍不足以支持模型直接上線。下列何者不是其提出質疑的合理理由?

  1. A在此類極度不平衡的資料中,即使模型永遠預測所有司機皆為正常,整體準確率仍可能高達99.95%
  2. B報告中未呈現召回率(Recall),因此模型可能無法有效辨識真正的外掛司機
  3. C異常偵測問題不可使用分類模型處理,僅能使用分群或離群值方法
  4. D對於少數類比例極低的問題,若僅觀察 Accuracy,可能忽略模型對異常樣本的實際偵測能力
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 本題要求挑出「不合理」的質疑。(C) 主張異常偵測不可使用分類模型、僅能使用分群或離群值方法,此絕對化敘述有誤:只要具備標註資料(本例已知哪些司機使用外掛),監督式二元分類正是處理異常偵測的正當且常用途徑,可搭配類別權重、重抽樣與合適的評估指標;非監督的分群或離群值方法通常是缺乏標籤時的替代方案。由於此理由本身不成立,它不是合理質疑,故為本題答案。 【為何其他選項錯了?】 - (A):在 0.05% 的極度不平衡下,即使模型將所有司機判為正常,Accuracy 仍可達 99.95%;單憑準確率無法證明模型具備偵測外掛的能力,屬合理質疑。 - (B):實務審查中,報告若僅強調 Accuracy 而未逐一檢視少數類的召回率(樣本極少時,四捨五入後的 1.00 可能掩蓋漏抓情形),即無法確認外掛司機的實際辨識率,要求補列 Recall 屬合理質疑。 - (D):與 (A) 相呼應,Accuracy 由多數類撐高,少數類全數誤判時數值幾乎不變,忽略異常樣本偵測能力的風險確實存在,屬合理質疑。 提示:具備標籤的異常偵測可採監督式分類;審視不平衡任務的模型,優先檢視少數類的 Recall 與 Precision,而非整體 Accuracy。

本題掛載於「模型評估」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 44 題觀念複習:模型評估

某共享乘車平台已訓練一個二元分類模型,偵測利用外掛程式竄改 GPS 資料騙取里程補貼的司機(正類=外掛司機,約占總體 0.05%)。營運長對此外掛偵測模型下達最終的商業決策目標:「對於作弊行為零容忍。即使誤凍結部分正常司機帳號,後續仍可交由人工覆核;但不能放過任何一個真正的外掛司機。」根據上述目標,團隊在調整模型輸出的決策機率門檻(Threshold,預設為 0.5)時,應採取下列何種策略最為合理?

  1. A選擇使模型對作弊者的召回率(Recall)最大化的門檻,通常代表應降低 Threshold
  2. B選擇使模型精確率(Precision)最大化的門檻,通常代表應提高 Threshold
  3. C固定使用 Threshold=0.5 作為預設值,因為調整門檻將破壞演算法原有的訓練平衡
  4. D選擇使模型特異度(Specificity)達到100%的門檻,以確保正常司機不會被誤判
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 將商業目標轉換為指標語言:「不能放過任何一個外掛司機」等於將漏網的偽陰性(False Negative)壓到最低,即最大化正類的召回率(Recall);「誤凍結正常司機可接受、後續交人工覆核」代表可容忍偽陽性(False Positive)增加、允許精確率下降。降低決策門檻(例如由 0.5 調至 0.2)會使模型更容易將樣本判為外掛,偵測範圍更廣、漏網更少,正是召回率優先策略的標準作法,故 (A) 正確。 【為何其他選項錯了?】 - (B):提高門檻是精確率優先策略,僅在把握極高時才判為正類,誤判減少但漏網增加,與「零容忍漏抓」的目標相反。 - (C):0.5 僅為預設值,門檻本應依商業成本結構調整;且調整門檻只影響機率轉換為標籤的切點,模型參數與訓練結果不受影響,「破壞訓練平衡」的說法不成立。 - (D):特異度 100% 代表完全不誤判正常司機,為此門檻必須設得極高,絕大多數外掛司機將被放行,與題幹目標完全相反。 提示:重視不漏抓則降低門檻以提升 Recall;重視不誤判則提高門檻以提升 Precision;決策門檻應依商業成本調整,而非固定於預設值。

本題掛載於「模型評估」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 45 題觀念複習:5. 探索分析

若分析師想找出「總貢獻營收最高的前 3 名客戶」,下列 Pandas 程式碼何者最為精確且高效?

  1. Adf.sort_values('Revenue', ascending=False).head(3)['CustomerID']
  2. Bdf.groupby('CustomerID')['Revenue'].max().head(3)
  3. Cdf.groupby('CustomerID')['Revenue'].sum().nlargest(3)
  4. Ddf.value_counts('CustomerID').head(3)
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 「總貢獻營收最高的前 3 名客戶」需要三個步驟:按客戶分組、將各客戶的所有訂單營收加總、取總額最大的前 3 名。df.groupby('CustomerID')['Revenue'].sum() 先計算每位客戶的營收總和,.nlargest(3) 直接回傳最大的三筆;nlargest 在「只取前 K 名」的情境下不必對全部客戶完整排序,效率優於先排序再取頭,語意也最精確。 【為何其他選項錯了?】 - (A):先按單筆 Revenue 排序再取前 3 列,取得的是「單筆金額最大的三筆訂單」對應的客戶;以多筆小額訂單累積出最高總額的客戶會被遺漏,且同一位客戶可能重複出現。 - (B):groupby 後取 max() 計算的是各客戶「單筆最大營收」,不是總貢獻;且 .head(3) 只是取分組結果的前三個(依索引順序),並未依金額排序。 - (D):value_counts('CustomerID') 統計的是每位客戶的訂單筆數,與金額無關;訂單筆數最多不等於營收貢獻最高。 提示:「總和最高前 K 名」的標準寫法:groupby(鍵)[數值].sum().nlargest(K);先分清楚要排序的是單筆、次數還是總額。

本題掛載於「5. 探索分析」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 46 題觀念複習:5. 探索分析

若分析師只想計算「Electronics(電子產品)」這個特定分類的平均營收,下列何者為最佳的語法?

  1. Adf[df['Category'] == 'Electronics']['Revenue'].mean()
  2. Bdf['Category' == 'Electronics']['Revenue'].mean()
  3. Cdf.loc['Electronics', 'Revenue'].mean()
  4. Ddf.filter(items=['Electronics'])['Revenue'].mean()
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 這是標準的布林遮罩(Boolean Masking)寫法:df['Category'] == 'Electronics' 先產生 True/False 序列,df[...] 以此篩出所有電子產品的資料列,再取 ['Revenue'] 欄位計算 .mean(),即得到該分類的平均營收。這是 Pandas 依「欄位值」進行條件篩選最正統的語法。 【為何其他選項錯了?】 - (B):df['Category' == 'Electronics'] 會先計算字串比較 'Category' == 'Electronics',結果為 False,等同於 df[False];Pandas 會嘗試尋找名為 False 的欄位而拋出 KeyError。引號位置不同,語意完全改變。 - (C):df.loc['Electronics', 'Revenue'] 是以「索引標籤」選取資料列,只有當 DataFrame 的索引本身就是 Category 時才成立;對預設整數索引的交易表會拋出 KeyError。 - (D):df.filter(items=['Electronics']) 過濾的是「欄位名稱」而非欄位內的值;資料表中沒有名為 Electronics 的欄位,只會得到空的 DataFrame,無法算出正確的平均營收。 提示:篩選「欄位值」用布林遮罩 df[df['欄']==值];filter 與 loc 依據的是欄位名稱與索引標籤,不能用來篩選內容。

本題掛載於「5. 探索分析」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 47 題觀念複習:ETL / ELT

資料分析師載入一份電商交易紀錄的 Pandas DataFrame df,欄位包含 OrderID(訂單編號)、CustomerID(客戶編號)、Category(商品分類)、Revenue(該筆營收);另有一份客戶資料表 customers,包含 CustomerID(客戶編號)與 Region(所在地區)欄位。分析師想將 customers 表中的 Region 欄位加入到 df 交易紀錄中,且「只保留那些在 customers 表中有對應資料的交易紀錄」。下列哪一種合併方式最正確?

  1. Apd.concat([df, customers], axis=1)
  2. Bpd.merge(df, customers, on='CustomerID', how='outer')
  3. Cpd.merge(df, customers, on='CustomerID', how='inner')
  4. Ddf.join(customers, on='CustomerID')
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 「把另一張表的欄位併入,且只保留兩邊都有對應鍵值的紀錄」正是內部合併(Inner Join)的定義:pd.merge(df, customers, on='CustomerID', how='inner') 以 CustomerID 為鍵進行配對,在 customers 中找不到對應客戶的交易列會被剔除,配對成功者則接上 Region 欄位,完全符合需求,故 (C) 正確。 【為何其他選項錯了?】 - (A):pd.concat(axis=1) 是「依索引位置」將兩張表左右拼接,不做任何鍵值配對;兩表列數與順序不同,拼接結果會出現客戶資料錯位對應的錯誤。 - (B):how='outer' 會保留兩邊「所有」紀錄:無對應客戶的交易仍保留(Region 補 NaN),沒有交易的客戶也會多出一列,與「只保留有對應者」的要求相反。 - (D):df.join(customers, on='CustomerID') 預設以 df 的 CustomerID 對應 customers 的「索引」,customers 未先 set_index('CustomerID') 會直接報錯;且 join 預設 how='left',仍會保留無對應的交易列,兩處都不符題意。 提示:merge 的 how 參數:inner 取交集、outer 取聯集、left/right 以單邊為準;「只留配對成功者」即為 inner。

本題掛載於「ETL / ELT」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 48 題觀念複習:標準化 / Robust

在進行機器學習建模前,資料分析師需對特徵變數 X 進行標準化處理,以消除不同量尺所造成的影響。已知使用 StandardScaler 進行資料轉換,程式碼如下:scaler = StandardScaler()。請問下列哪一種寫法可以正確完成資料標準化?

  1. AX_norm = scaler.transform(X)
  2. BX_norm = scaler.fit(X)
  3. CX_norm = scaler.fit_transform(X)
  4. DX_norm = fit_transform(scaler)
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 Scikit-learn 轉換器採兩段式設計:fit() 負責「學習參數」(StandardScaler 學習各欄位的平均數與標準差),transform() 負責「以學到的參數轉換資料」。fit_transform(X) 把兩步合併,先從 X 學出 μ 與 σ,隨即回傳標準化後的資料,是對訓練特徵完成標準化的正確寫法。 【為何其他選項錯了?】 - (A):scaler 剛建立、尚未執行 fit,直接呼叫 transform(X) 會拋出 NotFittedError,因為它還沒有計算平均數與標準差,無從轉換。 - (B):scaler.fit(X) 只學習參數,回傳的是 scaler 物件本身而非轉換後的資料;把估計器物件當成標準化結果使用,後續處理會出錯。 - (D):fit_transform(scaler) 把方法當成獨立函式呼叫、又把物件當成參數傳入,執行會拋出 NameError;正確寫法是「物件.方法(資料)」。 提示:fit 學參數、transform 套用轉換、fit_transform 一次完成;訓練集用 fit_transform,測試集只用 transform(沿用訓練集學到的參數)。

本題掛載於「標準化 / Robust」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 49 題觀念複習:邏輯斯回歸

使用鳶尾花卉資料集(iris,目標為 setosa、versicolor、virginica 三個類別)進行羅吉斯迴歸(Logistic Regression)分析。資料分析師已完成資料前處理(包含遺漏值處理與特徵標準化,X_norm 為標準化後的特徵矩陣、y 為目標變數),並準備建立分類模型。已知資料流程如下:1. 將資料區分為訓練集與測試集;2. 建立羅吉斯迴歸模型;3. 使用訓練資料進行模型擬合(fit)。請問下列哪一組 Scikit-learn 程式碼流程最為正確?

  1. AX_train, X_test, y_train, y_test = train_test_split(X_norm, y, train_size=0.2, random_state=123); log_reg = LogisticRegression(solver="liblinear"); log_reg.fit(X_train, y_train)
  2. BX_train, X_test, y_train, y_test = train_test_split(X_norm, y, train_size=0.2, random_state=123); log_reg = LogisticRegression(solver="lbfgs"); log_reg.fit(X_train, y_train)
  3. CX_train, X_test, y_train, y_test = train_test_split(y, X_norm, train_size=0.2, random_state=123); log_reg = LogisticRegression(solver="liblinear"); log_reg.fit(X_train, y_train)
  4. DX_train, X_test, y_train, y_test = train_test_split(y, X_norm, train_size=0.2, random_state=123); log_reg = LogisticRegression(solver="lbfgs"); log_reg.fit(X_train, y_train)
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 本題有兩個檢查點。第一,train_test_split 的參數順序必須是特徵在前、目標在後:train_test_split(X_norm, y, ...) 依序回傳 X_train, X_test, y_train, y_test;(C)(D) 把 y 放在第一個位置,回傳變數的內容整組錯位,直接排除。第二,iris 是三類別問題:lbfgs 是 LogisticRegression 的預設求解器,原生支援多項式(multinomial/Softmax)多類別;liblinear 僅支援二元分類或以一對其餘(OvR)方式拆解,對多類別問題並非合適選擇。因此 (B) 在切分順序與求解器選擇上都正確。 【為何其他選項錯了?】 - (A):切分順序正確,但對三類別資料選用 liblinear,多類別支援受限,不如預設的 lbfgs 合適。 - (C):train_test_split 第一個位置放了 y,使 X_train 實際裝入標籤;後續 fit(X_train, y_train) 等於以標籤作為特徵進行擬合,流程錯誤。 - (D):求解器選擇正確,但切分參數順序與 (C) 犯了相同錯誤,整體流程仍不成立。 提示:train_test_split(X, y) 永遠 X 前 y 後;多類別羅吉斯迴歸用 lbfgs(預設),liblinear 適用於二元問題。

本題掛載於「邏輯斯回歸」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。

第 50 題觀念複習:模型評估

已在鳶尾花卉資料集(iris,三類別:setosa、versicolor、virginica)上訓練完成羅吉斯迴歸模型 log_reg,X_test、y_test 為測試集。執行以下程式碼: y_pred = log_reg.predict(X_test) cm = confusion_matrix(y_test, y_pred) f1 = f1_score(y_test, y_pred, average="weighted") print(cm) 的輸出為: [[13 0 0]  [ 0 6 0]  [ 0 1 10]] print 出的 F1-score (Weighted) 為 0.9671550671550672;classification_report 顯示:setosa 的 precision/recall/f1 為 1.00/1.00/1.00(support 13)、versicolor 為 0.86/1.00/0.92(support 6)、virginica 為 1.00/0.91/0.95(support 11),accuracy 為 0.97(共 30 筆)。下列描述何者正確?

  1. Acm 表示混淆矩陣,橫列表測試集的預測值
  2. B混淆矩陣對角線數值皆大於非對角線數值表示模型過度擬合
  3. Cf1_score參數average="weighted"表示計算平均 f1_score
  4. Df1_score計算時採用各類別精確率(Precision)與召回率(Recall)的調和平均,並加權考量類別不平衡性
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 F1 分數的定義是精確率與召回率的調和平均:F1 = 2×P×R/(P+R),每個類別各計算一個 F1;average="weighted" 再以各類別的樣本數(support)為權重進行加權平均,本例即 (1.00×13 + 0.92×6 + 0.95×11)/30 ≈ 0.967,與程式輸出相符。加權設計使樣本數多的類別影響較大,即「加權考量類別不平衡性」,(D) 對計算方式與加權意義的描述皆正確。 【為何其他選項錯了?】 - (A):sklearn 的 confusion_matrix(y_test, y_pred) 慣例為橫列代表實際值(true label)、直行代表預測值;例如第三列 [0 1 10] 表示實際為 virginica 的 11 筆中,1 筆被預測為 versicolor、10 筆預測正確。將橫列解讀為預測值即讀反。 - (B):對角線數值大於非對角線僅代表模型在測試集上的分類正確率高;過度擬合須比較訓練集與測試集的表現落差才能判斷,單張測試集混淆矩陣無法作為依據。 - (C):weighted 並非單純的平均;各類別 F1 的簡單算術平均是 average="macro"(本例約 0.96),weighted 是依 support 加權(約 0.97),兩者計算方式與數值皆不同,說法不精確。 提示:混淆矩陣橫列為實際、直行為預測;macro 為各類別平等平均,weighted 為依樣本數加權;過擬合的判斷依據是訓練與測試表現的落差。

本題掛載於「模型評估」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。