AI 方法論知識地圖 · 模型開發

模型評估

測試集最終評估

在互動地圖中開啟 回AI 方法論知識地圖

觀念教學

訓練集分數高,不等於真實世界可信 — 模型評估用模型沒看過的測試集做最終評估,是上線前的最後把關。

核心觀念

模型評估(Model Evaluation)在測試集上確認泛化能力(Generalization)。分類問題看混淆矩陣(Confusion Matrix)AUCF1;回歸問題看 MAE、RMSE、R²。指標沒有最好、只有最合場景 — 選錯指標,爛模型也能考高分。

白話理解

瑕疵品比例極低的產線:模型全猜「正常品」,整體準確率照樣很高。準確率(Accuracy)在不平衡資料下會失真,要改看 Precision、Recall、F1。

指標速查

  • Precision(精確率)= TP 除以 (TP + FP):抓出來的裡面,多少是真的 — 在意誤報成本時用
  • Recall(召回率)= TP 除以 (TP + FN):真的裡面,抓到了多少 — 在意漏抓(如癌症漏診)時用
  • F1:Precision 與 Recall 的調和平均,不平衡資料的主力指標
  • MAE = 誤差絕對值的平均:每筆等權重,對離群值穩健
  • RMSE = 誤差平方的平均再開根號:平方會放大大誤差,在意極端個案就看它
  • R²(判定係數):模型解釋了資料多少變異
🎯 口訣:怕錯殺看 Precision,怕漏抓看 Recall;在意大誤差用 RMSE,想要穩健看 MAE。

iPAS 考點

四個真題方向:住院日數預測,多數人 3 到 7 天、少數重症住很久,要兼顧整體又重視極端誤差 → 往 RMSE(對大誤差敏感)方向選;瑕疵品極少、整體準確率虛高 → 改用 F1、Precision、Recall 這類不平衡友善指標;癌症篩檢要求降低漏診(FN)→ 選 Recall(靈敏度);害蟲檢測給 TP = 80、FP = 20、FN = 10 → Precision = 80 除以 100 = 0.8,Recall = 80 除以 90 約 0.89,漏檢代價高的關鍵任務優先看 Recall。共同心法:先問「FP 與 FN 哪個代價高」,指標跟著代價走。

📝 本節掛載 4 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

iPAS 歷屆考題詳解(15 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第39題

某醫院計畫開發住院日數預測模型,以協助病房調度。多數病人的住院日數集中在 3-7 天,但仍有少數重症患者因治療需求而住院日數明顯偏長。醫院希望採用一種合適的評估方式,既能兼顧大部分病人的預測準確度,也能確保對重症個案的預測維持穩健。下列哪一種方法最符合此需求?

  1. A在模型檢核時,同時呈現平均絕對誤差(MAE)與重症子群的誤差指標
  2. B僅針對一般病人樣本進行交叉驗證,以避免重症個案拉高誤差
  3. C將所有病人的住院日數進行標準化處理,以減少數值範圍差異的影響
  4. D只採用單一的整體決定係數(R²)作為模型優劣的判斷依據
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 題幹情境屬於偏態分布:多數病人住院日數集中於 3 至 7 天,少數重症患者明顯偏長。若僅使用單一整體指標,重症個案的預測誤差會被多數樣本稀釋而難以察覺。同時呈現整體的平均絕對誤差(MAE)與重症子群的專屬誤差指標,一方面可確認多數病人的預測準確度,另一方面可單獨檢視重症個案的預測穩健性,正符合「兼顧多數準確度與重症穩健性」的雙重需求,故 (A) 正確。 【為何其他選項錯了?】 - (B):僅以一般病人進行交叉驗證,等於將重症個案排除在評估之外;整體誤差雖然變低,但重症患者的預測品質完全未被檢驗,不符合題幹對穩健性的要求。 - (C):標準化是數值前處理手段,有助於模型訓練收斂,但不改變評估面的問題;重症個案的預測誤差仍然存在,也未提供子群層級的檢視。 - (D):R² 是單一整體指標,在偏態資料中易受少數極端值影響,且無法呈現重症子群的預測品質;僅以其判斷模型優劣,無法滿足兼顧的需求。 提示:資料呈偏態且關鍵少數不可忽略時,評估應採「整體指標加子群指標」並列呈現,而非依賴單一整體數字。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第40題

某製造業公司建置機器學習模型,用於預測產品是否為瑕疵品。實際生產資料 中,瑕疵品比例極低,大多數樣本皆為正常品。模型測試時發現,即使模型多數 預測為正常品,仍可獲得很高的整體準確率。在此情境下,若希望更有效衡量模 型對瑕疵品的辨識能力,下列何者較適合作為主要評估指標?

  1. AF1-score
  2. B均方誤差(Root Mean Squared Error, RMSE)
  3. C準確率(Accuracy)
  4. D判定係數(R2, Coefficient of Determination)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 此為典型的類別不平衡問題。假設瑕疵品僅占 1%,模型即使將全部樣本預測為正常品,準確率(Accuracy)仍可達 99%,卻完全沒有辨識瑕疵品的能力。此時應改用能反映少數類辨識能力的指標:精確率(Precision)衡量被預測為瑕疵品者中實際為瑕疵品的比例,召回率(Recall)衡量所有真實瑕疵品中被成功找出的比例,F1-score 則是兩者的調和平均數,須兩者皆高分數才會高。因此在類別不平衡情境下,F1-score 是比準確率更全面、更有效的主要評估指標,故 (A) 正確。 【為何其他選項錯了?】 - (B):RMSE 是迴歸任務的誤差指標,衡量數值預測與實際值的差距,不適用於分類問題。 - (C):準確率在類別不平衡時會受多數類主導而嚴重失真,無法反映模型對瑕疵品的辨識能力。 - (D):R² 是迴歸模型的指標,衡量模型對資料變異的解釋程度,與分類任務的評估無關。 提示:類別不平衡的分類任務,優先檢視 Precision、Recall 與 F1;RMSE 與 R² 屬迴歸指標,可直接排除。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第50題

某醫院使用機器學習模型篩檢癌症患者。模型預測結果會決定哪些病人需要進一 步檢查。院方非常重視盡量找出所有可能的癌症患者,即希望降低漏診(Missed Diagnosis)風險,即便這可能增加一些誤判。下列哪一個評估指標最能反映模型 找出癌症患者的能力?

  1. A精準率(Precision)
  2. B召回率(Recall)
  3. C假陽性率(False Positive Rate)
  4. DROC-AUC 曲線
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 題幹的核心需求是盡量找出所有可能的癌症患者、降低漏診風險,即使因此增加部分誤判。此需求對應的評估指標是召回率(Recall):其定義為所有真正的陽性樣本(實際癌症患者)中,被模型成功預測為陽性的比例。召回率越高,代表模型的查全能力越強、漏掉的真實患者越少,最能直接反映「找出癌症患者的能力」。 【名詞白話語典】 - 精確率(Precision):在所有被模型預測為陽性的樣本中,實際為陽性的比例。醫療情境中,高精確率代表被通知有病的人確實有病的機率高,可減少不必要的恐慌與後續檢查。 - 召回率(Recall):在所有實際有病的人中,被模型成功找出的比例。高召回率代表漏診率低。 【為何其他選項錯了?】 - (A):過度追求精確率會使模型趨於保守,僅在極有把握時才判為陽性,容易漏掉潛在患者,與題幹降低漏診的目標不符。 - (C):假陽性率是所有健康者中被誤判為有病的比例;院方雖可接受部分誤判,但該指標衡量的是誤判程度,並非「找出患者的能力」。 - (D):ROC-AUC 是模型在不同閾值下召回率與假陽性率的綜合表現,屬整體鑑別力指標;召回率本身才最直接對應題幹所問的查全能力。 提示:題幹強調「降低漏診、寧可多查」即對應召回率;強調「通知的人要確實有病」才對應精確率。
115年第二次初級AI應用規劃師第一科人工智慧基礎概論 第19題

某溫室農場開發AI 系統自動識別作物葉片上的害蟲種類,測試結果顯示:在 1000 張測試影像中,系統正確識別出80 隻害蟲,但誤判了20 張正常葉片為有害蟲,同時漏檢了10 隻實際存在的害蟲。對於害蟲檢測這個關鍵任務,下列哪個評估指標最需要優先關注?

  1. A召回率(Recall);
  2. B精確率(Precision);
  3. C準確率(Accuracy);
  4. DF1 分數(F1-Score)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 害蟲檢測任務的關鍵風險是漏檢:漏掉實際存在的害蟲可能導致病蟲害擴散,造成的損失遠高於誤報。召回率(Recall)衡量所有實際存在害蟲的樣本中被成功偵測出的比例,直接對應漏檢風險,因此是本情境最需優先關注的指標。以題目數據而言,系統漏檢了 10 隻實際存在的害蟲,正是召回率所要控制的部分。 【為何其他選項錯了?】 - (B):精確率關注被判定為害蟲的樣本中有多少為真,對應誤報成本;誤判正常葉片的後果(多餘的人工確認)遠輕於害蟲擴散,並非本題最關鍵的風險。 - (C):準確率易被大量正常樣本主導,在關鍵少數事件的偵測任務中參考價值有限。 - (D):F1 兼顧精確率與召回率,屬折衷指標;但題幹明確強調害蟲檢測為關鍵任務、應優先避免漏檢,故最需關注的是召回率。 提示:漏檢代價高的偵測任務優先看召回率;誤報代價高才優先看精確率。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第10題

如果希望同時兼顧「精確率(Precision)」和「召回率(Recall)」,下列哪一個指標可以作為綜合評估的標準?

  1. A準確率(Accuracy)
  2. B均方根誤差(RMSE)
  3. C均方誤差(MSE)
  4. DF1分數(F1 Score)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 F1 分數(F1 Score)是精確率(Precision)與召回率(Recall)的調和平均數(Harmonic Mean),公式為 F1 = 2PR/(P+R)。調和平均對較低的一方特別敏感,僅當兩者同時夠高時 F1 才會高,因此是同時兼顧查準(Precision)與查全(Recall)的綜合評估指標,特別適合類別不平衡的分類任務。 【為何其他選項錯了?】 - (A):準確率(Accuracy)僅看整體答對比例,在不平衡資料下嚴重失真:若 99% 樣本為負類,全部預測負類即有 99% 準確率,並未兼顧 Precision 與 Recall。 - (B):均方根誤差(RMSE)是迴歸任務的誤差指標,衡量預測值與實際值的差距,與分類的查準查全無關。 - (C):均方誤差(MSE)同為迴歸誤差指標,是 RMSE 未開根號的版本,同樣無法評估 Precision 與 Recall。 提示:同時兼顧 Precision 與 Recall 的綜合指標為 F1;調和平均受較低值主導,任一方偏低 F1 即偏低。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第16題

在二元分類問題中,若精確率(Precision)為0.8,召回率(Recall)為0.6,則F1分數(F1 Score)為何?

  1. A0.686
  2. B0.700
  3. C0.720
  4. D0.750
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 F1 分數是精確率與召回率的調和平均:F1 = 2×P×R/(P+R) = 2×0.8×0.6/(0.8+0.6) = 0.96/1.4 ≈ 0.686。調和平均的特性是受較低的數值主導,因此 F1 能懲罰精確率與召回率失衡的模型,比單看任一指標更全面,故 (A) 正確。 【為何其他選項錯了?】 - (B):0.700 是 (0.8+0.6)/2 的算術平均;F1 採調和平均,其值恆小於等於算術平均,僅在 P=R 時兩者相等。 - (C):0.720 不對應任何正確的平均計算方式(幾何平均為 √0.48 ≈ 0.693,亦非此值),屬干擾選項。 - (D):0.750 同樣無法由正確公式導出,屬干擾選項。 提示:F1 計算式為兩者乘積的兩倍除以兩者之和;其值必介於 P 與 R 之間且偏向較小的一方。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第30題

某情感分析模型在英文資料集上取得 macro F1-score = 0.91。當該模型部署於西班牙文資料集時,F1-score 驟降至 0.58。下列哪一項解釋最合理,且與F1-score 變化相關?

  1. Amacro F1-score 本身波動性高,建議改用 micro-average F1-score評估
  2. B模型在西班牙文語料上過度擬合,導致評估結果偏高
  3. C語言轉移造成召回率(Recall)下降,模型無法正確辨識關鍵情緒詞彙
  4. D以均方誤差(MSE)取代 F1-score 評估可獲得更準確的結果
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 模型在英文語料上訓練,對西班牙文的情緒詞彙、慣用表達與語法結構的辨識能力大幅下降,導致大量真實情緒樣本被漏判,召回率(Recall)顯著下滑;而 F1-score 是精確率與召回率的調和平均,召回率一旦大幅降低,F1 隨之明顯下降至 0.58。此解釋同時說明了跨語言部署造成的效能衰退(語言領域偏移),並直接連結到 F1 的組成結構,故 (C) 最合理。 【為何其他選項錯了?】 - (A):macro F1 是各類別 F1 的平均,本身並無波動性高的問題;改用 micro 平均也無法改變模型難以辨識西班牙文情緒詞彙的事實。 - (B):過擬合的表現是在訓練分布上的評估偏高;本題在西班牙文資料上量得的 0.58 是實際偏低的表現,「導致評估結果偏高」的敘述邏輯不通。 - (D):MSE 是迴歸指標,不適用於情感分類的評估,更換指標也無法解釋效能下降的原因。 提示:模型跨語言或跨領域部署後 F1 下降,應拆解檢視 Precision 與 Recall 何者衰退;辨識不出關鍵詞彙通常先反映在 Recall。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第8題

某工程師訓練了一個皮膚病變二元分類模型(惡性/良性),在向臨床醫師報告模型效能時,使用 ROC 曲線(Receiver Operating Characteristic Curve)進行呈現。請問ROC 曲線的橫軸(X軸)與縱軸(Y軸)分別代表哪些指標,且在醫療情境中代表哪一種意義?

  1. AX 軸為準確率(Accuracy),Y 軸為召回率(Recall),表示模型整體分類正確比例與偵測能力
  2. BX軸為假陽率(False Positive Rate, FPR),Y軸為真陽率(True Positive Rate, TPR),反映誤診健康個體的風險與正確識別病患的能力
  3. CX軸為精確率(Precision),Y軸為召回率(Recall),表示預測為陽性樣本的準確性與完整性
  4. DX軸為 IoU閾值,Y軸為 mAP,反映物件偵測模型在不同重疊條件下的表現
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 ROC 曲線的橫軸是假陽率 FPR = FP/(FP+TN),縱軸是真陽率 TPR = TP/(TP+FN);曲線是將決策閾值由嚴格調至寬鬆時,各閾值下的 (FPR, TPR) 點連成的軌跡。對應皮膚病變偵測的臨床意義:FPR 是健康個體被誤判為惡性的比例,反映誤診帶來的不必要切片與心理負擔;TPR(即召回率)是真正惡性個案被正確辨識的比例,反映不漏診的能力。ROC 曲線呈現的正是兩者之間的權衡,故 (B) 正確。 【為何其他選項錯了?】 - (A):準確率(Accuracy)並非 ROC 的任一軸;ROC 的設計正是為了避免準確率在類別不平衡下的失真。 - (C):以精確率對召回率作圖是 PR 曲線(Precision-Recall Curve),適用於極度不平衡的場景,但並非 ROC 曲線的定義。 - (D):IoU 閾值與 mAP 是物件偵測任務的評估設定,與二元分類的 ROC 曲線無關。 提示:ROC 曲線 X 軸為 FPR(誤報)、Y 軸為 TPR(偵測);曲線越接近左上角,模型鑑別力越佳。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第9題

某團隊在監控影像分類模型的線上效能時,透過儀表板呈現混淆矩陣(Confusion Matrix),以觀察模型預測結果與實際標籤的分佈情形。請問下列哪一項無法從混淆矩陣中直接計算?

  1. A精確率(Precision)
  2. B準確率(Accuracy)
  3. C召回率(Recall)
  4. DROC 曲線下面積(AUC)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 混淆矩陣呈現的是模型在單一決策閾值下的預測結果,四格 TP、FP、TN、FN 皆為固定數值,因此精確率 Precision = TP/(TP+FP)、召回率 Recall = TP/(TP+FN)、準確率 Accuracy = (TP+TN)/總樣本數,皆可直接由矩陣計算。AUC 則是 ROC 曲線下面積,而 ROC 曲線需將閾值由 0 掃至 1,在每個閾值下各計算一組 (FPR, TPR) 才能繪出;固定閾值的混淆矩陣僅對應曲線上的一個點,無法由單一點求得曲線下面積,故 AUC 無法直接從混淆矩陣計算。 【為何其他選項錯了?】 - (A):Precision = TP/(TP+FP),分子與分母皆可自矩陣取得,可直接計算。 - (B):Accuracy = (TP+TN)/(TP+FP+TN+FN),即對角線總和除以樣本總數,可直接計算。 - (C):Recall = TP/(TP+FN),同樣可直接由矩陣數值求得。 提示:一張混淆矩陣對應一個閾值,即 ROC 曲線上的一個點;AUC 需要所有閾值下的結果,單一矩陣無法計算。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第23題

Receiver Operating Characteristic(ROC)曲線係由單一分類模型在不同決策閾值下形成,並以真陽率(True Positive Rate, TPR)為縱軸、假陽率(False Positive Rate, FPR)為橫軸。圖中有四條由 (0,0) 附近延伸至 (1,1) 的線:水平線A——沿著 TPR=1 的高度自左上角水平延伸到右上角 (1,1);曲線B——自原點快速上升後趨緩、整體凸向左上角的圓弧(典型良好分類器形狀);曲線C——自原點上升後中段「先下降再回升」,TPR 隨 FPR 增加出現波浪狀起伏,最後到達 (1,1);斜直線D——自 (0,0) 到 (1,1) 的 45 度對角線。請問四條線中,何者最不可能是 ROC 曲線?

  1. A水平線A
  2. B曲線B
  3. C曲線C
  4. D斜直線D
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 ROC 曲線是將決策閾值由高至低掃描繪出的軌跡:閾值每降低一級,被判為陽性的樣本數只會增加或持平,因此 TPR 與 FPR 皆單調不減,曲線只能向右上方延伸,不可能回頭下降。曲線C中段出現 TPR 隨 FPR 增加而下降的波浪狀起伏,違反此數學性質,因此最不可能是 ROC 曲線。 【為何其他選項錯了?】 - (A):沿 TPR=1 延伸的水平線是近乎完美分類器的 ROC:先將所有正例全數辨識(TPR=1),其後閾值再降僅使 FPR 增加,曲線沿頂端水平前進,AUC 趨近 1,屬合法形狀,故非答案。 - (B):凸向左上角的圓弧是典型良好分類器的 ROC,AUC 介於 0.5 與 1 之間,為教科書標準形狀。 - (D):45 度對角線是隨機猜測的 ROC,AUC = 0.5;它代表模型無鑑別力,但屬合法且常作為基準線的 ROC。 提示:ROC 曲線必為單調不減;對角線代表隨機,貼近左上角代表優秀,出現回頭下降的曲線必非 ROC。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第43題

某共享乘車平台安全部門發現,僅有極少數司機(約占總體 0.05%)會利用外掛程式竄改 GPS 回傳資料(gps_ping_rate),以騙取里程補貼。某新進資料科學家訓練了一個二元分類模型,並在報告中指出:「模型整體準確率(Accuracy)高達 99.95%,因此可直接上線攔截可疑帳號。」報告附上的分類報告(classification report)如下(數值為四捨五入後結果): 類別 0(正常):precision 1.00、recall 1.00、f1-score 1.00 類別 1(外掛):precision 1.00、recall 1.00、f1-score 1.00 accuracy:1.00 macro avg:precision 1.00、recall 1.00、f1-score 1.00 weighted avg:precision 1.00、recall 1.00、f1-score 1.00 然而,資深工程師檢視後認為,僅憑上述結果仍不足以支持模型直接上線。下列何者不是其提出質疑的合理理由?

  1. A在此類極度不平衡的資料中,即使模型永遠預測所有司機皆為正常,整體準確率仍可能高達99.95%
  2. B報告中未呈現召回率(Recall),因此模型可能無法有效辨識真正的外掛司機
  3. C異常偵測問題不可使用分類模型處理,僅能使用分群或離群值方法
  4. D對於少數類比例極低的問題,若僅觀察 Accuracy,可能忽略模型對異常樣本的實際偵測能力
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 本題要求挑出「不合理」的質疑。(C) 主張異常偵測不可使用分類模型、僅能使用分群或離群值方法,此絕對化敘述有誤:只要具備標註資料(本例已知哪些司機使用外掛),監督式二元分類正是處理異常偵測的正當且常用途徑,可搭配類別權重、重抽樣與合適的評估指標;非監督的分群或離群值方法通常是缺乏標籤時的替代方案。由於此理由本身不成立,它不是合理質疑,故為本題答案。 【為何其他選項錯了?】 - (A):在 0.05% 的極度不平衡下,即使模型將所有司機判為正常,Accuracy 仍可達 99.95%;單憑準確率無法證明模型具備偵測外掛的能力,屬合理質疑。 - (B):實務審查中,報告若僅強調 Accuracy 而未逐一檢視少數類的召回率(樣本極少時,四捨五入後的 1.00 可能掩蓋漏抓情形),即無法確認外掛司機的實際辨識率,要求補列 Recall 屬合理質疑。 - (D):與 (A) 相呼應,Accuracy 由多數類撐高,少數類全數誤判時數值幾乎不變,忽略異常樣本偵測能力的風險確實存在,屬合理質疑。 提示:具備標籤的異常偵測可採監督式分類;審視不平衡任務的模型,優先檢視少數類的 Recall 與 Precision,而非整體 Accuracy。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第44題

某共享乘車平台已訓練一個二元分類模型,偵測利用外掛程式竄改 GPS 資料騙取里程補貼的司機(正類=外掛司機,約占總體 0.05%)。營運長對此外掛偵測模型下達最終的商業決策目標:「對於作弊行為零容忍。即使誤凍結部分正常司機帳號,後續仍可交由人工覆核;但不能放過任何一個真正的外掛司機。」根據上述目標,團隊在調整模型輸出的決策機率門檻(Threshold,預設為 0.5)時,應採取下列何種策略最為合理?

  1. A選擇使模型對作弊者的召回率(Recall)最大化的門檻,通常代表應降低 Threshold
  2. B選擇使模型精確率(Precision)最大化的門檻,通常代表應提高 Threshold
  3. C固定使用 Threshold=0.5 作為預設值,因為調整門檻將破壞演算法原有的訓練平衡
  4. D選擇使模型特異度(Specificity)達到100%的門檻,以確保正常司機不會被誤判
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 將商業目標轉換為指標語言:「不能放過任何一個外掛司機」等於將漏網的偽陰性(False Negative)壓到最低,即最大化正類的召回率(Recall);「誤凍結正常司機可接受、後續交人工覆核」代表可容忍偽陽性(False Positive)增加、允許精確率下降。降低決策門檻(例如由 0.5 調至 0.2)會使模型更容易將樣本判為外掛,偵測範圍更廣、漏網更少,正是召回率優先策略的標準作法,故 (A) 正確。 【為何其他選項錯了?】 - (B):提高門檻是精確率優先策略,僅在把握極高時才判為正類,誤判減少但漏網增加,與「零容忍漏抓」的目標相反。 - (C):0.5 僅為預設值,門檻本應依商業成本結構調整;且調整門檻只影響機率轉換為標籤的切點,模型參數與訓練結果不受影響,「破壞訓練平衡」的說法不成立。 - (D):特異度 100% 代表完全不誤判正常司機,為此門檻必須設得極高,絕大多數外掛司機將被放行,與題幹目標完全相反。 提示:重視不漏抓則降低門檻以提升 Recall;重視不誤判則提高門檻以提升 Precision;決策門檻應依商業成本調整,而非固定於預設值。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第50題

已在鳶尾花卉資料集(iris,三類別:setosa、versicolor、virginica)上訓練完成羅吉斯迴歸模型 log_reg,X_test、y_test 為測試集。執行以下程式碼: y_pred = log_reg.predict(X_test) cm = confusion_matrix(y_test, y_pred) f1 = f1_score(y_test, y_pred, average="weighted") print(cm) 的輸出為: [[13 0 0]  [ 0 6 0]  [ 0 1 10]] print 出的 F1-score (Weighted) 為 0.9671550671550672;classification_report 顯示:setosa 的 precision/recall/f1 為 1.00/1.00/1.00(support 13)、versicolor 為 0.86/1.00/0.92(support 6)、virginica 為 1.00/0.91/0.95(support 11),accuracy 為 0.97(共 30 筆)。下列描述何者正確?

  1. Acm 表示混淆矩陣,橫列表測試集的預測值
  2. B混淆矩陣對角線數值皆大於非對角線數值表示模型過度擬合
  3. Cf1_score參數average="weighted"表示計算平均 f1_score
  4. Df1_score計算時採用各類別精確率(Precision)與召回率(Recall)的調和平均,並加權考量類別不平衡性
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 F1 分數的定義是精確率與召回率的調和平均:F1 = 2×P×R/(P+R),每個類別各計算一個 F1;average="weighted" 再以各類別的樣本數(support)為權重進行加權平均,本例即 (1.00×13 + 0.92×6 + 0.95×11)/30 ≈ 0.967,與程式輸出相符。加權設計使樣本數多的類別影響較大,即「加權考量類別不平衡性」,(D) 對計算方式與加權意義的描述皆正確。 【為何其他選項錯了?】 - (A):sklearn 的 confusion_matrix(y_test, y_pred) 慣例為橫列代表實際值(true label)、直行代表預測值;例如第三列 [0 1 10] 表示實際為 virginica 的 11 筆中,1 筆被預測為 versicolor、10 筆預測正確。將橫列解讀為預測值即讀反。 - (B):對角線數值大於非對角線僅代表模型在測試集上的分類正確率高;過度擬合須比較訓練集與測試集的表現落差才能判斷,單張測試集混淆矩陣無法作為依據。 - (C):weighted 並非單純的平均;各類別 F1 的簡單算術平均是 average="macro"(本例約 0.96),weighted 是依 support 加權(約 0.97),兩者計算方式與數值皆不同,說法不精確。 提示:混淆矩陣橫列為實際、直行為預測;macro 為各類別平等平均,weighted 為依樣本數加權;過擬合的判斷依據是訓練與測試表現的落差。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第12題

某醫院導入肺癌篩檢模型,資料集中正常病例佔 99%、肺癌陽性僅佔 1%。模型上線後,系統報告整體準確率(Accuracy)為 99.1%。醫師對此數字感到疑慮,認為不足以評估臨床價值,在漏診風險上可能存在重大問題。請問在此情境下,僅以Accuracy 作為評估指標最嚴重的缺陷為何?

  1. AAccuracy 對類別不平衡不敏感,可能無法反映模型對肺癌陽性的偵測能力
  2. BAccuracy 的計算不包含模型對邊界樣本的分類結果,容易遺漏困難樣本
  3. CAccuracy 無法處理多分類問題,在二元分類下需改用 AUC
  4. DAccuracy 無法揭示模型的收斂速度,因此不適合用來選擇最終模型
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 類別極度不平衡(99:1)時,模型即使將所有病例判為正常,Accuracy 仍有 99%,卻可能完全未偵測到任何肺癌陽性。Accuracy 將 TP 與 TN 合併計算,對少數類的偵測能力不敏感;而臨床上最重視的正是漏診數量(FN)。因此僅以 Accuracy 評估的最嚴重缺陷,是無法反映模型對肺癌陽性的偵測能力,應改以 Recall(Sensitivity)、Precision、F1、PR-AUC 等針對少數類的指標評估,故 (A) 正確。 【為何其他選項錯了?】 - (B):Accuracy 的計算涵蓋所有樣本,不存在「不包含邊界樣本」的規則,此敘述與定義不符。 - (C):Accuracy 本可用於多分類問題;「二元分類必須改用 AUC」亦非正確規則,AUC 是補充視角而非強制替代。 - (D):評估指標本來就不負責反映收斂速度,此敘述既非 Accuracy 特有的缺陷,也與本情境的漏診風險無關。 提示:不平衡資料應優先檢視 Recall 與 Precision;高 Accuracy 可能僅是全數預測多數類的結果。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第32題

某詐欺偵測模型需同時具備高精確率(Precision),以避免誤凍結正常帳號,並維持高召回率(Recall)表現,以確保不放過任何詐欺行為。然而工程師發現兩者之間存在取捨關係(Precision-Recall Tradeoff)。在此情境下,F1-score最能反映何種特性?

  1. AF1-score = (Precision + Recall) / 2,為算術平均
  2. BF1-score為Precision 的加權平均
  3. CF1-score僅適用於類別平衡資料
  4. DF1-score = 2 × (Precision×Recall)/(Precision+Recall),為調和平均,對較小值敏感
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 F1-score = 2 × (Precision × Recall) / (Precision + Recall),為兩者的調和平均。調和平均的關鍵性質是受較小值主導:任一方偏低,F1 即明顯下降,唯有兩者皆高,F1 才會高。此特性正適合詐欺偵測這類必須同時兼顧精確率(避免誤凍結正常帳號)與召回率(不放過詐欺行為)的場景,可防止模型以犧牲一方換取另一方的高分,故 (D) 正確。 【為何其他選項錯了?】 - (A):(P+R)/2 是算術平均;算術平均會掩蓋短板,例如一方 0.99、另一方 0.2 時平均值仍接近 0.6,F1 並非算術平均。 - (B):F1 不是 Precision 的加權平均;若需調整兩者的相對重要性,應使用 Fβ 分數(β>1 時偏重 Recall),其加權作用於調和平均的結構,而非對 Precision 加權。 - (C):F1 並非僅適用於類別平衡資料;相反地,它在不平衡資料上遠比 Accuracy 具參考價值,這正是其主要用途之一。 提示:調和平均由較低的一方決定整體水準;需偏重 Precision 或 Recall 時,改用 Fβ 分數。

相關節點