機器學習知識地圖 · 監督式學習

邏輯斯回歸

二元分類(Yes/No)

在互動地圖中開啟 回機器學習知識地圖

觀念教學

名字有「回歸」,幹的卻是分類邏輯斯回歸(Logistic Regression)先算出一個 0 到 1 的機率,再用門檻切成 Yes 或 No,是二元分類的第一首選。

核心觀念

把線性模型的輸出丟進 Sigmoid 函數 — 一條 S 形曲線,把任何數字壓進 0 到 1 之間變成機率;超過門檻(常設 0.5)判正類,否則判負類。它本質仍是線性模型,決策邊界是一條直線(超平面)。

白話理解

「這位病患罹患糖尿病的機率是 0.73」— 超過 0.5,系統發出風險警示。它給的不只是答案,還有信心程度;醫療與金融這種要說得出理由的場域,特別愛用它。

優缺點

  • 優點:簡單快速;輸出機率而不只是分類結果;係數可解釋每個特徵的影響力
  • 典型場景:疾病診斷、信用評估、垃圾郵件分類、點擊率預測
  • 缺點:決策邊界是線性的,複雜的非線性邊界得手動加特徵交叉或多項式特徵
  • 缺點:對離群值較敏感
  • 評估:準確率、精確率、召回率、F1、AUC-ROC;機率品質看 Log Loss
🎯 口訣:名字叫回歸,做的是分類;Sigmoid 把分數壓成 0 到 1 的機率。

iPAS 考點

歷屆原題方向:「預測罹病機率(0 到 1),超過 0.5 就警示」→ 選邏輯斯回歸,判斷關鍵字是輸出機率加二元分類;陷阱選項是線性回歸 — 它輸出無界數值,不是機率。另一常考:「邏輯斯回歸是線性還是非線性模型」— 本質線性,只是用 Sigmoid 把輸出轉成機率。

📝 本節掛載 1 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

應用場景

垃圾郵件分類疾病診斷信用評估

評估指標

準確率精確率召回率F1AUC-ROCLog Loss

iPAS 歷屆考題詳解(5 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第20題

某醫院希望開發一個系統,根據患者資訊預測其罹患糖尿病的機率(0~1),並依據預測值是否超過 0.5 做出風險警示。下列哪一種模型最適合用於此分類任務?

  1. A邏輯迴歸(Logistic Regression)
  2. B支援向量機(Support Vector Machine)
  3. C決策樹(Decision Tree)
  4. DK 平均演算法(K-means)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 題目需求是輸出 0 到 1 的機率,並以 0.5 為門檻發出風險警示。邏輯迴歸以 Sigmoid 函數把特徵的線性組合映射到 (0,1),輸出可直接解讀為罹病機率,天然支援門檻判斷;係數並可解釋各特徵對風險的影響方向與幅度,符合醫療場景對可解釋性的要求,是此類「機率輸出+門檻分類」任務最合適的模型。 【為何其他選項錯了?】 - (B):標準 SVM 輸出的是樣本相對於決策邊界的位置,不直接提供機率;需另行以 Platt Scaling 等校準方法轉換,不是此需求的首選。 - (C):決策樹輸出類別或以葉節點樣本比例估計的粗糙機率,機率品質不平滑,且單棵樹容易過擬合,不如邏輯迴歸適合精確的機率警示。 - (D):K-means 是非監督分群演算法,不使用標籤,也不輸出類別機率,無法完成此監督式預測任務。 提示:「輸出 0 到 1 機率+門檻分類」的二元任務首選邏輯迴歸;K-means 是分群方法,不是分類器。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第25題

某金融機構正在建立傳統信用評分卡模型,採用邏輯迴歸(Logistic Regression)作為建模方法,並依循監理機關建議的標準化流程進行模型開發。下列哪一項不是傳統信用評分卡模型開發流程中的常見步驟?

  1. A使用生成式模型進行特徵學習
  2. B進行特徵選擇與多重共線性(Multicollinearity)分析
  3. C進行分箱(Binning)與資訊值(Information Value, IV)檢定
  4. D使用樣本穩定性指標(Population Stability Index, PSI)檢驗模型穩定性
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 傳統信用評分卡是受監理高度規範的建模流程,標準步驟包括:變數分箱(Binning)、以證據權重(WOE)與資訊值(IV)評估變數預測力、特徵選擇與多重共線性分析、邏輯迴歸建模與分數刻度轉換,以及上線後以樣本穩定性指標(PSI)監控母體偏移,全程強調透明、可解釋、可稽核。「使用生成式模型進行特徵學習」屬深度學習時代的作法,結果不易解釋、難以向監理機關說明,不屬於傳統評分卡的常見步驟,故為本題答案。 【為何其他選項錯了?】 - (B):特徵選擇與多重共線性分析是評分卡變數篩選的基本步驟;共線性會使迴歸係數不穩定、難以解釋,屬常見步驟。 - (C):分箱與 IV 檢定用於將連續變數離散化並評估預測力,是評分卡的代表性步驟。 - (D):PSI 用於檢驗上線後申請母體分布是否偏移,是監理建議的標準模型監控指標,屬常見步驟。 提示:評分卡流程:分箱看 IV、迴歸防共線、上線盯 PSI,全程走可解釋路線;生成式特徵學習不在其中。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第33題

某線上書店希望建立一個多類別書籍推薦模型,根據讀者的「年齡、性別、過去購書類別偏好評分」等特徵,預測讀者下次最可能購買的書籍主題(共 8類)。資料已完整標註,且資料量達數十萬筆。在模型選型上,除了預測準確率外,也需考量模型訓練效率、可擴充性,並需支援快速訓練與線上部署。請問下列哪種方法最適合此情境?

  1. A多類別羅吉斯迴歸(Multinomial Logistic Regression)
  2. B支援向量機(SVM)搭配One-vs-One
  3. CK-means 分群後將群集標籤作為分類結果
  4. D主成分分析(PCA)後再以最大主成分作為分類依據
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 本題是「多類別分類+數十萬筆資料+要求訓練快、可擴充、易部署」的組合。多類別羅吉斯迴歸(Multinomial Logistic Regression,即 Softmax 迴歸)原生支援多類別,以單一模型輸出 8 類機率;訓練屬凸優化,可用 SGD 等方法擴展到大規模資料;模型輕巧,推論僅需一次矩陣運算,線上部署負擔極低,完全符合題目的所有需求。 【為何其他選項錯了?】 - (B):SVM 搭配 One-vs-One 需訓練 C(8,2)=28 個分類器,核方法在數十萬筆資料上訓練成本高,預測時還需多模型投票,訓練效率與部署便利性皆不利。 - (C):K-means 是非監督分群,群集標籤與「書籍主題」類別沒有對應保證;已有完整標註仍改用分群,等於放棄監督訊號,方法選擇錯誤。 - (D):PCA 是降維工具而非分類器,「以最大主成分作為分類依據」缺乏監督訊號,無法對應 8 個主題類別,方法論不成立。 提示:大量標註資料的多類別問題,先考慮 Softmax 迴歸這類線性基準:快、穩、易部署;有標籤時不以非監督方法替代分類器。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第34題

某電商平台希望建立二元分類模型,根據商品的「價格區間、品牌、顏色、材質」等特徵,將商品分類為「高銷量(1)」或「低銷量(0)」。同時希望模型輸出具備可解釋的機率(如P=0.73 表示73%機率為高銷量)。請問下列哪種方法最適合?

  1. AK-means 分群(K-means Clustering)
  2. B決策樹迴歸(Decision Tree Regression)
  3. C羅吉斯迴歸(Logistic Regression)
  4. D線性迴歸(Linear Regression)
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 需求有兩個:二元分類(高銷量/低銷量)與可解釋的機率輸出。羅吉斯迴歸把特徵的線性組合經 Sigmoid 函數映射到 (0,1),輸出天然就是 P(y=1) 的機率估計(如 P=0.73);係數並可解讀為對數勝算(Log-odds)的影響方向與大小,兩項需求同時滿足,是最標準的選擇。 【為何其他選項錯了?】 - (A):K-means 是非監督分群,不使用「高/低銷量」標籤,分群結果與銷量類別沒有保證對應,也不輸出類別機率。 - (B):決策樹迴歸預測的是連續數值,不是二元類別;即使改用分類樹,單棵樹以葉節點比例估計的機率通常粗糙且不平滑,機率品質不如羅吉斯迴歸。 - (D):線性迴歸輸出無界的連續值,可能產生大於 1 或小於 0 的結果,無法解讀為機率;直接套用於 0/1 目標也違反其誤差假設。 提示:「類別+可解釋機率」對應羅吉斯迴歸(Sigmoid 輸出 0 到 1);線性迴歸輸出連續值,不是機率。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第49題

使用鳶尾花卉資料集(iris,目標為 setosa、versicolor、virginica 三個類別)進行羅吉斯迴歸(Logistic Regression)分析。資料分析師已完成資料前處理(包含遺漏值處理與特徵標準化,X_norm 為標準化後的特徵矩陣、y 為目標變數),並準備建立分類模型。已知資料流程如下:1. 將資料區分為訓練集與測試集;2. 建立羅吉斯迴歸模型;3. 使用訓練資料進行模型擬合(fit)。請問下列哪一組 Scikit-learn 程式碼流程最為正確?

  1. AX_train, X_test, y_train, y_test = train_test_split(X_norm, y, train_size=0.2, random_state=123); log_reg = LogisticRegression(solver="liblinear"); log_reg.fit(X_train, y_train)
  2. BX_train, X_test, y_train, y_test = train_test_split(X_norm, y, train_size=0.2, random_state=123); log_reg = LogisticRegression(solver="lbfgs"); log_reg.fit(X_train, y_train)
  3. CX_train, X_test, y_train, y_test = train_test_split(y, X_norm, train_size=0.2, random_state=123); log_reg = LogisticRegression(solver="liblinear"); log_reg.fit(X_train, y_train)
  4. DX_train, X_test, y_train, y_test = train_test_split(y, X_norm, train_size=0.2, random_state=123); log_reg = LogisticRegression(solver="lbfgs"); log_reg.fit(X_train, y_train)
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 本題有兩個檢查點。第一,train_test_split 的參數順序必須是特徵在前、目標在後:train_test_split(X_norm, y, ...) 依序回傳 X_train, X_test, y_train, y_test;(C)(D) 把 y 放在第一個位置,回傳變數的內容整組錯位,直接排除。第二,iris 是三類別問題:lbfgs 是 LogisticRegression 的預設求解器,原生支援多項式(multinomial/Softmax)多類別;liblinear 僅支援二元分類或以一對其餘(OvR)方式拆解,對多類別問題並非合適選擇。因此 (B) 在切分順序與求解器選擇上都正確。 【為何其他選項錯了?】 - (A):切分順序正確,但對三類別資料選用 liblinear,多類別支援受限,不如預設的 lbfgs 合適。 - (C):train_test_split 第一個位置放了 y,使 X_train 實際裝入標籤;後續 fit(X_train, y_train) 等於以標籤作為特徵進行擬合,流程錯誤。 - (D):求解器選擇正確,但切分參數順序與 (C) 犯了相同錯誤,整體流程仍不成立。 提示:train_test_split(X, y) 永遠 X 前 y 後;多類別羅吉斯迴歸用 lbfgs(預設),liblinear 適用於二元問題。

相關節點