資料知識地圖 · 6. 統計推論

假設檢定

Hypothesis Testing

在互動地圖中開啟 回資料知識地圖

觀念教學

「新藥有效」還是「剛好這批病人體質好」?假設檢定是統計學的法庭 — 先假設無罪,證據夠強才能定罪。

核心觀念

先設虛無假設 H0(沒有差異、沒有效果)與對立假設 H1,收集資料後計算 p-value:在 H0 為真的前提下,出現目前這麼極端結果的機率。p-value 小於顯著水準(慣例 0.05)就拒絕 H0,稱為統計顯著。信賴區間是同一件事的另一面:95% 信賴區間若不包含 0,通常等同於顯著。

白話理解

金融風控團隊檢驗「新版審核流程是否改變違約率」。H0 是「新舊流程沒差」;檢定算出 p-value 為 0.03,小於 0.05,拒絕 H0 — 證據顯示新流程確實帶來差異。

檢定方法與兩種錯誤

  • t 檢定(t-test):比較兩組平均數是否有差異
  • ANOVA(變異數分析):比較三組以上的平均數
  • 卡方檢定:檢驗兩個類別變數是否獨立
  • 型一錯誤(Type I Error, α):H0 其實為真卻拒絕它 — 冤枉好人、誤報
  • 型二錯誤(Type II Error, β):H0 其實為假卻沒拒絕 — 放走壞人、漏報
  • 兩種錯誤互相拉扯:α 訂得越嚴,β 越容易升高,想兼顧就得加大樣本
🎯 口訣:型一冤枉好人(沒效說有效),型二放走壞人(有效沒抓到)。

iPAS 考點

必考三件事:一,p-value 的正確定義是「H0 為真時看到此結果的機率」,不是「H0 為真的機率」;二,給情境判斷型一還是型二錯誤;三,方法配對 — 兩組平均用 t-test、三組以上用 ANOVA、類別變數用卡方。

應用場景

t-testANOVA卡方檢定Mann-Whitney U

評估指標

p-value信賴區間Type I/II Error

iPAS 歷屆考題詳解(7 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第23題

某研究團隊以單樣本 t檢定(one-sample t-test)檢驗「新行銷策略後的平均月銷售額是否與原本的 100 萬元不同」,顯著水準設定為 α =0.05。檢定結果顯示:p值=0.08,且95%信賴區間為 [95 萬元, 108 萬元]。根據上述結果,下列敘述何者正確?

  1. A因p值< 0.05,可拒絕虛無假設
  2. B若顯著水準改為 0.10,仍不顯著
  3. C因100 萬元落在信賴區間內,無法拒絕虛無假設
  4. D信賴區間寬度僅與顯著水準有關
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 信賴區間與假設檢定是一體兩面:95% 信賴區間 [95 萬, 108 萬] 包含虛無假設的值 100 萬元,等價於「在 α = 0.05 下無法拒絕 H0」;p 值 = 0.08 > 0.05 也給出相同結論。兩項證據互相印證:目前資料不足以宣稱新策略後的平均月銷售額與 100 萬元不同。 【為何其他選項錯了?】 - (A):p = 0.08 大於 0.05,結論是「無法拒絕」虛無假設;「p 值 < 0.05」與題目給定的數據直接矛盾。 - (B):若顯著水準放寬為 0.10,則 p = 0.08 < 0.10,反而成為「顯著、可拒絕 H0」;選項稱「仍不顯著」方向錯誤。 - (D):信賴區間寬度由信心水準、樣本變異(標準差)與樣本數共同決定,並非只與顯著水準有關。 提示:H0 的值落在信賴區間內等價於無法拒絕 H0;p 值與 α 的比較,和信賴區間的判讀結論必然一致。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第38題

一家製造廠評估新生產線推出後,產品良率是否較原生產線提升。工程師分別從兩條生產線各抽樣 100 件產品,原生產線良率為 95%,新生產線為 97%。若欲檢定兩條生產線良率的差異是否具有統計意義,下列哪一種方法最為合適?

  1. A雙樣本平均數 t 檢定(Two-sample t-test)
  2. B雙比例 Z 檢定(Two-proportion Z-test)
  3. C卡方檢定(Chi-square test)
  4. D變異數分析(ANOVA)
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 良率是「比例」型資料:每件產品只有良品或不良品兩種結果,兩條產線各抽 100 件,得到兩個樣本比例(95%、97%)。要檢定「兩個母體比例是否有差異」,標準工具是雙比例 Z 檢定(Two-proportion Z-test):以合併比例估計標準誤,計算兩比例差的 Z 統計量;樣本數各 100 件亦大致滿足常態近似條件。 【為何其他選項錯了?】 - (A):雙樣本 t 檢定比較的是兩組「連續變數的平均數」(如平均重量、平均尺寸);良率是二元結果的比例,不是連續量測值。 - (C):卡方檢定以 2×2 列聯表進行獨立性檢定,其雙尾結論與雙比例 Z 檢定在數學上等價;但題目問「最合適」,直接針對比例差設計、且可進行單尾檢定(檢定「是否提升」)的雙比例 Z 檢定更符合需求。 - (D):ANOVA 用於比較三組以上的平均數;本題只有兩組,且比較對象是比例而非平均數,兩個條件皆不符。 提示:兩組平均數用 t 檢定;兩組比例用雙比例 Z 檢定;三組以上平均數用 ANOVA。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第4題

某工程師使用 MLflow 進行實驗追蹤,評估三種不同學習率(0.001、0.01、0.1)對同一模型在驗證資料集上的損失表現。每種學習率皆以不同隨機種子重複訓練 10次,形成三組彼此獨立的樣本資料。經檢查後,這些資料近似常態分布且變異數相近。工程師希望判斷三組平均損失是否存在顯著差異,同時避免因進行多次兩兩比較而提高第一類型錯誤率。請問下列何者為最適合採用的統計方法?

  1. A單因子變異數分析(One-Way ANOVA)
  2. B獨立樣本 t 檢定(Independent Samples t-test)
  3. C卡方獨立性檢定(Chi-Square Test);
  4. DWilcoxon 符號等級檢定(Wilcoxon Signed-Rank Test)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 要同時比較「三組以上」獨立樣本的平均數是否有顯著差異,且資料近似常態、變異數相近,標準方法即為單因子變異數分析(One-Way ANOVA)。ANOVA 以一次 F 檢定回答「是否至少有一組平均數不同」,避免進行 3 次兩兩 t 檢定造成型一錯誤率膨脹(3 次檢定的整體偽陽性率約 1 − 0.95³ ≈ 14%)。題幹的條件(三組、常態、變異數相近、要求控制多重比較)完整對應 ANOVA 的適用情境。 【為何其他選項錯了?】 - (B):獨立樣本 t 檢定一次只能比較兩組;三組需檢定三次,正是題目明言要避免的「多次兩兩比較推高型一錯誤率」。 - (C):卡方獨立性檢定處理的是兩個類別變數之間的關聯(列聯表),損失值是連續數值,方法與資料型態不符。 - (D):Wilcoxon 符號等級檢定是「成對或單一樣本」的無母數方法,適用於資料不符常態的配對情境;本題為三組獨立且近似常態,應採用母數方法的 ANOVA。 提示:兩組獨立比較用 t 檢定,三組以上比較平均數用 ANOVA;整體顯著後再以事後檢定確認差異來源。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第6題

在 AI 模型評估的假說檢定框架中,「女士品茶」實驗是理解型一/型二錯誤的經典案例。實驗中某女士宣稱能分辨 8 杯奶茶中哪4杯先加牛奶,若以顯著水準 α=0.05進行假說檢定,下列敘述何者不正確?

  1. A虛無假說(H₀)為「女士無此能力(隨機猜測)」,對立假說(H₁)為「女士確實有此能力」
  2. B在α=0.05 下,若女士完全答對(8選4全對),其p 值約為1/70≈0.014,小於顯著水準,可達統計顯著
  3. C若女士完全答對且 p值<α,則拒絕虛無假說,統計上支持女士有此能力
  4. D若女士未完全答對,則「接受虛無假說」,代表確認女士無此能力
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 本題選「不正確」的敘述。假說檢定的邏輯是:證據不足以推翻 H₀ 時,只能說「不拒絕(fail to reject)虛無假說」,而非「接受並確認 H₀ 為真」。未達顯著可能只是樣本太小、檢定力不足,不能反過來當成「證明女士沒有此能力」。選項 (D) 把「接受虛無假說」解讀為「確認女士無此能力」,把證據不足誤當成反向證明,是不正確的敘述,即為本題答案。 【為何其他選項錯了?】 - (A):此敘述正確:H₀ 設為「無此能力(隨機猜測)」、H₁ 為「有此能力」,正是 Fisher 女士品茶實驗的標準設定。 - (B):此敘述正確:8 杯選 4 杯的組合數為 C(8,4) = 70,全對的機率為 1/70 ≈ 0.014,小於 0.05,達到統計顯著。 - (C):此敘述正確:p 值小於 α 時拒絕 H₀,統計上支持該女士確實具有分辨能力,推論程序無誤。 提示:檢定結論只有「拒絕」與「不拒絕」H₀,沒有「證明 H₀ 為真」;不顯著不等於沒有效果,可能只是樣本數不足、檢定力不夠。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第7題

某醫療AI研究團隊開發了一套個人化用藥劑量推薦系統,並設計實驗評估其效果。研究團隊招募 40 名高血壓患者,分別在導入 AI 推薦系統前後各測量一次收縮壓,且資料近似常態分布。研究目標是判斷同一批患者在依據 AI推薦調整用藥劑量前後,血壓是否有顯著差異。請問此研究情境應選用哪種統計檢定方法?

  1. A獨立樣本 t 檢定(Independent Samples t-test)
  2. B成對樣本 t 檢定(Paired Samples t-test)
  3. C單因子變異數分析(One-Way ANOVA)
  4. D魏克遜符號等級檢定(Wilcoxon Signed-Rank Test)
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 關鍵條件是「同一批 40 名患者、導入前後各測量一次」:同一受試者的前後測資料屬於成對(相依)樣本,應使用成對樣本 t 檢定。它先計算每位患者「前測 − 後測」的差值,再檢定差值的平均是否顯著異於 0,能扣除患者之間基準血壓的個體差異,統計檢定力高於把前後測視為兩組獨立資料的做法;資料近似常態也滿足 t 檢定的前提。 【為何其他選項錯了?】 - (A):獨立樣本 t 檢定假設兩組彼此無關;同一人的前後測高度相關,若視為獨立樣本,個體差異會混入誤差項,降低檢定力。 - (C):單因子 ANOVA 用於三組以上「獨立」組別的平均數比較;本題只有前後兩個相依時點,不適用。 - (D):Wilcoxon 符號等級檢定確實適用於成對設計,但它是資料「不符常態」時的無母數替代方案;題目已言明資料近似常態,首選仍是母數方法的成對 t 檢定。 提示:同一人前後測用成對 t 檢定;不同人分兩組用獨立 t 檢定;常態假設不成立時才改用 Wilcoxon。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第8題

某咖啡店聲稱其平均外送時間為 36 分鐘,母體標準差為 16 分鐘。顧客保護團體抽樣 9 筆訂單,發現平均外送時間為 40 分鐘。若採用右尾 Z 檢定(H₁: μ > 36),顯著水準 α = 0.05(臨界值 Z₀.₀₅ = 1.645),參考公式:Z = (x̄ − μ₀) / (σ / √n)。請問 Z 值與檢定結果為何?

  1. AZ ≈ 0.08,拒絕虛無假說
  2. BZ ≈ 0.08,不拒絕虛無假說
  3. CZ ≈ 0.75,拒絕虛無假說
  4. DZ ≈ 0.75,不拒絕虛無假說
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 代入公式 Z = (x̄ − μ₀) / (σ / √n):分子 = 40 − 36 = 4;分母 = 16 / √9 = 16 / 3 ≈ 5.33,故 Z = 4 ÷ 5.33 ≈ 0.75。右尾檢定的決策規則是 Z 大於臨界值才拒絕 H₀;0.75 < 1.645,落在不拒絕區,因此沒有足夠證據支持平均外送時間超過 36 分鐘。在僅抽樣 9 筆、母體標準差高達 16 分鐘的情況下,多出的 4 分鐘很可能只是抽樣波動。 【為何其他選項錯了?】 - (A):Z ≈ 0.08 是分母誤算的結果(如誤算成 4/48 ≈ 0.08);且即使 Z = 0.08 也遠小於 1.645,「拒絕」的結論同樣不成立。 - (B):Z 值計算錯誤,正確標準誤是 σ/√n = 16/3 ≈ 5.33,而非 48;雖然「不拒絕」的結論方向相同,但 Z 值錯誤即非正確選項。 - (C):Z ≈ 0.75 計算正確,但 0.75 小於臨界值 1.645,應為「不拒絕」;此選項在決策步驟判斷錯誤。 提示:標準誤是 σ/√n(除以根號 n);右尾檢定須 Z 大於臨界值才拒絕 H₀。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第9題

某生技公司正在進行新型 AI 輔助新藥篩選的臨床試驗,並將顯著水準由 α=0.05 降低至α=0.01。在新藥療效安全試驗的情境下,此調整對統計檢定的直接影響為何?

  1. A降低型二錯誤(Type II Error/β)的發生機率,減少未能偵測到有效藥物的風險
  2. B降低型一錯誤(Type I Error/α,偽陽性)的發生機率,減少將無效藥物誤判為有效並進入後續高成本試驗的風險
  3. C增加樣本數以提升統計功效(Statistical Power),進而改善估計精度
  4. D降低統計計算過程中的數值誤差,提高 p值的精確度
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 顯著水準 α 的定義就是「型一錯誤的機率上限」:在虛無假說為真(藥物其實無效)時,誤判為有效的機率。把 α 從 0.05 降至 0.01,直接效果是把偽陽性風險從 5% 壓低到 1%,降低「無效藥物被誤判有效、進入後續高成本試驗甚至危害病患」的機率。在新藥安全情境中,這是常見的保守設定,以更嚴格的門檻防止假療效通過檢定。 【為何其他選項錯了?】 - (A):方向相反。在樣本數不變的情況下,α 調小會使拒絕 H₀ 變難,型二錯誤 β 反而上升,更容易遺漏真正有效的藥物;α 與 β 存在此消彼長的抵換關係。 - (C):調整 α 本身不會自動增加樣本數;要在較小的 α 下維持統計功效,必須另外加大樣本數,那是研究設計的配套措施,不是降低 α 的直接影響。 - (D):α 是決策門檻,與數值計算精度或 p 值的準確性無關;p 值的計算結果不變,只是與更嚴格的門檻比較。 提示:α 是型一錯誤(偽陽性)上限;α 調小則偽陽性減少、但 β(偽陰性)上升,兩者為抵換關係。

相關節點