資料知識地圖 · 5. 探索分析

分佈 / 偏態

CDF / PDF / Skewness

在互動地圖中開啟 回資料知識地圖

觀念教學

建模前先問一句:這批資料長什麼樣?分佈(Distribution)就是資料的長相,而偏態告訴你它歪向哪一邊。

核心觀念

直方圖密度圖看形狀;PDF(機率密度函數)描述「每個值附近出現的相對可能性」,CDF(累積分佈函數)描述「小於等於某值的比例累積到多少」。兩個關鍵統計量:偏態(Skewness)量分佈歪斜的方向與程度,峰態(Kurtosis)量峰的尖銳度與尾巴厚度。

白話理解

台灣薪資資料是典型右偏(正偏):多數人集中在左側,少數高薪族群把右邊尾巴拉得很長,平均數被拉高、大於中位數。這時報「平均薪資」會失真,中位數才貼近多數人的感受。

判讀與處理

  • 右偏(偏態係數大於 0):尾巴在右,平均數大於中位數;常見於薪資、房價、消費金額
  • 左偏(偏態係數小於 0):尾巴在左,平均數小於中位數
  • 峰態係數高:高峰厚尾,極端值比常態分佈更常出現,做風險評估要特別小心
  • 判斷是否需要轉換:嚴重右偏可做對數轉換(取 log),讓分佈接近對稱,線性模型更好處理
  • CDF 的妙用:回答「前 80% 客戶的消費金額低於多少」這類累積型問題
🎯 口訣:尾巴指哪就偏哪 — 右偏平均大於中位,左偏剛好相反。

iPAS 考點

兩大題型:給「平均數與中位數的大小關係」判斷偏態方向(平均大於中位 = 右偏);給右偏情境問處理方式(對數轉換)。經典陷阱是把「右偏」誤解成資料堆在右邊 — 其實是尾巴在右邊,主體在左邊。

應用場景

直方圖密度圖Q-Q PlotBox Plot

評估指標

偏態係數峰態係數

iPAS 歷屆考題詳解(7 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第3題

某資料之分佈圖(直方圖搭配密度曲線)顯示:峰值位於 Value 約 40 處,分佈右側在 60 附近即快速下降截止,左側則有一條長尾一路延伸至約 -20。此資料之偏態(Skewness)值較有可能為下列哪個選項?

  1. ASkewness < 0
  2. BSkewness > 0
  3. CSkewness = 0
  4. D無法計算 Skewness
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 偏態(Skewness)的方向由長尾延伸的方向決定。本題分佈的峰值在右側(約 40 處),左側有一條長尾一路延伸至約 -20,屬於左偏(負偏)分佈,Skewness < 0。判斷要領:尾巴在左為負偏、尾巴在右為正偏,與峰的位置無關;峰看起來偏右,正是因為長尾被拉往左側,判讀時不可被峰的位置誤導。 【為何其他選項錯了?】 - (B):Skewness > 0 是右偏分佈,長尾應延伸向右側(大值方向),例如所得分配常見的右尾拖長形狀,與本圖相反。 - (C):Skewness = 0 代表左右對稱(如常態分佈);本圖左尾明顯長於右尾,並不對稱。 - (D):偏態是三階動差統計量,只要有數值資料即可計算,不存在「無法計算」的情形。 提示:偏態方向跟著尾巴走:左尾長為負偏(< 0),右尾長為正偏(> 0)。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第4題

累積分佈函數(Cumulative Distribution Function, CDF)可用於描述隨機變數的機率分佈特性,其數學定義為下列何者?

  1. A機率密度函數(Probability Density Function, PDF)的平均值
  2. B機率密度函數(Probability Density Function, PDF)的積分
  3. C機率密度函數(Probability Density Function, PDF)的離散總和
  4. D機率密度函數(Probability Density Function, PDF)的標準差
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 累積分佈函數 CDF 的定義是 F(x) = P(X ≤ x),即隨機變數小於等於 x 的機率。對連續型隨機變數而言,F(x) 等於機率密度函數 PDF 從負無窮大積分到 x 的結果;反過來說,PDF 是 CDF 的微分。這組「積分與微分」的互逆關係是機率論的基本性質,也是理解連續分佈的關鍵。 【為何其他選項錯了?】 - (A):PDF 的平均值並無對應的機率意義;期望值的定義是 x 乘上 f(x) 後積分,並非對密度函數本身取平均。 - (C):離散總和是離散型隨機變數以 PMF(機率質量函數)累加的做法;題目所指為 PDF(連續型),應使用積分而非加總。 - (D):標準差描述分佈的離散程度,與 CDF 的定義無關。 提示:連續型:CDF 為 PDF 的積分,PDF 為 CDF 的微分;離散型才以 PMF 加總。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第15題

某家客服中心統計資料發現,平均每小時會接到約 20通顧客來電,但每分鐘的來電數量不固定,可能為 0、1、2 通不等。這些來電事件彼此獨立,且在短時間內,發生的機率與時間長短成正比。若要以機率模型描述「每分鐘接到幾通來電」的機率分佈,下列哪一種最適合使用?

  1. A均勻分佈(Uniform distribution)
  2. B指數分佈(Exponential distribution)
  3. C卜瓦松分佈(Poisson distribution)
  4. D常態分佈(Normal distribution)
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 題目描述的正是卜瓦松分佈的經典適用條件:計數型隨機變數(每分鐘來電「幾通」)、事件彼此獨立、短時間內發生機率與時間長短成正比,且平均發生率固定(每小時約 20 通)。卜瓦松分佈專門描述「單位時間(或空間)內事件發生次數」的機率,如來電數、瑕疵數、事故數,本題情境完全符合。 【為何其他選項錯了?】 - (A):均勻分佈假設每個值出現機率相同,但各種來電數量的發生機率顯然不同,不符合情境。 - (B):指數分佈描述的是「兩次事件之間的等待時間」,屬連續型,而非「單位時間內的發生次數」(離散型);兩者是卜瓦松過程的一體兩面,須注意區分。 - (D):常態分佈是連續型且允許負值,來電數是非負整數的計數資料,本質不符;只有在平均數很大時才適合以常態近似。 提示:「單位時間發生幾次」用卜瓦松分佈;「等多久才發生下一次」用指數分佈。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第31題

某電商團隊觀察到,每位顧客對廣告推播的點擊行為可視為一次伯努利試驗(Bernoulli Trial),單次點擊成功機率為 p=0.4。當推播對象擴增至 5,000 位顧客時,團隊想快速預估「成功點擊總數」的分佈情形,以進行模型效能模擬與預測。若希望以常態分佈(Normal Distribution)近似原始分佈,下列哪一項判斷最為合理?

  1. A因樣本數極大,可直接以常態分佈近似二項分佈(Binomial Distribution)
  2. B只有當 np 與 n(1-p) 皆大於 5 時,才能以常態分佈作近似
  3. C常態近似只適用於 p=0.5 的情況
  4. D無論樣本數多大,二項分佈都不能以常態分佈近似
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 成功點擊總數服從二項分佈 B(n=5000, p=0.4)。二項分佈能否以常態近似,教科書判準是 np 與 n(1−p) 都要夠大(常用門檻為皆大於 5,部分教材採 10)。本題 np = 2000、n(1−p) = 3000,皆遠超門檻,近似成立。此條件同時考慮樣本數與機率的極端程度:n 很大但 p 極小時,np 仍可能很小,常態近似會失真,此時應改用卜瓦松近似。 【為何其他選項錯了?】 - (A):「樣本數極大即可直接近似」忽略了 p 的影響;若 p = 0.0001,n = 5000 時 np 僅 0.5,常態近似完全不適用。判準必須同時檢查 np 與 n(1−p),不能只看 n。 - (C):p = 0.5 只是近似效果最好的情況(分佈左右對稱),並非必要條件;只要 np 與 n(1−p) 夠大,p 偏離 0.5 仍可近似。 - (D):棣美弗-拉普拉斯定理(中央極限定理的特例)保證二項分佈在條件滿足時可用常態近似,「無論如何都不能」與理論相矛盾。 提示:二項分佈近似常態的判準:np > 5 且 n(1−p) > 5,兩個條件都要滿足,不能只看樣本數。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第42題

考慮某生產線每小時出現瑕疵品的個數符合卜瓦松分佈(Poisson Distribution),已知平均每小時產生 5 個瑕疵品,以下程式碼展示資料處理: import numpy as np from scipy.stats import poisson lambda_poisson = 5 print(poisson.pmf(5, lambda_poisson)) 請問下列敘述何者正確?

  1. Alambda_poisson = 5 表示每小時最多 5 個瑕疵品
  2. Bpoisson.pmf(5, lambda_poisson) 表示小於 5 個瑕疵品的機率
  3. C卜瓦松分佈的適用條件為事件彼此獨立,且平均發生率固定
  4. Dpoisson.cdf(10, 5) 表示大於或等於 10 個瑕疵品的機率
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 卜瓦松分佈的適用前提正是:事件彼此獨立發生、單位時間的平均發生率 λ 固定,且極短時間內最多發生一次事件。生產線瑕疵品計數符合這些條件,才能以 Poisson(λ=5) 建模,選項 (C) 敘述正確。另外說明,程式中 poisson.pmf(5, 5) 計算的是「恰好出現 5 個瑕疵品」的機率。 【為何其他選項錯了?】 - (A):λ 是「平均」發生次數,不是上限;每小時出現 8 個、10 個瑕疵品仍有發生機率,只是機率較低,把 λ 視為上限是對參數的誤解。 - (B):pmf(機率質量函數)計算的是「恰好等於 5 個」的機率;要計算「小於 5 個」應使用累積機率 poisson.cdf(4, 5)。 - (D):cdf(10, 5) 是 P(X ≤ 10),即「小於或等於 10 個」的累積機率;「大於或等於 10 個」應寫成 1 − poisson.cdf(9, 5),選項的方向與邊界皆錯誤。 提示:pmf 為恰好等於 k 的機率;cdf 為小於等於 k 的累積機率;λ 是平均次數而非上限。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第1題

工程師使用盒鬚圖(Box Plot)比較三個城市的房價分布,觀察到城市A的盒子很短但鬚很長,城市 B 的盒子很長且對稱,城市 C 的中位數位置明顯偏向盒子下方。依統計圖形判讀原則,下列敘述何者正確?

  1. A城市A中段房價集中但存在極端值;城市 C 中位數偏低,資料呈右偏分布
  2. B城市A房價集中且離群值少;城市 C 資料呈左偏分布
  3. C城市B 的盒子較長代表房價變異較大;城市 C 呈左偏分布
  4. D盒鬚圖無法判斷偏態,需搭配直方圖才能得出以上結論
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 盒鬚圖的盒子涵蓋第一四分位數(Q1)到第三四分位數(Q3),盒子短代表中間 50% 的房價集中;鬚很長代表資料整體範圍大、尾端存在遠離主體的極端值,城市A正是「中段集中但有極端值」的型態。城市C的中位數線靠近盒子下緣,表示下半部資料較密集、上半部延伸較開,屬於右偏(正偏)分布;此時平均數通常會被高價個案拉得比中位數高。 【為何其他選項錯了?】 - (B):「房價集中」只描述了盒子短的部分;鬚很長正暗示存在極端值或範圍大,「離群值少」與圖形特徵矛盾,且把城市C判為左偏也弄反了方向。 - (C):城市B盒子長代表變異大,此句正確;但城市C中位數偏向盒子下方屬右偏而非左偏,選項只要有一處錯誤即不成立。 - (D):盒鬚圖透過中位數在盒中的位置與上下鬚的長短即可判讀偏態方向,不需搭配直方圖;「無法判斷偏態」的敘述錯誤。 提示:中位數偏盒子下緣、上尾拉長為右偏;偏態方向依「長尾指向哪一側」判讀。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第3題

某物流平台要預測「每小時客服來電數量」,資料顯示平均每小時 12 通,且來電事件彼此獨立,並在固定時間區間內發生率穩定。工程師在選擇機率模型時,應優先考慮哪個分布?若實際資料的變異數明顯大於平均數,應如何調整?

  1. A使用常態分布(Normal Distribution);變異數偏大時改用 t 分布
  2. B使用卜瓦松分布(Poisson Distribution);變異數>平均數時改用負二項分布(Negative Binomial)
  3. C使用卜瓦松分布(Poisson Distribution);變異數偏大時增加樣本數即可修正
  4. D使用二項分布(Binomial Distribution);變異數偏大時改用卜瓦松分布(Poisson Dstribution)
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 「固定時間區間內的事件發生次數」、事件彼此獨立、發生率穩定,正是卜瓦松分布的三個經典假設,因此每小時來電數應優先以 Poisson(λ=12) 建模。卜瓦松分布有一項固定性質:平均數等於變異數(皆為 λ)。當實際資料的變異數明顯大於平均數,即出現過度離散(Overdispersion),表示卜瓦松假設不成立,標準做法是改用多一個離散參數的負二項分布(Negative Binomial)來吸收多出的變異。 【為何其他選項錯了?】 - (A):常態分布是連續分布,來電「次數」是非負整數的計數資料,分布型態的選擇即不正確;t 分布用於小樣本平均數推論,與過度離散問題無關。 - (C):前半句正確,但「增加樣本數」只會讓參數估計更精準,無法改變母體變異數大於平均數的事實;分布假設錯誤時,增加資料量並不能修正。 - (D):二項分布需要「固定試驗次數 n 與成功機率 p」,每小時來電數沒有天然的試驗次數上限;且修正方向顛倒,卜瓦松分布本身無法處理過度離散。 提示:計數資料優先考慮卜瓦松分布;變異數大於平均數(過度離散)時改用負二項分布。

相關節點