資料知識地圖 · 5. 探索分析

相關 / 關聯

相關係數與關聯分析

在互動地圖中開啟 回資料知識地圖

觀念教學

兩個變數會不會「一起動」?相關分析幫你量化這件事 — 但它只說「同動」,從不說「誰造成誰」。

核心觀念

相關係數(Correlation Coefficient)介於 -1 到 +1,絕對值越大關係越強,正負代表方向。Pearson 相關衡量線性關係,適合連續變數但對離群值敏感;Spearman 相關改用名次計算,衡量單調關係,對離群值與非線性較穩健。搭配 p-value 確認相關是否統計顯著,避免被小樣本的巧合騙到。

白話理解

超商發現「冰品銷量」和「防曬乳銷量」高度相關 — 不是冰棒讓人想擦防曬,而是背後的氣溫同時推動兩者。這就是經典警語:相關不等於因果,背後常躲著混雜因子。

工具怎麼選

  • 連續對連續、看線性:Pearson 相關係數
  • 次序資料或有離群值:Spearman 等級相關
  • 類別對類別:卡方檢定(Chi-square Test)檢驗兩變數是否獨立
  • 非線性關係:互資訊(Mutual Information)能捕捉任意形式的依賴
  • 相關係數接近 0 只代表「無線性相關」,仍可能存在 U 形這類非線性關係
🎯 口訣:Pearson 抓直線、Spearman 抓名次、卡方管類別 — 相關再高,都不等於因果。

iPAS 考點

三個常考點:一,給散佈圖或係數值,判斷關係的方向與強度;二,「兩個類別變數是否有關」,答案選卡方檢定;三,陷阱題給高相關情境誘導你選「A 導致 B」— 正解永遠是「相關不代表因果,需檢查混雜因子」。

應用場景

相關矩陣散佈圖熱力圖配對圖

評估指標

相關係數p-value

iPAS 歷屆考題詳解(6 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第22題

某投資研究員希望分析四檔科技類股(A、B、C、D)每日報酬率的變化趨勢,以判斷這些股票之間是否存在高度相關性與共變動性,並評估投資組合分散風險的程度。若研究員希望以單一圖表快速呈現各股票間的關聯強度與方向,下列哪一種視覺化呈現方式最適合?

  1. A為每檔股票各自繪製直方圖(Histogram)以比較報酬率分佈
  2. B針對任兩檔股票繪製散佈圖並加上趨勢線(Regression Line)
  3. C使用雙軸折線圖(Dual-axis Line Chart)同時顯示四檔股價變化
  4. D熱力圖(Heatmap)配合相關係數矩陣(Correlation Matrix)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 需求是以「單一圖表」同時呈現「四檔股票兩兩之間」的關聯強度與方向。四檔股票共有 6 組配對,先計算相關係數矩陣,再以熱力圖用顏色深淺編碼強度、色系區分正負,一張圖即可完整呈現 6 組關係,也能直接檢視投資組合的分散程度(相關性越低越分散),是多變數相關分析的標準呈現方式。 【為何其他選項錯了?】 - (A):直方圖只能觀察「單檔」報酬率的分佈形狀,無法呈現股票「之間」的關聯。 - (B):散佈圖加趨勢線一次只能觀察一對股票,6 組配對需要 6 張圖,不符合「單一圖表快速呈現」的要求。 - (C):雙軸折線圖顯示的是價格時間序列,「看起來同漲同跌」只是主觀印象,無法量化關聯強度與方向,且四條序列擠在兩條軸上判讀困難。 提示:多變數兩兩相關用相關係數矩陣加熱力圖;單變數分佈用直方圖;單一配對關係用散佈圖。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第26題

某串流影音平台運用關聯規則學習(Association Rule Learning)分析用戶的觀影行為,發現若使用者觀看了科幻影集,則有較高機率接著觀看超級英雄電影。分析顯示,同時觀看這兩種類型的使用者約佔全部觀影紀錄的12%,而觀看科幻影集的使用者中,有 50%也觀看了超級英雄電影,該規則的提升度(Lift)為1.8。根據上述資訊,下列哪一項推論最為正確?

  1. A支持度(Support)過低,代表此規則不具任何商業價值
  2. B提升度(Lift)大於 1 表示兩種類型內容無關,僅屬於隨機重疊
  3. C信賴度(Confidence)為 50%,代表觀看科幻影集者有明顯傾向觀看超級英雄電影
  4. D同時觀看比例僅 12%,代表兩種類型互相排斥
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 三個指標各有定義:支持度(Support)12% 表示兩類內容同時出現於全部紀錄的比例;信賴度(Confidence)50% 表示「觀看科幻影集者中有一半也觀看超級英雄電影」,呈現明顯的條件傾向;提升度(Lift)1.8 大於 1,表示這種共同觀看並非隨機巧合,而是比兩者獨立時高出 80% 的正向關聯。選項 (C) 對信賴度的解讀正確,且與提升度的訊息互相印證。 【為何其他選項錯了?】 - (A):支持度 12% 在推薦情境並不算低(約每 8 筆紀錄即有 1 筆),且商業價值須與信賴度、提升度合併判讀,不能僅憑支持度否定規則價值。 - (B):敘述方向相反:提升度等於 1 才代表兩者獨立無關;大於 1 代表正相關,1.8 屬於相當明確的正向關聯。 - (D):「互相排斥」意味著幾乎不同時出現且提升度小於 1;本題有 12% 的共現比例加上提升度 1.8,與互斥的特徵完全相反。 提示:Lift = 1 為獨立、> 1 為正相關、< 1 為負相關;Confidence 是條件機率 P(B|A),Support 是共同出現比例。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第30題

某行銷團隊想了解「廣告預算」與「銷售金額」之間的關聯程度。經繪製散佈圖後發現兩者呈現明顯線性趨勢,且資料中無明顯離群值(Outliers)。若希望衡量兩者之間線性關係的強度與方向,下列哪一種方法最適合?

  1. A均方根誤差(Root Mean Squared Error, RMSE)
  2. B共變異數(Covariance)
  3. C皮爾森相關係數(Pearson Correlation Coefficient)
  4. D平均絕對誤差(Mean Absolute Error, MAE)
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 皮爾森相關係數(Pearson Correlation Coefficient)專門用於衡量兩連續變數線性關係的強度與方向:值域為 −1 到 1,正負號表示方向,絕對值表示強度,且無單位、不受變數尺度影響。題目已確認兩變數關係近似線性且無明顯離群值,完全符合皮爾森相關係數的適用前提。 【為何其他選項錯了?】 - (A):RMSE 是預測模型的誤差指標,衡量預測值與實際值的差距,前提是已建立模型;它不衡量兩變數之間的關聯。 - (B):共變異數的正負號可表示方向,但數值大小受變數單位影響(金額單位由元改為萬元,共變異數即隨之改變),無法標準化比較「強度」;相關係數正是共變異數除以兩變數標準差後的標準化版本。 - (D):MAE 同樣是模型誤差指標,與變數間關聯強度無關。 提示:「兩變數線性關聯的強度與方向」對應皮爾森相關係數;共變異數只有方向、缺乏可比較的強度。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第18題

某零售企業的 AI工程師正在用關聯規則學習(Association Rule Learning)分析購物籃資料,評估商品 A 跟商品 B 之間同時購買的關係。關於「支援度(Support)」、「信賴度(Confidence)」、「提升度(Lift)」三個指標,下列敘述何者正確?

  1. A信賴度=P(A∩B),即A與B 同時出現的機率,範圍[0,1]
  2. B支援度=P(B|A),即 A出現時 B 也出現的條件機率,範圍[0,1]
  3. C提升度=P(A∩B) / [P(A)×P(B)],範圍固定在[0,1]之間
  4. D提升度=1 表示 A 與 B 獨立(無關聯),<1 表示負相關,>1 表示正向關聯,因此提升度並非數值愈大即代表關聯愈強
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 提升度 Lift(A→B) = P(A∩B) / [P(A)×P(B)] = Confidence(A→B) / P(B),衡量「A 出現後 B 出現的機率」相對於「B 本身出現機率」的放大倍數。Lift = 1 代表 A 與 B 統計獨立;大於 1 為正向關聯;小於 1 為負相關。但 Lift 高不必然代表關聯強而可靠:當支援度極低(例如兩件冷門商品偶然同時購買一次)時,Lift 可能極高卻無商業意義,因此實務上須將 Support、Confidence、Lift 三個指標合併判讀,選項 (D) 的敘述完整且正確。 【為何其他選項錯了?】 - (A):P(A∩B) 是「支援度」的定義;信賴度是條件機率 P(B|A),此選項把兩個指標的定義互換了。 - (B):P(B|A) 是「信賴度」的定義;支援度才是 A 與 B 同時出現的比例,與選項 (A) 同樣是定義對調的錯誤。 - (C):提升度的範圍是 [0, ∞),不是 [0,1];它是機率比值,大於 1 是常見情形,「固定在 0 到 1 之間」的敘述錯誤。 提示:Support 為同現比例、Confidence 為 P(B|A)、Lift 為相對獨立情形的放大倍率(= 1 表獨立);Lift 高還需 Support 足夠才有實務意義。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第19題

某電商平台某時段的交易紀錄共 8 筆訂單,各單購買產品如下:單號1:{A, B, E};單號2:{C, D};單號3:{B, D, E};單號4:{A, B, E};單號5:{B, C, E};單號6:{A, D};單號7:{A};單號8:{A, D}。對此資料執行 Apriori 演算法,設定最低支援度(出現次數)為 3。請問最終保留下來的最大頻繁項目集為何?

  1. A{A}
  2. B{A, D}
  3. C{A, B, E}
  4. D{B, E}
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 先計算單項出現次數:A 出現於單號 1、4、6、7、8 共 5 次;B 於 1、3、4、5 共 4 次;C 於 2、5 共 2 次;D 於 2、3、6、8 共 4 次;E 於 1、3、4、5 共 4 次。C 未達 3 次先遭淘汰,頻繁 1-項集為 {A}{B}{D}{E}。再組 2-項集並計數:{A,B}=2(單號1、4)、{A,D}=2(單號6、8)、{A,E}=2(單號1、4)、{B,D}=1(單號3)、{B,E}=4(單號1、3、4、5)、{D,E}=1(單號3)。只有 {B,E} 達到門檻 3;頻繁 2-項集僅剩一個,無法再組 3-項集,演算法終止,最大頻繁項目集即為 {B, E}。 【為何其他選項錯了?】 - (A):{A} 支援度 5 確實頻繁,但它只是 1-項集;既然存在頻繁的 2-項集 {B,E},最大頻繁項目集就不會是 {A}。 - (B):{A, D} 僅同時出現於單號 6、8,支援度 2,未達門檻 3,於 2-項集階段即被淘汰。 - (C):{A, B, E} 僅出現於單號 1、4,支援度 2;且其子集 {A,B} 與 {A,E} 皆不頻繁,依 Apriori 性質根本不會成為候選。 提示:Apriori 反單調性:頻繁項目集的所有子集必為頻繁;逐層淘汰後,保留下來的最長項目集即為最大頻繁項目集。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第24題

某AI工程師評估客戶滿意度評分(1–5分,含有明顯離群值)與退款率(連續型比例變數)之間的相關性,考慮使用皮爾森(Pearson)、斯皮爾曼(Spearman)或肯德爾(Kendall)相關係數。關於三者的特性比較,下列敘述何者不正確?

  1. A皮爾森衡量兩個連續變數間的線性關係強度;斯皮爾曼與肯德爾基於排名(Rank)計算,對非線性單調關係也適用
  2. B斯皮爾曼相關係數的計算公式等價於皮爾森,只是將原始數值替換為其排名後代入計算
  3. C與肯德爾相比,斯皮爾曼對離群值的穩健度更強
  4. D三者的數值範圍(相關係數區間)皆相同,均在[-1, 1]之間
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 本題選「不正確」的敘述。一般認定與選項 (C) 恰好相反:肯德爾(Kendall's tau)比斯皮爾曼(Spearman's rho)更穩健。Kendall 只計算配對之間的一致與不一致(concordant/discordant pairs),單一離群值只影響它所參與配對的方向;Spearman 雖然也使用排名,但公式含有「排名差的平方」,極端值造成的大排名差會被平方放大,對離群值與誤差相對敏感。因此「斯皮爾曼比肯德爾更穩健」是不正確的敘述,即為本題答案。 【為何其他選項錯了?】 - (A):此敘述正確:Pearson 衡量線性關係;Spearman 與 Kendall 基於排名,凡單調關係(不必線性)皆能捕捉,對含離群值的滿意度評分較合適,故不是本題要選的錯誤敘述。 - (B):此敘述正確:Spearman 的定義就是「將原始數值換成排名後計算 Pearson 相關係數」,兩者公式等價。 - (D):此敘述正確:三者的取值範圍皆為 [-1, 1],正負代表方向、絕對值代表強度。 提示:離群值多時採用排名相關;穩健度排序為 Kendall ≥ Spearman > Pearson;Spearman 等於排名版的 Pearson。

相關節點