資料知識地圖 · 5. 探索分析
相關 / 關聯
相關係數與關聯分析
觀念教學
兩個變數會不會「一起動」?相關分析幫你量化這件事 — 但它只說「同動」,從不說「誰造成誰」。
核心觀念
相關係數(Correlation Coefficient)介於 -1 到 +1,絕對值越大關係越強,正負代表方向。Pearson 相關衡量線性關係,適合連續變數但對離群值敏感;Spearman 相關改用名次計算,衡量單調關係,對離群值與非線性較穩健。搭配 p-value 確認相關是否統計顯著,避免被小樣本的巧合騙到。
白話理解
超商發現「冰品銷量」和「防曬乳銷量」高度相關 — 不是冰棒讓人想擦防曬,而是背後的氣溫同時推動兩者。這就是經典警語:相關不等於因果,背後常躲著混雜因子。
工具怎麼選
- 連續對連續、看線性:Pearson 相關係數
- 次序資料或有離群值:Spearman 等級相關
- 類別對類別:卡方檢定(Chi-square Test)檢驗兩變數是否獨立
- 非線性關係:互資訊(Mutual Information)能捕捉任意形式的依賴
- 相關係數接近 0 只代表「無線性相關」,仍可能存在 U 形這類非線性關係
🎯 口訣:Pearson 抓直線、Spearman 抓名次、卡方管類別 — 相關再高,都不等於因果。
iPAS 考點
三個常考點:一,給散佈圖或係數值,判斷關係的方向與強度;二,「兩個類別變數是否有關」,答案選卡方檢定;三,陷阱題給高相關情境誘導你選「A 導致 B」— 正解永遠是「相關不代表因果,需檢查混雜因子」。
應用場景
評估指標
iPAS 歷屆考題詳解(6 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某投資研究員希望分析四檔科技類股(A、B、C、D)每日報酬率的變化趨勢,以判斷這些股票之間是否存在高度相關性與共變動性,並評估投資組合分散風險的程度。若研究員希望以單一圖表快速呈現各股票間的關聯強度與方向,下列哪一種視覺化呈現方式最適合?
- A為每檔股票各自繪製直方圖(Histogram)以比較報酬率分佈
- B針對任兩檔股票繪製散佈圖並加上趨勢線(Regression Line)
- C使用雙軸折線圖(Dual-axis Line Chart)同時顯示四檔股價變化
- D熱力圖(Heatmap)配合相關係數矩陣(Correlation Matrix)
看正解與逐選項詳解
正解:D
某串流影音平台運用關聯規則學習(Association Rule Learning)分析用戶的觀影行為,發現若使用者觀看了科幻影集,則有較高機率接著觀看超級英雄電影。分析顯示,同時觀看這兩種類型的使用者約佔全部觀影紀錄的12%,而觀看科幻影集的使用者中,有 50%也觀看了超級英雄電影,該規則的提升度(Lift)為1.8。根據上述資訊,下列哪一項推論最為正確?
- A支持度(Support)過低,代表此規則不具任何商業價值
- B提升度(Lift)大於 1 表示兩種類型內容無關,僅屬於隨機重疊
- C信賴度(Confidence)為 50%,代表觀看科幻影集者有明顯傾向觀看超級英雄電影
- D同時觀看比例僅 12%,代表兩種類型互相排斥
看正解與逐選項詳解
正解:C
某行銷團隊想了解「廣告預算」與「銷售金額」之間的關聯程度。經繪製散佈圖後發現兩者呈現明顯線性趨勢,且資料中無明顯離群值(Outliers)。若希望衡量兩者之間線性關係的強度與方向,下列哪一種方法最適合?
- A均方根誤差(Root Mean Squared Error, RMSE)
- B共變異數(Covariance)
- C皮爾森相關係數(Pearson Correlation Coefficient)
- D平均絕對誤差(Mean Absolute Error, MAE)
看正解與逐選項詳解
正解:C
某零售企業的 AI工程師正在用關聯規則學習(Association Rule Learning)分析購物籃資料,評估商品 A 跟商品 B 之間同時購買的關係。關於「支援度(Support)」、「信賴度(Confidence)」、「提升度(Lift)」三個指標,下列敘述何者正確?
- A信賴度=P(A∩B),即A與B 同時出現的機率,範圍[0,1]
- B支援度=P(B|A),即 A出現時 B 也出現的條件機率,範圍[0,1]
- C提升度=P(A∩B) / [P(A)×P(B)],範圍固定在[0,1]之間
- D提升度=1 表示 A 與 B 獨立(無關聯),<1 表示負相關,>1 表示正向關聯,因此提升度並非數值愈大即代表關聯愈強
看正解與逐選項詳解
正解:D
某電商平台某時段的交易紀錄共 8 筆訂單,各單購買產品如下:單號1:{A, B, E};單號2:{C, D};單號3:{B, D, E};單號4:{A, B, E};單號5:{B, C, E};單號6:{A, D};單號7:{A};單號8:{A, D}。對此資料執行 Apriori 演算法,設定最低支援度(出現次數)為 3。請問最終保留下來的最大頻繁項目集為何?
- A{A}
- B{A, D}
- C{A, B, E}
- D{B, E}
看正解與逐選項詳解
正解:D
某AI工程師評估客戶滿意度評分(1–5分,含有明顯離群值)與退款率(連續型比例變數)之間的相關性,考慮使用皮爾森(Pearson)、斯皮爾曼(Spearman)或肯德爾(Kendall)相關係數。關於三者的特性比較,下列敘述何者不正確?
- A皮爾森衡量兩個連續變數間的線性關係強度;斯皮爾曼與肯德爾基於排名(Rank)計算,對非線性單調關係也適用
- B斯皮爾曼相關係數的計算公式等價於皮爾森,只是將原始數值替換為其排名後代入計算
- C與肯德爾相比,斯皮爾曼對離群值的穩健度更強
- D三者的數值範圍(相關係數區間)皆相同,均在[-1, 1]之間
看正解與逐選項詳解
正解:C