資料知識地圖 · 5. 探索分析
5. 探索分析
EDA & Descriptive Statistics
觀念教學
拿到資料先別急著建模 — 先「摸熟它」。探索性資料分析(EDA, Exploratory Data Analysis)就是你和資料的第一次深度對話:看長相、找關係、抓異常。
核心觀念
EDA 搭配敘述性統計(Descriptive Statistics)描述資料現況:集中趨勢(平均數、中位數)、離散程度(標準差、四分位距),再用分佈、偏態、CDF/PDF 理解資料長相。目的不是下結論,而是產生假設,決定後續怎麼清理、怎麼建模。這一站的成果,用洞察數量與報告品質來衡量。
白話理解
零售團隊拿到兩年銷售資料:先畫直方圖看營收分佈,再算相關看「來客數與營收」是否連動,最後用散佈圖做群聚初探,看客群會不會自然分成幾群。這些圖表匯整起來,就是給老闆看的第一版洞察。
探索的四個動作
- 看分佈:直方圖、CDF/PDF、偏態,判斷資料長相與是否需要轉換
- 找關聯:相關係數、交叉分析,找出變數之間的關係
- 群聚初探:觀察資料是否自然分群,為後續分群建模鋪路
- 視覺化:圖表傳達初步洞察,匯整成 Dashboard 與報告雛形
🎯 口訣:先描述、再探索 — 看長相、找關係、抓群聚、畫出來。
iPAS 考點
最愛考分析四層次:描述性(發生了什麼)、診斷性(為什麼發生)、預測性(Predictive,接下來會怎樣)、處方性(該怎麼做)。題目給四個部門對營運與銷售資料的分析需求,問哪個最接近預測性分析 — 判斷關鍵字是「預測下一季、估計未來、可能性」;報告歷史現況的是描述性,直接給行動建議的是處方性,別選錯層。
📝 本節掛載 1 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。
應用場景
評估指標
iPAS 歷屆考題詳解(7 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某企業分析團隊正在處理一組近兩年的營運與銷售數據,共有四個部門提出了各自的分析需求,請判斷哪一個最接近「預測性分析(Predictive Analysis)」的特性?
- A視覺化所有產品線過去月銷售走勢與標準差,觀察其分佈情況與波動程度
- B藉由資料比對分析,找出去年母親節促銷失效的地區與品類組合
- C建構模型推算下一季的主力商品銷量,以規劃備貨與倉儲資源配置
- D透過熱圖分析廣告投放成本與訂單轉換率之間的潛在關聯性
看正解與逐選項詳解
正解:C
使用Python的 pandas套件處理各商品銷售數據(變數為 df)時,若需計算「總銷售額」欄位的敘述性統計量(如平均值、標準差等),應使用下列哪一種語法?
- Adf['總銷售額'].sum()
- Bdf['總銷售額'].describe()
- Cdf['總銷售額'].sort_values()
- Ddf['總銷售額'].stats()
看正解與逐選項詳解
正解:B
某金融科技公司分析每日上億筆交易資料,以監控客戶轉帳金額分佈與異常波動。由於資料量極大,為兼顧效率與準確度,團隊決定採用「近似分位數(Approximate Quantile)」方法進行資料摘要統計。下列何者最能正確反映該技術的核心目的?
- A確保每個分位值的結果完全精確,即使計算時間較長
- B利用機器學習模型預測分位數位置,以減少統計計算量
- C僅能對結構化資料進行批次處理,無法應用於即時資料流
- D在可容忍誤差範圍內,快速估算分位值以支援即時分析
看正解與逐選項詳解
正解:D
某遊戲銷售資料集(DataFrame 變數為 data)包含 Platform(遊戲平台)與 Global_Sales(全球銷售量,單位:百萬份)等欄位。為了觀察各遊戲平台的市場表現,分析師想要統計每個平台的全球銷售總額,並以長條圖呈現。請選出最能正確實現此分析的程式碼。
- Adata.groupby("Platform")["Global_Sales"].sum().plot(kind="bar")
- Bdata.groupby("Platform")["Global_Sales"].count().plot(kind="bar")
- Cdata["Platform"].value_counts().plot(kind="bar")
- Ddata.groupby("Platform")["Global_Sales"].mean().plot(kind="bar")
看正解與逐選項詳解
正解:A
使用行銷資料集 marketing.csv 進行分析,以 df = pd.read_csv("marketing.csv") 載入後,執行 df.describe() 得到以下輸出(數值依序為 youtube、facebook、newspaper、sales 四個欄位): count:200.00、199.00、200.00、200.00 mean:176.451、27.820、36.665、16.827 std:103.025、17.808、26.134、6.261 min:0.84、0.00、0.36、1.92 25%:89.25、11.94、15.30、12.45 50%:179.70、27.00、30.90、15.48 75%:262.59、43.68、54.12、20.88 max:355.68、59.52、136.80、32.40 根據上述結果,下列何者正確?
- A資料集個數為 199 筆,變數個數為 4 個
- Bsales 變數的中位數是 16.827
- Cfacebook 變數的第三四分位數(Q3)是 11.94
- Dyoutube 變數的第一四分位數(Q1)是 89.25
看正解與逐選項詳解
正解:D
若分析師想找出「總貢獻營收最高的前 3 名客戶」,下列 Pandas 程式碼何者最為精確且高效?
- Adf.sort_values('Revenue', ascending=False).head(3)['CustomerID']
- Bdf.groupby('CustomerID')['Revenue'].max().head(3)
- Cdf.groupby('CustomerID')['Revenue'].sum().nlargest(3)
- Ddf.value_counts('CustomerID').head(3)
看正解與逐選項詳解
正解:C
若分析師只想計算「Electronics(電子產品)」這個特定分類的平均營收,下列何者為最佳的語法?
- Adf[df['Category'] == 'Electronics']['Revenue'].mean()
- Bdf['Category' == 'Electronics']['Revenue'].mean()
- Cdf.loc['Electronics', 'Revenue'].mean()
- Ddf.filter(items=['Electronics'])['Revenue'].mean()
看正解與逐選項詳解
正解:A