AI 方法論知識地圖 · 模型開發
資料探索 (EDA)
視覺化與統計分析
觀念教學
探索性資料分析 (EDA) 是理解資料的關鍵步驟,透過視覺化和統計分析,了解資料分佈、相關性與異常值,為後續處理提供依據。
📊 核心四大圖表
- Histogram(直方圖):單一數值變數的分佈(常態、偏態)
- Scatter Plot(散佈圖):兩個數值變數的關聯性(如坪數 vs 總價)
- Box Plot(箱型圖):中位數與 IQR,最適合偵測異常值 Outliers
- Heatmap(熱力圖):顏色深淺視覺化矩陣,常用於相關係數與共線性判斷
📈 延伸圖表
- Bar Chart(長條圖):比較不同類別的數值大小
- Line Chart(折線圖):呈現資料隨時間變化的趨勢
- Pie Chart(圓餅圖):顯示各類別在整體中的佔比結構
應用場景
iPAS 歷屆考題詳解(8 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
下列哪一種圖表最適合用來呈現並分析「兩個數值型變數」之間的關係,例如觀察身高與體重的相關性?
- A散佈圖 (Scatter Plot)
- B折線圖 (Line Chart)
- C直方圖 (Histogram)
- D長條圖 (Bar Chart)
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
題幹要求呈現「兩個數值型變數」之間的關係,例如身高與體重的相關性。散佈圖(Scatter Plot)以一個變數為 X 軸、另一個變數為 Y 軸,將每筆觀測值畫成平面上的一個點,可直接呈現兩變數間的正相關、負相關或無明顯關係,並能搭配趨勢線與相關係數輔助分析,是檢視雙數值變數關聯的標準圖表,故 (A) 正確。
【為何其他選項錯了?】
- (B):折線圖適合呈現具順序性的資料變化,例如時間序列的趨勢;身高與體重的觀測值之間沒有先後順序,連線並無意義,無法呈現相關性。
- (C):直方圖用於觀察「單一」連續變數的分布形態(集中程度、偏態、多峰),一次僅能處理一個變數,無法表達兩變數的關係。
- (D):長條圖用於比較不同「類別」之間的數值大小,例如各產品的銷售量;身高與體重皆為連續數值而非類別,不適用。
提示:兩個數值變數的關係用散佈圖;單一變數分布用直方圖;類別比較用長條圖;時間趨勢用折線圖。
在統計推論中,若樣本來自母體但呈現明顯偏態分布,且樣本數有限,下列哪一項策略最能減少推估母體參數的偏誤?
- A直接使用樣本平均數與變異數估計母體參數,不做任何調整
- B增加樣本數並考慮使用分位數或中位數作為中心趨勢估計
- C將樣本隨機重新排列後,多次計算平均值以消除偏態影響
- D完全依賴樣本標準差來估計母體參數,忽略分布形態
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
題幹條件是樣本呈明顯偏態且樣本數有限。偏態分布下,樣本平均數容易受極端值拉動,以其推估母體中心趨勢會產生偏誤;樣本數不足則使估計的不確定性升高。因此,增加樣本數可提升估計的穩定性,同時改用對極端值穩健(robust)的中位數或分位數作為中心趨勢估計,能降低偏態與極端值造成的推估偏誤,故 (B) 為最合適的策略。
【為何其他選項錯了?】
- (A):偏態資料不做任何調整,直接以樣本平均數與變異數推估母體參數,兩者皆易受極端值影響,偏誤正是此作法的直接後果。
- (C):隨機重新排列樣本只改變資料順序,不改變分布形態;排列法(Permutation)用於檢定顯著性,重排後多次計算平均值仍無法消除偏態的影響。
- (D):偏態分布下標準差同樣會被極端值放大,完全依賴標準差並忽略分布形態,會系統性高估離散程度,偏誤更大。
提示:偏態加小樣本的組合,思考方向是「增加樣本」與「改用穩健統計量(中位數、分位數)」;平均數與標準差在偏態下都不可靠。
某電商資料團隊要協助行銷部門規劃再行銷策略。目前取得資料包含使用者點擊、購買紀錄、流量來源與轉換率。若資料團隊希望先進行探索性資料分析(EDA),下列哪一項最符合 EDA 的做法?
- A建立隨機森林模型,預測使用者是否會完成購買
- B使用 K-means 對使用者群進行分群並立即制定對應促銷策略
- C繪製各類流量來源對轉換率的關聯圖,尋找潛在關係
- D對不同購物路徑設定統計假設並進行雙樣本 t 檢定
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
探索性資料分析(EDA)的目的,是在建模或決策之前,透過視覺化與描述統計了解資料的分布、模式、異常值與變數間的潛在關係,作為後續分析方向的依據。繪製各類流量來源對轉換率的關聯圖以尋找潛在關係,屬於以視覺化探索資料的行為,不涉及建模與決策,正是 EDA 的典型做法,故 (C) 正確。
【為何其他選項錯了?】
- (A):建立隨機森林模型預測購買行為屬於預測建模階段的工作,通常在 EDA 完成、對資料有基本理解之後才進行。
- (B):K-means 分群可作為探索工具,但「立即制定對應促銷策略」已進入決策執行,超出 EDA 的探索範疇。
- (D):設定統計假設並執行雙樣本 t 檢定屬於推論統計的驗證性分析,與 EDA「先觀察資料、再形成假設」的順序相反。
提示:EDA 的特徵是「看資料、找模式、不下結論」;選項中出現建模、決策或假設檢定,都已超出探索階段。
若希望檢視某一連續型數據的分布情形(如集中程度、偏態或是否呈現多峰),下列哪一種應用情境最適合使用直方圖(Histogram)來進行分析?
- A探討顧客年齡資料的整體分布特徵,並檢視是否存在異常集中或分散現象
- B比較不同商品在各月份的銷售額變化趨勢,以觀察季節性波動
- C追蹤公司近一年營收的時間序列變化,以了解整體成長趨勢
- D檢視產品價格與月銷售量之間的關聯性,以評估是否具線性相關
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
直方圖(Histogram)將連續數值切分為多個區間,統計各區間內的資料筆數,用於觀察單一連續變數的分布形態,包括集中程度、偏態與是否呈現多峰。顧客年齡屬連續資料,以直方圖檢視其整體分布特徵、辨識異常集中或分散現象,正是直方圖的標準應用情境,故 (A) 正確。
【為何其他選項錯了?】
- (B):比較不同商品在各月份的銷售額變化屬時間趨勢分析,適合折線圖;直方圖不呈現數值隨時間的變化。
- (C):追蹤近一年營收的時間序列變化,重點是趨勢走向,同樣應使用折線圖,而非分布圖。
- (D):檢視價格與銷售量兩個變數的關聯性,應使用散佈圖;直方圖一次僅能呈現單一變數的分布,無法表達兩變數關係。
提示:題幹關鍵詞「分布情形、集中程度、偏態、多峰」皆指向直方圖;出現「趨勢」選折線圖,「兩變數關聯」選散佈圖。
在資料處理中,下列何者屬於「結構化數據」的例子?
- A儲存在 MySQL 資料庫中的訂單記錄
- B以 JSON 格式儲存的商品訂單資訊
- C用 XML 標註的產品目錄
- D儲存在純文字檔案中的客服對話紀錄
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
結構化數據指依固定綱要(Schema)組織、以列與欄形式儲存的資料,每筆紀錄的欄位定義明確且一致。MySQL 是關聯式資料庫,以表格方式儲存資料,其中的訂單記錄具有固定欄位與資料型別,是結構化數據的典型範例,故 (A) 正確。
【名詞白話語典】
- 結構化數據(Structured Data):高度組織化、有固定綱要的資料,如關聯式資料庫中的表格。
- 半結構化數據(Semi-structured Data):具部分組織性但格式彈性的資料,以標籤或鍵值對描述結構,如 JSON 與 XML。
- 非結構化數據(Unstructured Data):沒有固定結構的資料,如純文字、圖片、音訊。
【為何其他選項錯了?】
- (B):JSON 以鍵值對(key-value pairs)描述資料,結構可任意巢狀與變化,屬半結構化數據。
- (C):XML 以標籤定義元素,格式彈性大,同屬半結構化數據。
- (D):純文字檔中的客服對話紀錄沒有固定欄位與綱要,屬非結構化數據。
提示:判斷依據是「綱要是否固定」;關聯式資料庫=結構化,JSON 與 XML=半結構化,純文字與影音=非結構化。
關於敘述性統計指標,下列敘述何者最為正確?
- A中位數(Median)能有效反映極端值對資料分佈的影響
- B標準差(Standard Deviation)越大,代表資料越集中
- C百分位數(Percentile)主要用於衡量資料在整體分布中的相對位置
- D平均值(Mean)適合描述偏態且包含離群值(Outliers)的資料
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
百分位數(Percentile)表示某數值在整體資料排序後所處的相對位置,例如成績位於第 90 百分位數,代表高於 90% 的觀測值。它衡量的正是資料點在整體分布中的相對位置,故 (C) 的敘述最為正確。
【名詞白話語典】
- 百分位數(Percentile):衡量位置的統計指標,用於了解某數值在整個群體中所處的水準。
【為何其他選項錯了?】
- (A):中位數是排序後位於中間的數值,特性是「不受」極端值影響;敘述稱其能反映極端值的影響,與其性質恰好相反。
- (B):標準差衡量資料的離散程度,數值越大代表資料越「分散」;敘述將方向寫反。
- (D):平均值易受離群值拉動,偏態或含離群值的資料應改用中位數描述中心趨勢;敘述稱平均值適合此類資料,並不正確。
提示:本題考統計量的基本性質:中位數抗極端值、標準差大代表分散、百分位數看相對位置、平均值怕離群值。
某企業資料分析人員需針對不同型態的數據選擇合適的視覺化工具。下列哪一種 情境最適合使用直方圖(Histogram)?
- A檢視顧客年齡資料在不同區間的集中情形
- B分析產品售價與銷售量之間的關聯程度
- C比較各產品類別的年度銷售總額
- D在地圖上標示各縣市加盟店的地理分布位置
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
直方圖(Histogram)用於視覺化單一連續變數的分布:將數值範圍切成若干區間,統計各區間內的資料筆數。檢視顧客年齡在不同區間的集中情形,例如 20 至 30 歲、30 至 40 歲各有多少人,正是直方圖的標準應用場景,故 (A) 正確。
【名詞白話語典】
- 直方圖(Histogram):觀察單一數值變數分布的圖表,X 軸為數值區間,Y 軸為該區間內的資料筆數(頻率)。
【為何其他選項錯了?】
- (B):分析售價與銷售量兩個變數之間的關聯程度,應使用散佈圖(Scatter Plot)。
- (C):比較各產品類別的年度銷售總額屬類別間的數值比較,應使用長條圖(Bar Chart)。
- (D):在地圖上標示各縣市加盟店的地理分布位置,應使用地圖視覺化(Map Visualization)。
提示:選圖表先辨資料型態:單一連續變數分布=直方圖,雙變數關聯=散佈圖,類別比較=長條圖,地理分布=地圖。
某市政府建置城市治理資料平台,需整合交通車流偵測資料、路口監視器影像, 以及民眾透過陳情系統提交的文字通報。由於各類資料格式、儲存方式與資料型 態差異甚大,導致資料清理與整合成本顯著增加。就大數據特性而言,此專案最 主要面臨下列哪一項挑戰?
- AVolume
- BVelocity
- CVariety
- DVeracity
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
題幹整合的資料包含交通車流偵測資料(結構化數值)、路口監視器影像(非結構化影像)與民眾文字通報(非結構化文本),痛點在於「格式、儲存方式與資料型態差異甚大」導致清理與整合成本增加。這正是大數據特性中多樣性(Variety)的典型挑戰:資料類型橫跨結構化與非結構化,需以不同技術處理,故 (C) 正確。
【名詞白話語典】
- Volume(容量):資料量非常巨大。
- Velocity(速度):資料生成與處理的速度非常快。
- Variety(多樣性):資料的類型與格式多樣,包含結構化、半結構化與非結構化資料。
- Veracity(真實性):資料的品質、準確性與可信度存在不確定性。
【為何其他選項錯了?】
- (A):Volume 指資料量規模帶來的挑戰;題幹強調的是格式與型態差異,而非資料量。
- (B):Velocity 指資料高速產生與即時處理的壓力;題幹並未以處理速度為核心痛點。
- (D):Veracity 指資料品質與可信度的問題;題幹描述的是異質資料的整合成本,而非資料真偽。
提示:抓題幹關鍵句「格式、儲存方式與資料型態差異甚大」,直接對應 Variety;數量對 Volume、速度對 Velocity、品質對 Veracity。