AI 方法論知識地圖 · 模型開發

資料探索 (EDA)

視覺化與統計分析

在互動地圖中開啟 回AI 方法論知識地圖

觀念教學

探索性資料分析 (EDA) 是理解資料的關鍵步驟,透過視覺化和統計分析,了解資料分佈、相關性與異常值,為後續處理提供依據。

📊 核心四大圖表

  • Histogram(直方圖):單一數值變數的分佈(常態、偏態)
  • Scatter Plot(散佈圖):兩個數值變數的關聯性(如坪數 vs 總價)
  • Box Plot(箱型圖):中位數與 IQR,最適合偵測異常值 Outliers
  • Heatmap(熱力圖):顏色深淺視覺化矩陣,常用於相關係數與共線性判斷

📈 延伸圖表

  • Bar Chart(長條圖):比較不同類別的數值大小
  • Line Chart(折線圖):呈現資料隨時間變化的趨勢
  • Pie Chart(圓餅圖):顯示各類別在整體中的佔比結構

應用場景

Histogram 直方圖Scatter Plot 散佈圖Box Plot 箱型圖Heatmap 熱力圖Bar Chart 長條圖Line Chart 折線圖Pie Chart 圓餅圖

iPAS 歷屆考題詳解(8 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第12題

下列哪一種圖表最適合用來呈現並分析「兩個數值型變數」之間的關係,例如觀察身高與體重的相關性?

  1. A散佈圖 (Scatter Plot)
  2. B折線圖 (Line Chart)
  3. C直方圖 (Histogram)
  4. D長條圖 (Bar Chart)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 題幹要求呈現「兩個數值型變數」之間的關係,例如身高與體重的相關性。散佈圖(Scatter Plot)以一個變數為 X 軸、另一個變數為 Y 軸,將每筆觀測值畫成平面上的一個點,可直接呈現兩變數間的正相關、負相關或無明顯關係,並能搭配趨勢線與相關係數輔助分析,是檢視雙數值變數關聯的標準圖表,故 (A) 正確。 【為何其他選項錯了?】 - (B):折線圖適合呈現具順序性的資料變化,例如時間序列的趨勢;身高與體重的觀測值之間沒有先後順序,連線並無意義,無法呈現相關性。 - (C):直方圖用於觀察「單一」連續變數的分布形態(集中程度、偏態、多峰),一次僅能處理一個變數,無法表達兩變數的關係。 - (D):長條圖用於比較不同「類別」之間的數值大小,例如各產品的銷售量;身高與體重皆為連續數值而非類別,不適用。 提示:兩個數值變數的關係用散佈圖;單一變數分布用直方圖;類別比較用長條圖;時間趨勢用折線圖。
第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第32題

在統計推論中,若樣本來自母體但呈現明顯偏態分布,且樣本數有限,下列哪一項策略最能減少推估母體參數的偏誤?

  1. A直接使用樣本平均數與變異數估計母體參數,不做任何調整
  2. B增加樣本數並考慮使用分位數或中位數作為中心趨勢估計
  3. C將樣本隨機重新排列後,多次計算平均值以消除偏態影響
  4. D完全依賴樣本標準差來估計母體參數,忽略分布形態
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 題幹條件是樣本呈明顯偏態且樣本數有限。偏態分布下,樣本平均數容易受極端值拉動,以其推估母體中心趨勢會產生偏誤;樣本數不足則使估計的不確定性升高。因此,增加樣本數可提升估計的穩定性,同時改用對極端值穩健(robust)的中位數或分位數作為中心趨勢估計,能降低偏態與極端值造成的推估偏誤,故 (B) 為最合適的策略。 【為何其他選項錯了?】 - (A):偏態資料不做任何調整,直接以樣本平均數與變異數推估母體參數,兩者皆易受極端值影響,偏誤正是此作法的直接後果。 - (C):隨機重新排列樣本只改變資料順序,不改變分布形態;排列法(Permutation)用於檢定顯著性,重排後多次計算平均值仍無法消除偏態的影響。 - (D):偏態分布下標準差同樣會被極端值放大,完全依賴標準差並忽略分布形態,會系統性高估離散程度,偏誤更大。 提示:偏態加小樣本的組合,思考方向是「增加樣本」與「改用穩健統計量(中位數、分位數)」;平均數與標準差在偏態下都不可靠。
第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第36題

某電商資料團隊要協助行銷部門規劃再行銷策略。目前取得資料包含使用者點擊、購買紀錄、流量來源與轉換率。若資料團隊希望先進行探索性資料分析(EDA),下列哪一項最符合 EDA 的做法?

  1. A建立隨機森林模型,預測使用者是否會完成購買
  2. B使用 K-means 對使用者群進行分群並立即制定對應促銷策略
  3. C繪製各類流量來源對轉換率的關聯圖,尋找潛在關係
  4. D對不同購物路徑設定統計假設並進行雙樣本 t 檢定
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 探索性資料分析(EDA)的目的,是在建模或決策之前,透過視覺化與描述統計了解資料的分布、模式、異常值與變數間的潛在關係,作為後續分析方向的依據。繪製各類流量來源對轉換率的關聯圖以尋找潛在關係,屬於以視覺化探索資料的行為,不涉及建模與決策,正是 EDA 的典型做法,故 (C) 正確。 【為何其他選項錯了?】 - (A):建立隨機森林模型預測購買行為屬於預測建模階段的工作,通常在 EDA 完成、對資料有基本理解之後才進行。 - (B):K-means 分群可作為探索工具,但「立即制定對應促銷策略」已進入決策執行,超出 EDA 的探索範疇。 - (D):設定統計假設並執行雙樣本 t 檢定屬於推論統計的驗證性分析,與 EDA「先觀察資料、再形成假設」的順序相反。 提示:EDA 的特徵是「看資料、找模式、不下結論」;選項中出現建模、決策或假設檢定,都已超出探索階段。
第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第48題

若希望檢視某一連續型數據的分布情形(如集中程度、偏態或是否呈現多峰),下列哪一種應用情境最適合使用直方圖(Histogram)來進行分析?

  1. A探討顧客年齡資料的整體分布特徵,並檢視是否存在異常集中或分散現象
  2. B比較不同商品在各月份的銷售額變化趨勢,以觀察季節性波動
  3. C追蹤公司近一年營收的時間序列變化,以了解整體成長趨勢
  4. D檢視產品價格與月銷售量之間的關聯性,以評估是否具線性相關
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 直方圖(Histogram)將連續數值切分為多個區間,統計各區間內的資料筆數,用於觀察單一連續變數的分布形態,包括集中程度、偏態與是否呈現多峰。顧客年齡屬連續資料,以直方圖檢視其整體分布特徵、辨識異常集中或分散現象,正是直方圖的標準應用情境,故 (A) 正確。 【為何其他選項錯了?】 - (B):比較不同商品在各月份的銷售額變化屬時間趨勢分析,適合折線圖;直方圖不呈現數值隨時間的變化。 - (C):追蹤近一年營收的時間序列變化,重點是趨勢走向,同樣應使用折線圖,而非分布圖。 - (D):檢視價格與銷售量兩個變數的關聯性,應使用散佈圖;直方圖一次僅能呈現單一變數的分布,無法表達兩變數關係。 提示:題幹關鍵詞「分布情形、集中程度、偏態、多峰」皆指向直方圖;出現「趨勢」選折線圖,「兩變數關聯」選散佈圖。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第15題

在資料處理中,下列何者屬於「結構化數據」的例子?

  1. A儲存在 MySQL 資料庫中的訂單記錄
  2. B以 JSON 格式儲存的商品訂單資訊
  3. C用 XML 標註的產品目錄
  4. D儲存在純文字檔案中的客服對話紀錄
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 結構化數據指依固定綱要(Schema)組織、以列與欄形式儲存的資料,每筆紀錄的欄位定義明確且一致。MySQL 是關聯式資料庫,以表格方式儲存資料,其中的訂單記錄具有固定欄位與資料型別,是結構化數據的典型範例,故 (A) 正確。 【名詞白話語典】 - 結構化數據(Structured Data):高度組織化、有固定綱要的資料,如關聯式資料庫中的表格。 - 半結構化數據(Semi-structured Data):具部分組織性但格式彈性的資料,以標籤或鍵值對描述結構,如 JSON 與 XML。 - 非結構化數據(Unstructured Data):沒有固定結構的資料,如純文字、圖片、音訊。 【為何其他選項錯了?】 - (B):JSON 以鍵值對(key-value pairs)描述資料,結構可任意巢狀與變化,屬半結構化數據。 - (C):XML 以標籤定義元素,格式彈性大,同屬半結構化數據。 - (D):純文字檔中的客服對話紀錄沒有固定欄位與綱要,屬非結構化數據。 提示:判斷依據是「綱要是否固定」;關聯式資料庫=結構化,JSON 與 XML=半結構化,純文字與影音=非結構化。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第16題

關於敘述性統計指標,下列敘述何者最為正確?

  1. A中位數(Median)能有效反映極端值對資料分佈的影響
  2. B標準差(Standard Deviation)越大,代表資料越集中
  3. C百分位數(Percentile)主要用於衡量資料在整體分布中的相對位置
  4. D平均值(Mean)適合描述偏態且包含離群值(Outliers)的資料
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 百分位數(Percentile)表示某數值在整體資料排序後所處的相對位置,例如成績位於第 90 百分位數,代表高於 90% 的觀測值。它衡量的正是資料點在整體分布中的相對位置,故 (C) 的敘述最為正確。 【名詞白話語典】 - 百分位數(Percentile):衡量位置的統計指標,用於了解某數值在整個群體中所處的水準。 【為何其他選項錯了?】 - (A):中位數是排序後位於中間的數值,特性是「不受」極端值影響;敘述稱其能反映極端值的影響,與其性質恰好相反。 - (B):標準差衡量資料的離散程度,數值越大代表資料越「分散」;敘述將方向寫反。 - (D):平均值易受離群值拉動,偏態或含離群值的資料應改用中位數描述中心趨勢;敘述稱平均值適合此類資料,並不正確。 提示:本題考統計量的基本性質:中位數抗極端值、標準差大代表分散、百分位數看相對位置、平均值怕離群值。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第17題

某企業資料分析人員需針對不同型態的數據選擇合適的視覺化工具。下列哪一種 情境最適合使用直方圖(Histogram)?

  1. A檢視顧客年齡資料在不同區間的集中情形
  2. B分析產品售價與銷售量之間的關聯程度
  3. C比較各產品類別的年度銷售總額
  4. D在地圖上標示各縣市加盟店的地理分布位置
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 直方圖(Histogram)用於視覺化單一連續變數的分布:將數值範圍切成若干區間,統計各區間內的資料筆數。檢視顧客年齡在不同區間的集中情形,例如 20 至 30 歲、30 至 40 歲各有多少人,正是直方圖的標準應用場景,故 (A) 正確。 【名詞白話語典】 - 直方圖(Histogram):觀察單一數值變數分布的圖表,X 軸為數值區間,Y 軸為該區間內的資料筆數(頻率)。 【為何其他選項錯了?】 - (B):分析售價與銷售量兩個變數之間的關聯程度,應使用散佈圖(Scatter Plot)。 - (C):比較各產品類別的年度銷售總額屬類別間的數值比較,應使用長條圖(Bar Chart)。 - (D):在地圖上標示各縣市加盟店的地理分布位置,應使用地圖視覺化(Map Visualization)。 提示:選圖表先辨資料型態:單一連續變數分布=直方圖,雙變數關聯=散佈圖,類別比較=長條圖,地理分布=地圖。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第46題

某市政府建置城市治理資料平台,需整合交通車流偵測資料、路口監視器影像, 以及民眾透過陳情系統提交的文字通報。由於各類資料格式、儲存方式與資料型 態差異甚大,導致資料清理與整合成本顯著增加。就大數據特性而言,此專案最 主要面臨下列哪一項挑戰?

  1. AVolume
  2. BVelocity
  3. CVariety
  4. DVeracity
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 題幹整合的資料包含交通車流偵測資料(結構化數值)、路口監視器影像(非結構化影像)與民眾文字通報(非結構化文本),痛點在於「格式、儲存方式與資料型態差異甚大」導致清理與整合成本增加。這正是大數據特性中多樣性(Variety)的典型挑戰:資料類型橫跨結構化與非結構化,需以不同技術處理,故 (C) 正確。 【名詞白話語典】 - Volume(容量):資料量非常巨大。 - Velocity(速度):資料生成與處理的速度非常快。 - Variety(多樣性):資料的類型與格式多樣,包含結構化、半結構化與非結構化資料。 - Veracity(真實性):資料的品質、準確性與可信度存在不確定性。 【為何其他選項錯了?】 - (A):Volume 指資料量規模帶來的挑戰;題幹強調的是格式與型態差異,而非資料量。 - (B):Velocity 指資料高速產生與即時處理的壓力;題幹並未以處理速度為核心痛點。 - (D):Veracity 指資料品質與可信度的問題;題幹描述的是異質資料的整合成本,而非資料真偽。 提示:抓題幹關鍵句「格式、儲存方式與資料型態差異甚大」,直接對應 Variety;數量對 Volume、速度對 Velocity、品質對 Veracity。

相關節點