資料知識地圖 · 5. 探索分析

視覺化

圖表與報告雛形

在互動地圖中開啟 回資料知識地圖

觀念教學

分析做得再深,對方看不懂就等於沒做。視覺化是把洞察「翻譯」成一眼能懂的圖 — 它是溝通工具,不是美工。

核心觀念

資料視覺化(Data Visualization)的核心原則是「圖表類型要配問題類型」:選錯圖,再漂亮也失真。成敗看兩個指標:圖表清晰度(一眼看懂)與洞察傳達效果(看懂後知道該做什麼)。EDA 階段的圖表會匯整成 Dashboard 雛形,作為與需求方來回確認的可溝通中間產物

白話理解

向製造主管簡報瑕疵分析:折線圖看瑕疵率趨勢,長條圖比較各產線,盒鬚圖看各批次分佈,散佈圖看「機台溫度與瑕疵率」的關係。四張圖拼成一頁 Dashboard,主管三分鐘抓到重點。

圖表選型速查

  • 看趨勢(隨時間變化):折線圖
  • 比較類別大小:長條圖;類別太多就排序取前幾名
  • 看占比:圓餅圖(類別少才用)或堆疊長條圖
  • 看分佈:直方圖、盒鬚圖,順便抓離群值
  • 看兩變數關係:散佈圖
  • 少用 3D 效果、雙 Y 軸與截斷 Y 軸 — 誤導圖表的三大來源
🎯 口訣:趨勢折線、比較長條、占比圓餅、分佈直方、關係散佈。

iPAS 考點

考「情境配圖表」:「想看近 12 個月營收變化」選折線圖;「各分店業績比較」選長條圖;「客戶年齡分佈」選直方圖。最常見陷阱是圓餅圖 — 類別一多或需要精確比較時,它就是錯誤選項。

應用場景

MatplotlibSeabornPlotlyTableauPower BI

評估指標

圖表清晰度洞察傳達效果

iPAS 歷屆考題詳解(7 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第21題

某資料分析師設計在業務績效報告時,希望單一頁面中同時呈現多區域、不同產品線的銷售趨勢變化,並確保主管能在短時間內掌握整體資料走向。若依據 Edward Rolf Tufte 的數據密度(Data Density) 原則,下列哪一種設計方式最能符合該概念?

  1. A將每個區域的銷售資料分成多張獨立折線圖,以避免資訊重疊
  2. B使用顏色區分產品線,於同一圖表中整合多區域趨勢線,保持比例一致且標註清晰
  3. C移除所有輔助線與標籤,僅保留主要折線以凸顯趨勢
  4. D將資料轉換為表格形式,確保數值精確呈現並取代圖表視覺化
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 Tufte 的數據密度(Data Density)原則主張:在同樣版面中呈現越多「有效」資訊越好,同時維持清晰可讀,以最少的墨水、最小的空間傳達最多的資料。把多區域、多產品線的趨勢用顏色區分、整合在同一張比例一致、標註清晰的圖表中,單位面積承載的資訊量最高,主管能在單一畫面比較整體走向,正是高數據密度的實踐。 【為何其他選項錯了?】 - (A):拆成多張獨立小圖會稀釋版面的資訊密度,且各圖比例尺不一致時難以互相比較,違背「單一頁面快速掌握整體」的目標。 - (C):將輔助線與標籤全部移除是誤解了 Tufte 的「去除圖表垃圾(Chartjunk)」概念,應刪除的是無意義的裝飾,而非有助判讀的必要標註;刪除過度會使圖表失去可讀性。 - (D):表格適合精確查詢數值,但要觀察「趨勢走向」時,人眼難以從大量數字中辨識變化,這正是視覺化的價值所在。 提示:Data Density 等於單位面積的有效資訊量;刪裝飾不刪資訊,整合而不雜亂。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第25題

某電商資料團隊繪製顧客單筆消費金額的箱型圖後發現:四分位距(IQR)範圍極小,但上鬚線拉得很長,且在高金額區域有多筆離群值。若希望協助行銷部門依據消費層級設計分群策略,下列哪一種視覺化方式最有助於凸顯不同消費層級間的差異?

  1. A以對數刻度繪製箱型圖或長條圖,放大高金額消費族群的變化差異
  2. B移除所有離群值,確保資料呈現集中分布
  3. C採用等距分箱(Equal-Width Binning)方式分群
  4. D改以折線圖(Line Chart)觀察時間變化趨勢
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 IQR 極小、上鬚很長、高金額端有多筆離群值,代表消費金額嚴重右偏:多數顧客消費金額低,少數顧客金額極高。在線性刻度下,大部分資料被壓縮在圖的低值區,層級差異難以辨識。改用對數刻度後,低、中、高消費層級在視覺上被拉開,跨數量級的差異變得可讀,最有助於觀察不同消費層級的結構,支援分群策略設計。 【為何其他選項錯了?】 - (B):高金額離群值正是高消費客群,是分群策略中最具價值的目標族群;將其移除等於刪去關鍵分析對象,與「依消費層級分群」的目的直接矛盾。 - (C):等距分箱在右偏資料上會使絕大多數樣本集中於第一箱,其餘箱幾乎無資料,分群缺乏鑑別度;右偏資料較適合等頻分箱或對數分箱。 - (D):折線圖觀察的是時間趨勢,題目問的是消費「層級結構」的差異,分析維度不符。 提示:嚴重右偏、跨數量級的金額資料,改用對數刻度即可呈現層級結構。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第46題

某遊戲銷售資料集(DataFrame 變數為 data)包含 NA_Sales、EU_Sales、JP_Sales、Other_Sales(各地區銷售量)等欄位。團隊希望比較北美、歐洲、日本及其他地區的整體銷售總額比例,並使用 seaborn 套件以長條圖的形式進行可視化分析。請選出能正確顯示這些地區銷售總額比例的程式碼。

  1. Asns.countplot(x=["NA_Sales","EU_Sales","JP_Sales","Other_Sales"], data=data)
  2. Bsns.lineplot(x="Platform", y=["NA_Sales","EU_Sales","JP_Sales","Other_Sales"], data=data)
  3. Csns.barplot(x="variable", y="value", data=pd.melt(data, value_vars=["NA_Sales","EU_Sales","JP_Sales","Other_Sales"]), estimator=sum)
  4. Dsns.histplot(data[["NA_Sales","EU_Sales","JP_Sales","Other_Sales"]])
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 四個地區的銷量分別存放於四個「欄位」(寬格式),但 seaborn 的 barplot 期望「一欄是類別、一欄是數值」的長格式。pd.melt 將四個欄位融合為 variable(地區名)與 value(銷量)兩欄,再以 x="variable"、y="value" 繪製長條圖,並以 estimator=sum 將每個地區的銷量「加總」呈現(barplot 預設計算平均),完整達成各地區銷售總額的比較。 【為何其他選項錯了?】 - (A):countplot 只能計數,且把欄位名稱清單直接傳給 x 是錯誤用法;它無法呈現銷售「數量加總」,只能統計出現次數。 - (B):lineplot 的 y 參數不接受欄位名稱列表的寫法,執行會報錯;且折線圖適合呈現趨勢,不適合類別間的總量比較。 - (D):histplot 繪製的是各欄位數值的「分佈直方圖」,呈現銷量落在各區間的頻率,而非各地區加總後的比較。 提示:寬格式轉長格式使用 pd.melt;seaborn 的 barplot 預設計算平均,要呈現總和須指定 estimator=sum。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第47題

某遊戲銷售資料集(DataFrame 變數為 data)包含 Name(遊戲名稱)與 NA_Sales(北美地區銷售量)等欄位。研究團隊想要知道在北美地區(NA)銷售成績最好的遊戲前五名,並希望以 seaborn 的條狀圖呈現結果。請選出能正確完成這項分析的程式碼。

  1. Asns.barplot(x="NA_Sales", y="Name", data=data.head(5))
  2. Bsns.barplot(x="Name", y="NA_Sales", data=data.nlargest(5, "NA_Sales"))
  3. Csns.lineplot(x="Name", y="NA_Sales", data=data.nlargest(5, "NA_Sales"))
  4. Dsns.countplot(x="Name", y="NA_Sales", data=data)
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 本題有兩個關鍵步驟:先以 data.nlargest(5, "NA_Sales") 依北美銷量由大到小取出前五筆,再以 sns.barplot(x="Name", y="NA_Sales") 用遊戲名稱作為類別軸、銷量作為數值軸繪製條狀圖。選項 (B) 正確組合了「依指定欄位取前五名」與「條狀圖呈現」兩項需求。 【為何其他選項錯了?】 - (A):data.head(5) 只是取資料表「原始排列順序」的前 5 列,並非依北美銷量排序的前五名,無法回答「NA 銷售成績最好」的問題。 - (C):nlargest 的用法正確,但 lineplot 是折線圖,五個離散的遊戲名稱之間連線並無意義,且題目指明要以條狀圖呈現。 - (D):countplot 是計數圖,只能統計類別出現次數;且它不接受同時指定 x 與 y 的用法,執行會直接報錯。 提示:取前 N 名使用 nlargest(N, "欄位");head() 只依原始順序取列,nlargest 才依數值大小取列。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第27題

某AI產品的商業分析師在準備月度報告時,需要在單一頁面上同時呈現 1,000 位使用者的留存率、活躍程度與付費轉換率三項指標,以讓決策層快速掌握整體趨勢。若依據Edward Tufte 的資料視覺化原則中資料密度(Data Density)的概念,下列何者最符合此原則的設計方向?

  1. A將1,000 筆資料分散至多張圖表(每張顯示約 100 筆),避免單一圖表資訊過載
  2. B移除所有圖例、軸標籤與輔助線等非資料墨水(Non-data Ink),使版面最簡潔
  3. C在圖表中加入大量裝飾性元素(如色塊、陰影、3D 效果),使視覺效果更豐富
  4. D在有限頁面空間中呈現盡可能多的有效資料資訊,同時維持可讀性與清楚的視覺層次
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 Tufte 的資料密度(Data Density)指圖表面積內承載的有效資料量,他主張在維持可讀性的前提下盡量提高單位面積的資訊量,讓讀者快速掌握大量事實;搭配高資料墨水比(Data-ink Ratio)與去除圖表垃圾(Chartjunk),構成其精簡高效的視覺化原則。要在單一頁面同時呈現 1,000 位使用者的三項指標供決策層速讀,正應提高資料密度並維持清楚的視覺層次,選項 (D) 完全對應。 【為何其他選項錯了?】 - (A):把資料拆成多張各 100 筆的圖表,單位面積資訊量反而下降,決策層必須翻頁自行整合,與提高資料密度的方向相反。 - (B):Tufte 主張刪除的是「非資料墨水」中無意義的部分;圖例與軸標籤是理解資料必需的資訊載體,全部移除會使圖表無法判讀,精簡不等於移除必要標註。 - (C):色塊、陰影、3D 效果正是 Tufte 批判的 Chartjunk,裝飾越多、資料墨水比越低,與資料密度原則完全相反。 提示:Tufte 三原則:高資料密度、高資料墨水比、去除圖表垃圾;版面應保留給資料本身而非裝飾。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第28題

行銷團隊比較三種廣告投放管道(A/B/C)的轉換率差異,原始數據如下,A:3.2%、B:3.8%、C:4.0%。若設計圖表時將 y 軸刻意截斷(不從 0 開始),造成視覺差異放大。此做法最可能產生的問題為何?

  1. A提升資料解析效率並減少認知負擔
  2. B增強小幅差異的可視化辨識能力
  3. C造成視覺誤導並放大實際差異感
  4. D提升圖表計算準確性與數據正確性
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 三個管道的轉換率僅相差 0.8 個百分點(3.2%、3.8%、4.0%),若 y 軸不從 0 開始、只顯示 3% 至 4.1% 的區間,長條的視覺高度差會被放大數倍,讀者容易誤以為管道間成效差距懸殊。這是典型的截斷 y 軸(Truncated Axis)視覺誤導:數值本身沒有造假,但視覺比例失真,屬於圖形誠信(Graphical Integrity)問題,Tufte 以謊言因子(Lie Factor)偏高描述此類圖表。 【為何其他選項錯了?】 - (A):截斷 y 軸並未提升資料解析效率或降低認知負擔,反而使讀者對差異幅度形成錯誤印象,增加誤判風險。 - (B):在特定分析場景中放大顯示差異或有其用途,但前提是明確標示斷軸;題幹描述的是「刻意截斷造成視覺差異放大」,核心影響是誤導而非輔助辨識,不能視為正面效果。 - (D):圖表的繪製方式不會改變數據計算的正確性;截斷軸影響的是視覺觀感,與計算準確性無關,此選項答非所問。 提示:長條圖比較量值時 y 軸原則上從 0 開始;非零起點必須明確標示斷軸,否則即構成視覺誤導。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第29題

某 AI 系統的維運工程師需要在儀表板上呈現「模型推論延遲(ms)隨時間的變化趨勢」,以便即時監控 服務水準協議(Service Level Agreement, SLA)是否達標(P99<200 ms)。在資料視覺化的圖表類型選擇上,下列哪種圖表最適合呈現連續數值隨時間變化的趨勢?

  1. A面積圖(Area Chart)
  2. B散佈圖(Scatter Plot)
  3. C長條圖(Bar Chart)
  4. D折線圖(Line Plot)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 「連續數值隨時間變化的趨勢」正是折線圖的典型用途:x 軸放時間、y 軸放延遲毫秒數,點與點之間以線相連,上升、下降、震盪與尖峰皆可直接判讀;監控儀表板還能疊加 P99 與 200ms 的 SLA 水平參考線,超標時一眼可見。時間序列趨勢監控以折線圖為首選,是視覺化圖表選擇的基本原則。 【為何其他選項錯了?】 - (A):面積圖本質是折線圖下方填色,適合強調量體大小或堆疊組成;對延遲指標而言,填色未增加資訊,多序列(如 P50/P95/P99)堆疊時還會互相遮擋。 - (B):散佈圖用於觀察兩個變數之間的關係(如延遲與請求量),點與點不相連,趨勢的連續性與時間順序不易判讀。 - (C):長條圖適合離散類別間的量值比較;用於每分鐘延遲會形成大量緊密相鄰的柱狀,趨勢反而難以辨識。 提示:看趨勢用折線、比類別用長條、看關係用散佈、看組成用面積或堆疊;先確認資料要回答的問題再選圖表。

相關節點