資料知識地圖 · 5. 探索分析
視覺化
圖表與報告雛形
觀念教學
分析做得再深,對方看不懂就等於沒做。視覺化是把洞察「翻譯」成一眼能懂的圖 — 它是溝通工具,不是美工。
核心觀念
資料視覺化(Data Visualization)的核心原則是「圖表類型要配問題類型」:選錯圖,再漂亮也失真。成敗看兩個指標:圖表清晰度(一眼看懂)與洞察傳達效果(看懂後知道該做什麼)。EDA 階段的圖表會匯整成 Dashboard 雛形,作為與需求方來回確認的可溝通中間產物。
白話理解
向製造主管簡報瑕疵分析:折線圖看瑕疵率趨勢,長條圖比較各產線,盒鬚圖看各批次分佈,散佈圖看「機台溫度與瑕疵率」的關係。四張圖拼成一頁 Dashboard,主管三分鐘抓到重點。
圖表選型速查
- 看趨勢(隨時間變化):折線圖
- 比較類別大小:長條圖;類別太多就排序取前幾名
- 看占比:圓餅圖(類別少才用)或堆疊長條圖
- 看分佈:直方圖、盒鬚圖,順便抓離群值
- 看兩變數關係:散佈圖
- 少用 3D 效果、雙 Y 軸與截斷 Y 軸 — 誤導圖表的三大來源
🎯 口訣:趨勢折線、比較長條、占比圓餅、分佈直方、關係散佈。
iPAS 考點
考「情境配圖表」:「想看近 12 個月營收變化」選折線圖;「各分店業績比較」選長條圖;「客戶年齡分佈」選直方圖。最常見陷阱是圓餅圖 — 類別一多或需要精確比較時,它就是錯誤選項。
應用場景
評估指標
iPAS 歷屆考題詳解(7 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某資料分析師設計在業務績效報告時,希望單一頁面中同時呈現多區域、不同產品線的銷售趨勢變化,並確保主管能在短時間內掌握整體資料走向。若依據 Edward Rolf Tufte 的數據密度(Data Density) 原則,下列哪一種設計方式最能符合該概念?
- A將每個區域的銷售資料分成多張獨立折線圖,以避免資訊重疊
- B使用顏色區分產品線,於同一圖表中整合多區域趨勢線,保持比例一致且標註清晰
- C移除所有輔助線與標籤,僅保留主要折線以凸顯趨勢
- D將資料轉換為表格形式,確保數值精確呈現並取代圖表視覺化
看正解與逐選項詳解
正解:B
某電商資料團隊繪製顧客單筆消費金額的箱型圖後發現:四分位距(IQR)範圍極小,但上鬚線拉得很長,且在高金額區域有多筆離群值。若希望協助行銷部門依據消費層級設計分群策略,下列哪一種視覺化方式最有助於凸顯不同消費層級間的差異?
- A以對數刻度繪製箱型圖或長條圖,放大高金額消費族群的變化差異
- B移除所有離群值,確保資料呈現集中分布
- C採用等距分箱(Equal-Width Binning)方式分群
- D改以折線圖(Line Chart)觀察時間變化趨勢
看正解與逐選項詳解
正解:A
某遊戲銷售資料集(DataFrame 變數為 data)包含 NA_Sales、EU_Sales、JP_Sales、Other_Sales(各地區銷售量)等欄位。團隊希望比較北美、歐洲、日本及其他地區的整體銷售總額比例,並使用 seaborn 套件以長條圖的形式進行可視化分析。請選出能正確顯示這些地區銷售總額比例的程式碼。
- Asns.countplot(x=["NA_Sales","EU_Sales","JP_Sales","Other_Sales"], data=data)
- Bsns.lineplot(x="Platform", y=["NA_Sales","EU_Sales","JP_Sales","Other_Sales"], data=data)
- Csns.barplot(x="variable", y="value", data=pd.melt(data, value_vars=["NA_Sales","EU_Sales","JP_Sales","Other_Sales"]), estimator=sum)
- Dsns.histplot(data[["NA_Sales","EU_Sales","JP_Sales","Other_Sales"]])
看正解與逐選項詳解
正解:C
某遊戲銷售資料集(DataFrame 變數為 data)包含 Name(遊戲名稱)與 NA_Sales(北美地區銷售量)等欄位。研究團隊想要知道在北美地區(NA)銷售成績最好的遊戲前五名,並希望以 seaborn 的條狀圖呈現結果。請選出能正確完成這項分析的程式碼。
- Asns.barplot(x="NA_Sales", y="Name", data=data.head(5))
- Bsns.barplot(x="Name", y="NA_Sales", data=data.nlargest(5, "NA_Sales"))
- Csns.lineplot(x="Name", y="NA_Sales", data=data.nlargest(5, "NA_Sales"))
- Dsns.countplot(x="Name", y="NA_Sales", data=data)
看正解與逐選項詳解
正解:B
某AI產品的商業分析師在準備月度報告時,需要在單一頁面上同時呈現 1,000 位使用者的留存率、活躍程度與付費轉換率三項指標,以讓決策層快速掌握整體趨勢。若依據Edward Tufte 的資料視覺化原則中資料密度(Data Density)的概念,下列何者最符合此原則的設計方向?
- A將1,000 筆資料分散至多張圖表(每張顯示約 100 筆),避免單一圖表資訊過載
- B移除所有圖例、軸標籤與輔助線等非資料墨水(Non-data Ink),使版面最簡潔
- C在圖表中加入大量裝飾性元素(如色塊、陰影、3D 效果),使視覺效果更豐富
- D在有限頁面空間中呈現盡可能多的有效資料資訊,同時維持可讀性與清楚的視覺層次
看正解與逐選項詳解
正解:D
行銷團隊比較三種廣告投放管道(A/B/C)的轉換率差異,原始數據如下,A:3.2%、B:3.8%、C:4.0%。若設計圖表時將 y 軸刻意截斷(不從 0 開始),造成視覺差異放大。此做法最可能產生的問題為何?
- A提升資料解析效率並減少認知負擔
- B增強小幅差異的可視化辨識能力
- C造成視覺誤導並放大實際差異感
- D提升圖表計算準確性與數據正確性
看正解與逐選項詳解
正解:C
某 AI 系統的維運工程師需要在儀表板上呈現「模型推論延遲(ms)隨時間的變化趨勢」,以便即時監控 服務水準協議(Service Level Agreement, SLA)是否達標(P99<200 ms)。在資料視覺化的圖表類型選擇上,下列哪種圖表最適合呈現連續數值隨時間變化的趨勢?
- A面積圖(Area Chart)
- B散佈圖(Scatter Plot)
- C長條圖(Bar Chart)
- D折線圖(Line Plot)
看正解與逐選項詳解
正解:D