資料知識地圖 · 3. 資料管線
DW / Lake
資料倉儲與資料湖
觀念教學
資料要住哪?資料倉儲(Data Warehouse)像精裝樣品屋,進門前先裝潢好;資料湖(Data Lake)像大倉庫,先全堆進來再說。
核心觀念
DW 存結構化資料,走 Schema-on-Write:寫入時就強制套用結構,查詢快、品質穩,天生為報表與 BI 而生。Data Lake 收原始的結構化、半結構化與非結構化資料(JSON、影像、Log),走 Schema-on-Read:讀取時才解釋結構,進料門檻低、彈性大。現代趨勢是 Lakehouse:湖的彈性加上倉儲的治理與查詢能力,一套架構通吃。
白話理解
製造業品管:感測器原始波形、產線照片先全進資料湖——以後訓練瑕疵檢測模型用得上;良率統計等彙整數字進倉儲,供管理層即查即看。誰住哪,看用途。
選型重點
- 固定報表、BI 儀表板、SQL 分析 → DW,查詢效能優先
- 機器學習訓練、原始資料保留、格式雜 → Data Lake,儲存成本低
- 沒有治理的湖會退化成資料沼澤(Data Swamp):存了一堆沒人說得清的檔案
- Lakehouse 讓湖上資料也有交易與 Schema 管理,兼顧兩邊
- 常見組合:Lake 收原料、DW 出成品,兩層並存
🎯 口訣:倉儲先整理再入住(Write),湖先入住再整理(Read);湖不治理,遲早變沼澤。
iPAS 考點
標配題:「Schema-on-Write 對應哪種儲存?」——資料倉儲;「適合存放非結構化原始資料的是?」——資料湖。情境題:「多格式原始資料供未來 AI 訓練」選 Lake、「主管即時查詢結構化報表」選 DW。Lakehouse 是兩者折衷的新趨勢,也開始入題。
應用場景
評估指標
iPAS 歷屆考題詳解(2 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某企業建置生成式 AI 系統,利用大量客服紀錄與產品評論資料訓練語言模型,以自動生成客服回覆與知識摘要。由於資料來源多樣,且包含非結構化文字、影像與表格資訊,團隊希望在不降低模型效能的前提下,提升資料處理效率與一致性,下列哪一種資料處理策略最適合?
- A建立資料湖(Data Lake)結構,並以 Apache Spark或Ray進行分散式資料預處理與特徵抽取,再串接至模型訓練管線(Pipeline)
- B採用單節點高效能伺服器搭配批次處理模式,集中執行資料清理與格式轉換
- C將所有文字資料轉換為向量,並以資料庫索引方式直接餵入語言模型訓練
- D使用生成式模型先行自動清理資料內容,再將結果輸入至下游訓練流程
看正解與逐選項詳解
正解:A
某 AI 平台工程師正在為多模態模型訓練系統規劃資料儲存架構,需要同時處理原始影像、非結構化文本,以及經過整理的結構化特徵資料。在此情境下,應如何選擇資料湖(Data Lake)與資料倉儲(Data Warehouse)的使用方式?
- A將原始影像與文本資料儲存在 Data Lake,將整理後的結構化特徵資料儲存在Data Warehouse
- B將所有資料統一儲存在 Data Warehouse,以提升查詢效率
- C將所有資料統一儲存在 Data Lake,但犧牲結構化資料的查詢效率
- D僅將原始影像資料儲存在 Data Lake,其餘資料統一存入 Data Warehouse
看正解與逐選項詳解
正解:A