資料知識地圖 · 3. 資料管線

DW / Lake

資料倉儲與資料湖

在互動地圖中開啟 回資料知識地圖

觀念教學

資料要住哪?資料倉儲(Data Warehouse)像精裝樣品屋,進門前先裝潢好;資料湖(Data Lake)像大倉庫,先全堆進來再說。

核心觀念

DW 存結構化資料,走 Schema-on-Write:寫入時就強制套用結構,查詢快、品質穩,天生為報表與 BI 而生。Data Lake 收原始的結構化、半結構化與非結構化資料(JSON、影像、Log),走 Schema-on-Read:讀取時才解釋結構,進料門檻低、彈性大。現代趨勢是 Lakehouse:湖的彈性加上倉儲的治理與查詢能力,一套架構通吃。

白話理解

製造業品管:感測器原始波形、產線照片先全進資料湖——以後訓練瑕疵檢測模型用得上;良率統計等彙整數字進倉儲,供管理層即查即看。誰住哪,看用途。

選型重點

  • 固定報表、BI 儀表板、SQL 分析 → DW,查詢效能優先
  • 機器學習訓練、原始資料保留、格式雜 → Data Lake,儲存成本
  • 沒有治理的湖會退化成資料沼澤(Data Swamp):存了一堆沒人說得清的檔案
  • Lakehouse 讓湖上資料也有交易與 Schema 管理,兼顧兩邊
  • 常見組合:Lake 收原料、DW 出成品,兩層並存
🎯 口訣:倉儲先整理再入住(Write),湖先入住再整理(Read);湖不治理,遲早變沼澤。

iPAS 考點

標配題:「Schema-on-Write 對應哪種儲存?」——資料倉儲;「適合存放非結構化原始資料的是?」——資料湖。情境題:「多格式原始資料供未來 AI 訓練」選 Lake、「主管即時查詢結構化報表」選 DW。Lakehouse 是兩者折衷的新趨勢,也開始入題。

應用場景

BigQuerySnowflakeDatabricksS3/GCS

評估指標

查詢效能儲存成本

iPAS 歷屆考題詳解(2 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第24題

某企業建置生成式 AI 系統,利用大量客服紀錄與產品評論資料訓練語言模型,以自動生成客服回覆與知識摘要。由於資料來源多樣,且包含非結構化文字、影像與表格資訊,團隊希望在不降低模型效能的前提下,提升資料處理效率與一致性,下列哪一種資料處理策略最適合?

  1. A建立資料湖(Data Lake)結構,並以 Apache Spark或Ray進行分散式資料預處理與特徵抽取,再串接至模型訓練管線(Pipeline)
  2. B採用單節點高效能伺服器搭配批次處理模式,集中執行資料清理與格式轉換
  3. C將所有文字資料轉換為向量,並以資料庫索引方式直接餵入語言模型訓練
  4. D使用生成式模型先行自動清理資料內容,再將結果輸入至下游訓練流程
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 情境特徵:資料來源多樣(非結構化文字、影像、表格)、資料量大,且用於生成式 AI 訓練。資料湖(Data Lake)專為容納各種格式的原始資料而設計;Apache Spark 或 Ray 提供分散式的資料預處理與特徵抽取能力,可水平擴展處理大量資料;再串接模型訓練管線(Pipeline)確保流程自動化與一致性。此組合兼顧處理效率、格式彈性與流程一致性,是生成式 AI 資料工程的標準作法,故 (A) 正確。 【為何其他選項錯了?】 - (B):單節點伺服器效能再高也有物理上限,面對多模態大量資料缺乏水平擴展能力,集中批次處理也難以支撐持續更新的訓練需求。 - (C):「所有文字直接轉向量餵入訓練」跳過了清理、去重與品質控管等關鍵步驟;影像與表格的異質性也無法僅以向量化解決一致性問題。 - (D):以生成式模型自動清理資料,其輸出本身帶有幻覺與偏差風險,未經驗證即輸入下游訓練,可能將錯誤內容混入訓練資料,反而損害模型品質。 提示:多模態、大量、訓練用途的組合,對應資料湖儲存原始資料、Spark/Ray 分散式前處理、Pipeline 串接訓練。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第39題

某 AI 平台工程師正在為多模態模型訓練系統規劃資料儲存架構,需要同時處理原始影像、非結構化文本,以及經過整理的結構化特徵資料。在此情境下,應如何選擇資料湖(Data Lake)與資料倉儲(Data Warehouse)的使用方式?

  1. A將原始影像與文本資料儲存在 Data Lake,將整理後的結構化特徵資料儲存在Data Warehouse
  2. B將所有資料統一儲存在 Data Warehouse,以提升查詢效率
  3. C將所有資料統一儲存在 Data Lake,但犧牲結構化資料的查詢效率
  4. D僅將原始影像資料儲存在 Data Lake,其餘資料統一存入 Data Warehouse
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 標準分工:資料湖(Data Lake)採 schema-on-read,以低成本物件儲存容納原始、異構的非結構化資料,影像與文本原始檔案直接入湖,保留完整原始資訊供多模態訓練取用;資料倉儲(Data Warehouse)採 schema-on-write,存放清理整合後的結構化特徵資料,支援高效 SQL 查詢與分析。兩者各司其職,是多模態 AI 平台的典型儲存架構,進一步整合則演化為 Lakehouse,故 (A) 正確。 【為何其他選項錯了?】 - (B):原始影像與文本不符合資料倉儲的結構化 schema 設計,強行存入成本高,倉儲的查詢效率優勢也無從發揮。 - (C):全部存入資料湖將犧牲結構化特徵的查詢效率;訓練與分析需要高效讀取整理後的特徵,仍需資料倉儲或等效的結構化儲存層。 - (D):非結構化的文本與影像同屬資料湖的適用範圍;僅將影像入湖、文本存入倉儲,分類標準前後不一致。 提示:原始異構資料存資料湖(schema-on-read),整理後的結構化特徵存資料倉儲(schema-on-write)。

相關節點