資料知識地圖 · 2. 資料來源

2. 資料來源

Data Source & Acquisition

在互動地圖中開啟 回資料知識地圖

觀念教學

資料來源與取得方式:DB / API / 檔案 / Log。取得方式包含 API 串接、爬蟲、日誌收集、DB 查詢。需注意取樣與偏差(sampling bias)的前置風險。

Big Data 5V 特性

評估資料來源時,先用 5V 判斷你面對的是不是大數據:

  • Volume(量):資料量大,從 TB 到 PB 等級(如社群貼文、IoT 感測器)
  • Velocity(速):資料產生與處理速度快,需即時或近即時處理(如股票交易、即時推薦)
  • Variety(多樣):資料型態多元,結構化(表格)、半結構化(JSON/XML)、非結構化(圖片/影片/文字)
  • Veracity(真實性):資料品質與可信度,是否有噪音、缺失、偏差?垃圾進垃圾出 (GIGO)
  • Value(價值):從海量資料中提煉出商業洞見,資料本身不值錢,分析後的決策才值錢
簡單記法:量大、速快、型雜、質疑、值挖

應用場景

資料庫查詢API 串接網頁爬蟲日誌收集檔案匯入

評估指標

資料完整性取得效率

iPAS 歷屆考題詳解(1 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第33題

某自駕車公司的 AI 訓練團隊面臨標註成本高的問題,無法取得足夠的真實惡劣天氣(大雨、濃霧)駕駛場景資料,工程師提議使用合成資料(Synthetic Data)來補充訓練集。請問下列何者最能正確敘述合成資料在 AI訓練中的角色?

  1. A合成資料主要用於文字任務的資料擴增,影像任務仍需依賴真實資料
  2. B合成資料可完全取代真實資料,直接用於模型訓練
  3. C合成資料主要用於降低模型推論時的計算成本
  4. D合成資料可在控制條件下產生多樣化場景,用於擴充訓練資料並提升模型的泛化能力
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 合成資料(Synthetic Data)的價值在於「可控條件下量產所需場景」:以模擬器或生成模型製造大雨、濃霧、逆光等真實世界難以蒐集的長尾駕駛情境,且標籤(物件位置、深度、分割遮罩)可隨模擬自動生成,大幅節省人工標註成本。將合成資料混入訓練集擴充多樣性,能提升模型對罕見場景的泛化能力;自駕領域大量使用模擬產生的訓練資料,正是最典型的應用,故 (D) 正確。 【為何其他選項錯了?】 - (A):合成資料在影像領域應用極廣(3D 渲染、模擬器、擴散模型生成影像),「主要用於文字任務、影像仍依賴真實資料」的敘述與實務相反。 - (B):合成與真實資料之間存在領域差距(Domain Gap),模型仍需真實資料參與訓練與驗證校準,「完全取代真實資料」言過其實。 - (C):合成資料作用於訓練資料端,與推論階段的計算成本無關;要降低推論成本應採模型量化、蒸餾等技術。 提示:合成資料的定位是可控地擴充訓練資料、補足罕見場景;它輔助而非取代真實資料,也與推論成本無關。

相關節點