資料知識地圖 · 2. 資料來源

DB / API

資料庫與 API 串接

在互動地圖中開啟 回資料知識地圖

觀念教學

取得資料的兩條主幹道:一條往內,從自家資料庫撈;一條往外,透過 API 跟別人的系統要。

核心觀念

關聯式資料庫(Relational Database)如 MySQL、PostgreSQL:資料表加 SQL 查詢,擅長結構化資料與交易處理。NoSQL 如 MongoDB:文件、鍵值等彈性結構,擅長半結構化資料與高速寫入。外部資料靠 REST APIGraphQL:REST 一個端點對一種資源;GraphQL 讓用戶端指定「只回傳這幾個欄位」,減少來回傳輸。

白話理解

零售公司做銷售分析:訂單放 PostgreSQL(交易要安全)、商品評論放 MongoDB(格式彈性)、天氣資料跟氣象開放 API 要。分析的第一步不是建模,是把三路資料撈出來、串起來。

選用重點

  • 結構固定、需要交易一致性 → 關聯式資料庫
  • 欄位多變、寫入量大 → NoSQL
  • 外部串接注意 API 回應時間、呼叫次數上限(Rate Limit)與版本異動
  • 內部撈數顧查詢效能:善用索引、避免全表掃描,別把正式交易庫查掛
  • 大量分析請走倉儲或唯讀副本,分析與交易分流
🎯 口訣:內部找 DB、外部靠 API;結構穩用 SQL、彈性快用 NoSQL。

iPAS 考點

分類題:MongoDB 屬 NoSQL 文件型資料庫;訂單交易系統選關聯式。差異題:GraphQL 與 REST 的差別在用戶端可指定回傳欄位。判斷關鍵字:「彈性 Schema、水平擴充」選 NoSQL;「交易、關聯查詢、一致性」選關聯式,兩組別搞反。

應用場景

SQL 查詢API 整合資料同步

評估指標

查詢效能API 回應時間

iPAS 歷屆考題詳解(4 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第34題

在圖形資料庫(Graph Database)中建模社群平台資料時,若每筆「按讚」行為都包含時間戳記(Timestamp)與裝置類型(Device Type)等資訊。若希望同時保留使用者與貼文之間的互動關係,並能有效查詢「按讚」的行為屬性,下列哪一種設計方式最為合適?

  1. A將「按讚」視為節點(Node),與使用者建立邊(Edge)
  2. B將「按讚」資訊作為邊的屬性(Property)儲存,連結使用者與被按讚的貼文節點
  3. C把「按讚」資訊直接寫入使用者節點中作為屬性
  4. D建立「按讚紀錄表」並將資料存入關聯式資料庫
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 屬性圖(Property Graph)的建模慣例:實體(使用者、貼文)建為節點,互動關係(按讚)建為邊,而關係本身的附加資訊(時間戳記、裝置類型)存為邊的屬性(Property)。如此使用者與貼文的關聯結構清晰,查詢「誰在何時以何種裝置對哪篇貼文按讚」時,沿著邊讀取屬性即可,同時保留關係結構與行為屬性的查詢效率,故 (B) 正確。 【為何其他選項錯了?】 - (A):把每次按讚都建成獨立節點會產生大量中介節點,查詢使用者與貼文的直接關係還需多跳一層;這種關係具體化通常保留給多方關係或關係本身還要被其他關係連結的情況,本題並不需要。 - (C):把按讚資訊寫入使用者節點屬性,等於以節點儲存一份清單,遺失了與貼文之間的邊,無法從貼文端反向查詢,浪費圖資料庫的關聯查詢優勢。 - (D):另建關聯式資料表等於放棄圖資料庫的原生關聯能力,兩套系統還需同步資料,多層關係查詢又回到多表 JOIN 的效能負擔。 提示:屬性圖建模原則:實體為節點、關係為邊、關係的附加資訊為邊的屬性。
114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第35題

某企業欲建構知識圖譜(Knowledge Graph),以整合內部的研究報告、專利資料與專家知識,並支援語意查詢與關聯推理。若希望模型能具備良好的語意擴展性與高效推理能力,下列哪一種圖模型設計最為合適?

  1. A僅以節點(Node)與邊(Edge)表示,所有資訊存放於節點屬性中
  2. B將資料結構建為 RDF(Resource Description Framework)三元組(Subject–Predicate–Object)
  3. C使用文件型資料庫儲存內容,並以標籤(Tag)連接節點
  4. D採用關聯式資料庫儲存對應關係,並搭配預建索引加速查詢
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 知識圖譜要支援「語意查詢與關聯推理」,RDF 三元組(Subject-Predicate-Object,主詞-述詞-受詞)正是為此制定的標準:每筆知識都是一條機器可理解的陳述(如「專利X-引用-論文Y」),搭配 RDFS/OWL 本體論(Ontology)定義類別與關係的語意階層,再以 SPARQL 查詢語言與推理引擎進行邏輯推導。語意擴展性(可隨時新增關係型別)與推理能力兼備,屬 W3C 語意網標準體系的核心,故 (B) 正確。 【為何其他選項錯了?】 - (A):把所有資訊放在節點屬性中,關係語意未被顯式建模,推理引擎無從依據關係型別進行推導,新增語意型別也困難。 - (C):文件型資料庫加標籤只能做粗略的關聯查詢,標籤缺乏形式化語意定義,無法支援語意推理與擴展。 - (D):關聯式資料庫雖可儲存對應關係,但多層關聯查詢需要逐層 JOIN,效能隨推理深度惡化,且缺乏原生的本體論與推理引擎支援。 提示:語意查詢與關聯推理的需求對應 RDF 三元組加 SPARQL;屬性圖適合營運型關聯查詢,RDF 適合語意與推理。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第13題

某電商平台正在重構商品資料架構,需同時支援三個系統:商品管理後台需處理結構化與半結構化資料(如巢狀庫存與不同類別商品欄位差異),並支援複雜條件查詢;AI推薦系統需儲存高維向量(1,536 維)並進行高效相似度搜尋(高 QPS);即時庫存服務則要求ACID且延遲低於 10ms,以避免超賣。在此情境下,哪種資料庫架構最適合?

  1. A全部使用關聯式資料庫,透過 JSON 欄位儲存巢狀資料,並以延伸套件支援向量搜尋,同時以資料列鎖(Row-level Lock)處理庫存扣減
  2. B商品資料使用文件型資料庫,向量搜尋使用專用向量資料庫,庫存服務使用關聯式資料庫,各系統依需求選擇最適合的資料庫
  3. C全部使用文件型資料庫,同時處理商品資料、向量搜尋與庫存服務,以統一技術棧降低維運複雜度
  4. D商品與向量資料使用搜尋引擎型資料庫,並以文件更新機制處理庫存扣減
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 三個系統的工作負載性質差異極大:商品管理需處理巢狀、欄位異質的半結構化資料並支援複雜條件查詢,文件型資料庫(如 MongoDB)最適合;推薦系統需對 1,536 維向量進行高 QPS 相似度搜尋,專用向量資料庫具備 HNSW 等近似最近鄰索引與水平擴展設計;庫存扣減要求 ACID 交易與 10ms 以內延遲,關聯式資料庫的交易保證最可靠。依工作負載選型、各司其職,正是多元持久化(Polyglot Persistence)的設計原則,故 (B) 正確。 【為何其他選項錯了?】 - (A):關聯式資料庫以 JSON 欄位與向量延伸套件雖然「都能做到」,但巢狀查詢彈性與高 QPS 向量檢索的效能上限不如專用引擎,單一資料庫承擔三種負載也容易互相干擾。 - (C):文件型資料庫的多文件交易與隔離保證相對較弱,以其承擔「不得超賣」的庫存扣減,一致性風險過高;統一技術棧的維運便利無法彌補交易正確性的缺口。 - (D):搜尋引擎型資料庫(如 Elasticsearch)為近即時架構且預設最終一致,文件更新機制不具嚴格 ACID 保證,不適合作為庫存扣減的權威資料來源。 提示:依負載選型:半結構化與複雜查詢用文件型、向量檢索用向量資料庫、強一致交易用關聯式;單一資料庫難以同時滿足三種極端需求。
115年第一次中級AI應用規劃師第二科大數據處理分析與應用 第14題

某AI平台的資料量已達 PB 級,單一資料庫節點已無法負荷,決定採用分片(Sharding)策略。下列何者為 Sharding設計的主要目的?

  1. A增加資料備份數量以提升安全性
  2. B將查詢結果預先計算以降低延遲
  3. C將資料水平分割以提升擴展性與負載均衡
  4. D將資料壓縮以減少儲存成本
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 分片(Sharding)是把同一份大型資料集依分片鍵(Shard Key)「水平分割」成多個子集,分散存放於多個節點,各節點只負責自身資料子集的儲存與讀寫。目的有二:突破單機容量與吞吐上限,達成水平擴展(Scale-out);並將查詢與寫入流量分散到多個節點,實現負載均衡。PB 級資料超出單節點負荷時,分片是標準解法,故 (C) 正確。 【為何其他選項錯了?】 - (A):增加備份數量、提升資料安全性與可用性是複製(Replication)的目的;分片是把資料切割分散,每個分片預設只有一份,兩種機制常搭配使用但目的不同。 - (B):預先計算查詢結果屬於物化視圖(Materialized View)或快取策略,與水平分割資料是不同層次的優化手段。 - (D):壓縮儲存依靠儲存格式與編碼技術(如列式儲存、壓縮演算法);分片只是將資料分散到不同節點,資料總量並未減少。 提示:Sharding 是水平切割以擴展與分流;Replication 是多副本以高可用,兩者目的不同,不可混淆。

相關節點