學習路線圖 · AI應用規劃師中級

階段 4 大數據/ML

科目2:機率統計、Hadoop/Spark、分析方法;科目3:ML數學、常見演算法(SVM/隨機森林/非監督)。

在互動地圖中開啟 回學習路線圖

觀念教學

進入中級的硬核區:階段 4 直接對準科目2 與科目3,把大數據處理與機器學習演算法練成能算、能選、能解釋。

這一階段學什麼

  • 機率統計(科目2):機率分布、假設檢定、相關與因果,資料分析的數學語言
  • Hadoop 與 Spark(科目2):分散式儲存與運算框架 — 資料大到單機吃不下時的標準解法,Spark 以記憶體內運算的速度見長
  • 分析方法(科目2):從敘述統計到預測分析的方法家族與適用時機
  • ML 數學與演算法(科目3):SVM、隨機森林等監督式模型的原理、優劣與適用資料
  • 非監督學習(科目3):聚類與降維,沒有標籤時從資料找結構;回歸與分類的界線也要分清

為什麼是現在學

階段 3 你已看過系統全貌,現在往下鑽演算法層才有掛載點;順序顛倒,學統計就會變成背公式。這一階段的統計與模型知識,是階段 5 深度學習與調校的直接前置 — 不懂過擬合的統計本質,超參數調校就是亂槍打鳥。

怎麼練(具體行動)

  1. 每天手算一題機率統計:分布、期望值、檢定,累積 30 題手感
  2. 做一份演算法選型表:SVM、隨機森林、聚類、回歸各自的適用資料型態與限制
  3. 用公開資料集跑一次完整分析:分群找客群,或回歸做預測,寫成兩頁報告
  4. 整理 Hadoop 與 Spark 的差異筆記,標出各自的典型使用場景

完成標準

  • 給一個資料場景,能正確選演算法並說明理由(呼應里程碑:掌握資料與演算法)
  • 基礎機率統計題手算得出來,不靠猜
  • 完成至少一份大數據或 ML 分析實作
⚠️ 常見誤區:監督與非監督的任務搞混 — 有標籤學映射、沒標籤找結構,考題最愛在這裡設陷阱。

科目2 與科目3 的分數大宗都在這一階段,投入產出比全路線最高。

里程碑

✓ 掌握資料與演算法

範例專題

大數據或ML分析

應用場景

Hadoop/SparkSVM/RF聚類/回歸機率統計

iPAS 歷屆考題詳解(6 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第二科大數據處理分析與應用 第11題

若一家公司需即時監控大量物聯網裝置的異常行為,下列哪一種組合最適合此應用?

  1. A傳統關聯式資料庫+圖形視覺化
  2. B批次資料處理+雲端備份
  3. C大數據平台+即時資料分析技術
  4. DWord文件+手動標註
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 題幹有兩個關鍵條件:「大量物聯網裝置」與「即時監控」。大量裝置持續回傳資料,資料量(Volume)與產生速度(Velocity)遠超過傳統單機系統的負荷,需要大數據平台提供分散式儲存與運算能力;「即時」偵測異常行為則需要串流處理(Stream Processing)等即時資料分析技術,在資料抵達時立即運算與告警。兩者組合才能同時滿足規模與時效需求,故 (C) 正確。 【為何其他選項錯了?】 - (A):傳統關聯式資料庫在高頻寫入與巨量資料場景下,效能與擴充性不足;圖形視覺化只是呈現手段,無法解決處理能力問題。 - (B):批次處理的運作模式是累積資料後定期執行,與「即時監控」的需求相矛盾;雲端備份屬資料保全機制,不具分析能力。 - (D):Word 文件與手動標註是人工作業方式,面對大量裝置持續產生的資料流,在速度與規模上皆不具可行性。 提示:題幹同時出現「巨量」與「即時」,對應大數據平台加串流即時分析的組合。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第23題

一家再生能源公司希望預測未來三個月太陽能發電量的波動範圍。由於氣候條件具有高度隨機性,且輸入變數(如日照時數、雲量、溫度)之間存在不確定關係,工程團隊決定以隨機抽樣方式模擬多種可能情境,以估算整體發電量的機率分佈與風險區間。請問此時所採用的技術最符合下列哪一種方法?

  1. A蒙地卡羅方法(Monte Carlo Method);
  2. BK-means聚類(K-means Clustering)
  3. C支持向量迴歸(Support Vector Regression, SVR)
  4. D特徵選取(Feature Selection)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 蒙地卡羅方法(Monte Carlo Method)的核心:當系統具高度隨機性、輸入變數間的關係複雜難以解析求解時,以大量隨機抽樣模擬各種可能情境,再從模擬結果的統計分布,估算目標量的機率分佈、期望值與風險區間。題幹描述對日照時數、雲量、溫度等不確定輸入進行隨機抽樣、模擬多種情境,並估算發電量的機率分佈與風險區間,每個要素都對應蒙地卡羅方法的標準流程,故 (A) 正確。 【為何其他選項錯了?】 - (B):K-means 是把資料劃分為 K 個群集的非監督式聚類演算法,不進行隨機模擬,也無法輸出機率分佈與風險區間。 - (C):支持向量迴歸(SVR)輸出單點預測值,無法直接提供波動範圍與風險區間這類分佈層級的資訊,亦與隨機抽樣模擬無關。 - (D):特徵選取(Feature Selection)是挑選對預測有用變數的前處理步驟,與情境模擬和機率分佈估算無關。 提示:「隨機抽樣、模擬多種情境、估算機率分佈」三個關鍵詞同時出現,即指向蒙地卡羅方法。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第33題

某資料科學團隊正在開發一個客戶相似度比對系統,用於計算所有客戶之間的相似度分數。若系統需逐一比對每一位客戶與其他所有客戶的資料組合,此時演算法的時間複雜度最可能為哪一種?其代表意義為何?

  1. AO(n) — 執行時間與資料量成線性關係
  2. BO(n²) — 執行時間與資料量平方成正比
  3. CO(1) — 執行時間固定不變
  4. DO(log n) — 執行時間與資料量呈對數成長關係
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 每一位客戶都要與其他所有客戶配對比較,配對總數為 n(n−1)/2,約為 n²/2;以 Big-O 記號忽略常數係數後即為 O(n²),代表執行時間與資料量的平方成正比。客戶數從 1 萬成長到 10 萬(10 倍),比對次數約增加 100 倍。這也是大規模相似度比對系統需改用近似最近鄰(ANN)索引或分桶策略的原因:O(n²) 的成長速度無法支撐百萬級用戶規模。故 (B) 正確。 【為何其他選項錯了?】 - (A):O(n) 代表每筆資料只處理固定次數的線性掃描;兩兩配對需對每筆資料再遍歷其餘所有資料,運算量遠超過線性成長。 - (C):O(1) 是不隨資料量變動的固定時間操作,例如雜湊表的單次查找,與逐一配對的情境完全不符。 - (D):O(log n) 是每一步將問題規模減半的對數成長,如二分搜尋;兩兩比對的運算量與對數成長相差多個數量級。 提示:題目描述「每一位與其他所有」的兩兩比對,即對應 O(n²) 的平方成長。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第40題

以下程式碼: import numpy as np v1 = np.array([1, 2, 3]) v2 = np.array([4, 5, 6]) A = np.array([[1, 2], [3, 4]]) 依據上述程式碼進行資料處理,下列何者正確?

  1. Anp.linalg.inv(A) 計算矩陣 A 的行列式
  2. Bv1 * v2 結果為 array([5, 7, 9])
  3. Cnp.dot(v1, v2) 結果為 np.int64(32)
  4. Dnp.linalg.eig(A) 計算矩陣 A 的反矩陣
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 np.dot(v1, v2) 計算兩向量的內積:1×4+2×5+3×6=4+10+18=32,回傳值為純量整數,NumPy 的顯示形式即 np.int64(32),故 (C) 正確。內積是機器學習最基礎的線性代數運算之一,從線性迴歸的加權和到注意力機制的相似度計算,底層皆以內積實作。 【為何其他選項錯了?】 - (A):np.linalg.inv(A) 計算的是反矩陣;行列式需使用 np.linalg.det(A),兩個函數的功能不同。 - (B):v1 * v2 是逐元素相乘,結果為 array([4, 10, 18]);array([5, 7, 9]) 是 v1 + v2 逐元素相加的結果,選項將乘法與加法混淆。 - (D):np.linalg.eig(A) 計算特徵值與特徵向量;反矩陣是 np.linalg.inv(A) 的功能,選項把兩個函數的用途對調。 提示:dot 是內積、* 是逐元素相乘、inv 是反矩陣、det 是行列式、eig 是特徵分解,依函數名稱對應功能。
114年第二梯次中級AI應用規劃師第三科機器學習技術與應用 第41題

考慮擲骰子並採用蒙地卡羅(Monte Carlo)方法估算條件機率,程式碼如下: import numpy as np np.random.seed(123) n = 100000 dice_rolls = np.random.randint(1, 7, size=n) A = (dice_rolls % 2 == 0) B = (dice_rolls > 3) A_and_B = A & B 事件 A:擲出偶數;事件 B:擲出大於 3。請問下列何者為條件機率 P(A|B) 的正確估計式?

  1. AA_and_B.sum() / (A.sum() * B.sum())
  2. BA_and_B.sum() / (A.sum() + B.sum())
  3. CA_and_B.sum() / A.sum()
  4. DA_and_B.sum() / B.sum()
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 條件機率的定義:P(A|B)=P(A∩B)/P(B)。以蒙地卡羅方法估計時,機率以發生次數的比例代替:P(A∩B)≈A_and_B.sum()/n,P(B)≈B.sum()/n,兩者相除後分母的 n 互相消去,得到估計式 A_and_B.sum()/B.sum(),故 (D) 正確。理論驗算:B={4,5,6},其中偶數為 {4,6},P(A|B)=2/3,十萬次模擬的估計值會非常接近 0.667。 【為何其他選項錯了?】 - (A):以 A 與 B 的發生次數相乘作分母,單位變成次數的平方,不對應任何機率公式。 - (B):以兩事件發生次數相加作分母沒有機率意義,P(A)+P(B) 不會出現在條件機率的分母。 - (C):以 A.sum() 作分母計算的是 P(B|A),即「給定擲出偶數,擲出大於 3 的機率」,條件方向與題目要求相反。 提示:P(A|B) 讀作「給定 B 之下 A 的機率」,條件事件 B 的發生次數放分母。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第1題

某量化投資團隊需估算某投資組合未來 30 日的風險值。由於衍生性金融商品的定價模型過於複雜,無法以解析解直接求得,工程師因此採用隨機模擬方式,產生大量市場情境模擬並估計損失分布。此方法屬於下列哪一種技術框架?

  1. A馬可夫鏈(Markov Chain):以狀態轉移機率描述系統演變的隨機過程
  2. B梯度下降最佳化(Gradient Descent):透過迭代更新參數以最小化損失函數
  3. C蒙地卡羅方法(Monte Carlo Method):透過大量隨機抽樣近似機率分布或數值結果
  4. D貝氏推論(Bayesian Inference):結合先驗分布與資料更新後驗機率
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 蒙地卡羅方法(Monte Carlo Method)的核心是透過大量隨機抽樣,近似難以解析求解的機率分布或數值結果。題幹情境中,衍生性商品定價模型過於複雜、無法以解析解直接求得風險值,工程師因此產生大量隨機市場情境、模擬損失分布,再據以估計未來 30 日風險值(VaR),正是金融風險管理中蒙地卡羅模擬的典型應用,故 (C) 正確。 【為何其他選項錯了?】 - (A):馬可夫鏈描述「狀態依轉移機率演變」的隨機過程,重點在狀態轉移結構;題幹並未建模狀態轉移,而是直接以大量抽樣估計損失分布。兩者可結合為 MCMC,但本題考點是抽樣近似本身。 - (B):梯度下降是最佳化演算法,以迭代更新參數來最小化損失函數;其「損失函數」是模型訓練的目標函數,與估計投資損失分布是不同概念。 - (D):貝氏推論的核心是以先驗分布結合觀測資料更新後驗機率;題幹沒有先驗與後驗更新的流程。 提示:無解析解且以大量隨機抽樣近似,對應蒙地卡羅;狀態轉移對應馬可夫鏈;先驗更新對應貝氏推論。

相關節點