學習路線圖 · AI應用規劃師中級
階段 4 大數據/ML
科目2:機率統計、Hadoop/Spark、分析方法;科目3:ML數學、常見演算法(SVM/隨機森林/非監督)。
觀念教學
進入中級的硬核區:階段 4 直接對準科目2 與科目3,把大數據處理與機器學習演算法練成能算、能選、能解釋。
這一階段學什麼
- 機率統計(科目2):機率分布、假設檢定、相關與因果,資料分析的數學語言
- Hadoop 與 Spark(科目2):分散式儲存與運算框架 — 資料大到單機吃不下時的標準解法,Spark 以記憶體內運算的速度見長
- 分析方法(科目2):從敘述統計到預測分析的方法家族與適用時機
- ML 數學與演算法(科目3):SVM、隨機森林等監督式模型的原理、優劣與適用資料
- 非監督學習(科目3):聚類與降維,沒有標籤時從資料找結構;回歸與分類的界線也要分清
為什麼是現在學
階段 3 你已看過系統全貌,現在往下鑽演算法層才有掛載點;順序顛倒,學統計就會變成背公式。這一階段的統計與模型知識,是階段 5 深度學習與調校的直接前置 — 不懂過擬合的統計本質,超參數調校就是亂槍打鳥。
怎麼練(具體行動)
- 每天手算一題機率統計:分布、期望值、檢定,累積 30 題手感
- 做一份演算法選型表:SVM、隨機森林、聚類、回歸各自的適用資料型態與限制
- 用公開資料集跑一次完整分析:分群找客群,或回歸做預測,寫成兩頁報告
- 整理 Hadoop 與 Spark 的差異筆記,標出各自的典型使用場景
完成標準
- 給一個資料場景,能正確選演算法並說明理由(呼應里程碑:掌握資料與演算法)
- 基礎機率統計題手算得出來,不靠猜
- 完成至少一份大數據或 ML 分析實作
⚠️ 常見誤區:監督與非監督的任務搞混 — 有標籤學映射、沒標籤找結構,考題最愛在這裡設陷阱。
科目2 與科目3 的分數大宗都在這一階段,投入產出比全路線最高。
里程碑
✓ 掌握資料與演算法
範例專題
大數據或ML分析
應用場景
iPAS 歷屆考題詳解(6 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
若一家公司需即時監控大量物聯網裝置的異常行為,下列哪一種組合最適合此應用?
- A傳統關聯式資料庫+圖形視覺化
- B批次資料處理+雲端備份
- C大數據平台+即時資料分析技術
- DWord文件+手動標註
看正解與逐選項詳解
正解:C
一家再生能源公司希望預測未來三個月太陽能發電量的波動範圍。由於氣候條件具有高度隨機性,且輸入變數(如日照時數、雲量、溫度)之間存在不確定關係,工程團隊決定以隨機抽樣方式模擬多種可能情境,以估算整體發電量的機率分佈與風險區間。請問此時所採用的技術最符合下列哪一種方法?
- A蒙地卡羅方法(Monte Carlo Method);
- BK-means聚類(K-means Clustering)
- C支持向量迴歸(Support Vector Regression, SVR)
- D特徵選取(Feature Selection)
看正解與逐選項詳解
正解:A
某資料科學團隊正在開發一個客戶相似度比對系統,用於計算所有客戶之間的相似度分數。若系統需逐一比對每一位客戶與其他所有客戶的資料組合,此時演算法的時間複雜度最可能為哪一種?其代表意義為何?
- AO(n) — 執行時間與資料量成線性關係
- BO(n²) — 執行時間與資料量平方成正比
- CO(1) — 執行時間固定不變
- DO(log n) — 執行時間與資料量呈對數成長關係
看正解與逐選項詳解
正解:B
以下程式碼: import numpy as np v1 = np.array([1, 2, 3]) v2 = np.array([4, 5, 6]) A = np.array([[1, 2], [3, 4]]) 依據上述程式碼進行資料處理,下列何者正確?
- Anp.linalg.inv(A) 計算矩陣 A 的行列式
- Bv1 * v2 結果為 array([5, 7, 9])
- Cnp.dot(v1, v2) 結果為 np.int64(32)
- Dnp.linalg.eig(A) 計算矩陣 A 的反矩陣
看正解與逐選項詳解
正解:C
考慮擲骰子並採用蒙地卡羅(Monte Carlo)方法估算條件機率,程式碼如下: import numpy as np np.random.seed(123) n = 100000 dice_rolls = np.random.randint(1, 7, size=n) A = (dice_rolls % 2 == 0) B = (dice_rolls > 3) A_and_B = A & B 事件 A:擲出偶數;事件 B:擲出大於 3。請問下列何者為條件機率 P(A|B) 的正確估計式?
- AA_and_B.sum() / (A.sum() * B.sum())
- BA_and_B.sum() / (A.sum() + B.sum())
- CA_and_B.sum() / A.sum()
- DA_and_B.sum() / B.sum()
看正解與逐選項詳解
正解:D
某量化投資團隊需估算某投資組合未來 30 日的風險值。由於衍生性金融商品的定價模型過於複雜,無法以解析解直接求得,工程師因此採用隨機模擬方式,產生大量市場情境模擬並估計損失分布。此方法屬於下列哪一種技術框架?
- A馬可夫鏈(Markov Chain):以狀態轉移機率描述系統演變的隨機過程
- B梯度下降最佳化(Gradient Descent):透過迭代更新參數以最小化損失函數
- C蒙地卡羅方法(Monte Carlo Method):透過大量隨機抽樣近似機率分布或數值結果
- D貝氏推論(Bayesian Inference):結合先驗分布與資料更新後驗機率
看正解與逐選項詳解
正解:C