機器學習知識地圖 · 強化學習
強化學習
Reinforcement Learning
觀念教學
沒有標準答案,只有獎懲:像訓練小狗,做對給點心、做錯不給 — 強化學習讓 AI 在試錯中學會「怎麼行動」。
核心觀念
強化學習(Reinforcement Learning, RL)透過代理人(Agent)與環境(Environment)互動:觀察狀態(State)、採取行動(Action)、收到獎勵(Reward),再依獎懲調整策略(Policy)。目標是最大化累積獎勵 — 不是單步賺最多,而是長期總分最高,所以要能忍受延遲回報。它不依賴事先標記的資料,答案來自行動後的回饋。
白話理解
金融科技公司的智慧投資系統:依市場狀態決定「買進、持有、賣出」,拿每次交易盈虧當獎勵,逐步優化下一次決策。物流公司的車隊調度同理:依配送狀態動態調整行動選擇,讓績效逐步收斂變好 — 兩個都是 iPAS 考過的原題情境。
核心機制
- 探索與利用(Exploration vs Exploitation):嘗試新動作與沿用已知最佳動作之間取平衡,偏一邊就學不動
- 兩大路線:價值型(Q-Learning、SARSA,學「每個動作值多少分」)與策略型(Policy Gradient,直接學「該怎麼做」);Actor-Critic 是兩者合體
- 驗收看累積獎勵、平均每回合獎勵、收斂速度與 Q 值收斂曲線;策略型另看策略熵、梯度方差與 Advantage 估計;實務再加安全性指標與訓練效率
🎯 口訣:狀態、行動、獎勵轉不停 — 沒有標籤,靠試錯把累積獎勵衝到最高。
iPAS 考點
判斷關鍵字:與環境互動、獎勵回饋、試錯調整、不依賴標記資料 — 投資決策、車隊調度、遊戲對弈往 RL 選;「依歷史標記資料學習」是監督式,「找資料中的群組」是非監督式。近年考題把 RL 思維延伸到 Agentic AI:解決方案圖譜(Solution Graph)的作用是把任務拆解成節點與路徑,輔助代理搜尋最佳解決路徑(常搭配啟發式搜尋策略);多代理 LLM 系統若未清楚定義各代理的任務啟動條件與角色分工,最可能出現任務重疊、衝突或流程卡死 — 這一組題目都繞著「代理如何規劃與協作」出。
📝 本節掛載 8 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。
應用場景
評估指標
iPAS 歷屆考題詳解(9 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
一間金融科技公司設計一款智慧投資系統,該系統會根據市場變化自動決定「買進」、「持有」或「賣出」的行動,並根據每次交易後的盈虧結果,逐步優化下一次的投資策略。整個過程中,系統不依賴事先標記的資料,而是根據歷次行動獲得的獎勵進行調整。請問此系統最可能採用哪一種學習方法?
- A強化式學習 (Reinforcement Learning)
- B監督式學習 (Supervised Learning)
- C非監督式學習 (Unsupervised Learning)
- D遷移學習 (Transfer Learning)
看正解與逐選項詳解
正解:A
Agentic AI 在解決方案圖譜(Solution Graph)上尋找最佳解決路徑時,通常會使用什麼樣的搜尋策略?
- A使用廣度優先、深度優先或最佳優先等演算法進行探索
- B每一步都隨機選擇動作,反覆嘗試直到找到一條可行路徑
- C只執行事先假定的一條路徑,失敗就停止
- D完全依靠 LLM 一次性推斷最優完整路徑
看正解與逐選項詳解
正解:A
在建置多代理大型語言模型(Multi-agent LLMs)系統時,若未清楚定義每個代理的任務啟動條件和角色分工,最可能出現什麼問題?
- A回覆內容前後不連貫,系統邏輯斷裂
- B不同代理的答案互相衝突,無法判斷最終決策
- C系統陷入無限對話循環,導致資源耗盡
- D多個代理重複做同樣的任務,造成效率低落
看正解與逐選項詳解
正解:D
在 Agentic AI 的架構中,解決方案圖譜(Solution Graph)常被用來輔助代理的任務執行,其主要作用為何?
- A透過圖形結構完全取代大型語言模型的推理,讓代理只依靠圖演算法完成任務
- B僅用於保存代理的輸出結果,方便後續檢視與審計,而不影響實際推理流程
- C將代理限制在既定流程內,避免其產生偏離設計腳本的行為
- D作為代理在執行過程中的參考框架,用於組織決策步驟並支援任務推理
看正解與逐選項詳解
正解:D
某物流公司導入強化式學習(Reinforcement Learning)優化車隊調度。模型在系 統運行過程中,會依據不同配送狀態動態調整行動選擇方式,使決策結果逐步朝 較佳績效收斂。上述模型在學習過程中的調整行為,最符合下列哪一項強化式學 習核心機制?
- A調整策略函數以改變行動選擇機率
- B更新訓練資料分布以降低模型偏差
- C重新分群狀態資料以識別決策類型
- D建立正確決策標籤進行誤差修正
看正解與逐選項詳解
正解:A
在生成式 AI 應用設計中,情境感知代理(Context-aware Agent)的核心特性為何?
- A能依任務需求即時重新訓練模型參數以優化結果
- B僅依使用者當前輸入指令執行任務,不保留歷程資訊
- C具備跨模態處理能力,可同時理解文字與影像內容
- D能利用對話歷史、任務狀態調整行為與決策
看正解與逐選項詳解
正解:D
某企業建置 Agentic AI 系統處理跨部門複雜任務,團隊以解決方案圖譜(Solution Graph)作為規劃框架。下列何者為 Solution Graph 的主要功能?
- A取代語言模型推理機制,改以圖形搜尋完成決策
- B作為任務知識庫,用於儲存 AI 已完成案例以供檢索
- C限制代理(Agent)僅能依固定流程執行,以降低行為不確定性
- D定義代理(Agent)可參考的任務分解與決策路徑結構
看正解與逐選項詳解
正解:D
某電商平台導入強化學習(Reinforcement Learning)技術優化商品推薦策略,AI 代理(AI Agent)會根據使用者的點擊與購買行為持續調整推薦內容。技術團隊在討論中發現,系統面臨一個核心挑戰:若AI Agent 總是推薦過去表現良好的商品,可能會錯失發掘更高潛力商品的機會;但若頻繁嘗試未知商品,又可能影響短期的推薦成效與使用者體驗。請問上述情境敘述的是強化學習中哪一個核心問題?
- A探索與利用的權衡(Exploration vs. Exploitation);
- B偏差與變異的權衡(Bias vs. Variance);
- C梯度爆炸與消失(Vanishing and Exploding Gradients);
- D過擬合與欠擬合(Overfitting and Underfitting)
看正解與逐選項詳解
正解:A
某倉儲自動化公司以強化學習(Reinforcement Learning, RL)訓練機器手臂進行揀貨,獎勵函數設計為「每成功抓取一個貨品得+1 分」。部署後發現機器手臂學會反覆放開再抓取同一物品,以累積分數,但實際完成任務的效率極低。請問此現象的核心問題為何?應如何修正獎勵設計?
- A獎勵塑形(Reward Shaping):將獎勵改為「成功完成一次揀貨任務」而非單次抓取行為
- B策略退化(Policy Degradation):降低學習率以穩定訓練
- C信用分配問題(Credit Assignment Problem):引入優勢函數(Advantage Function)
- D災難性遺忘(Catastrophic Forgetting):加入經驗回放(Replay Buffer)
看正解與逐選項詳解
正解:A