機器學習知識地圖 · 強化學習

強化學習

Reinforcement Learning

在互動地圖中開啟 回機器學習知識地圖

觀念教學

沒有標準答案,只有獎懲:像訓練小狗,做對給點心、做錯不給 — 強化學習讓 AI 在試錯中學會「怎麼行動」。

核心觀念

強化學習(Reinforcement Learning, RL)透過代理人(Agent)環境(Environment)互動:觀察狀態(State)、採取行動(Action)、收到獎勵(Reward),再依獎懲調整策略(Policy)。目標是最大化累積獎勵 — 不是單步賺最多,而是長期總分最高,所以要能忍受延遲回報。它不依賴事先標記的資料,答案來自行動後的回饋。

白話理解

金融科技公司的智慧投資系統:依市場狀態決定「買進、持有、賣出」,拿每次交易盈虧當獎勵,逐步優化下一次決策。物流公司的車隊調度同理:依配送狀態動態調整行動選擇,讓績效逐步收斂變好 — 兩個都是 iPAS 考過的原題情境。

核心機制

  • 探索與利用(Exploration vs Exploitation):嘗試新動作與沿用已知最佳動作之間取平衡,偏一邊就學不動
  • 兩大路線:價值型(Q-Learning、SARSA,學「每個動作值多少分」)與策略型(Policy Gradient,直接學「該怎麼做」);Actor-Critic 是兩者合體
  • 驗收看累積獎勵平均每回合獎勵收斂速度Q 值收斂曲線;策略型另看策略熵梯度方差Advantage 估計;實務再加安全性指標訓練效率
🎯 口訣:狀態、行動、獎勵轉不停 — 沒有標籤,靠試錯把累積獎勵衝到最高。

iPAS 考點

判斷關鍵字:與環境互動、獎勵回饋、試錯調整、不依賴標記資料 — 投資決策、車隊調度、遊戲對弈往 RL 選;「依歷史標記資料學習」是監督式,「找資料中的群組」是非監督式。近年考題把 RL 思維延伸到 Agentic AI:解決方案圖譜(Solution Graph)的作用是把任務拆解成節點與路徑,輔助代理搜尋最佳解決路徑(常搭配啟發式搜尋策略);多代理 LLM 系統若未清楚定義各代理的任務啟動條件與角色分工,最可能出現任務重疊、衝突或流程卡死 — 這一組題目都繞著「代理如何規劃與協作」出。

📝 本節掛載 8 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

應用場景

遊戲 AI機器人導航庫存管理機器人控制自動駕駛模擬安全關鍵系統機器人手臂控制自動駕駛Atari 遊戲

評估指標

累積獎勵收斂速度Q 值收斂曲線平均每回合獎勵安全性指標策略熵梯度方差訓練效率Advantage 估計

iPAS 歷屆考題詳解(9 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第17題

一間金融科技公司設計一款智慧投資系統,該系統會根據市場變化自動決定「買進」、「持有」或「賣出」的行動,並根據每次交易後的盈虧結果,逐步優化下一次的投資策略。整個過程中,系統不依賴事先標記的資料,而是根據歷次行動獲得的獎勵進行調整。請問此系統最可能採用哪一種學習方法?

  1. A強化式學習 (Reinforcement Learning)
  2. B監督式學習 (Supervised Learning)
  3. C非監督式學習 (Unsupervised Learning)
  4. D遷移學習 (Transfer Learning)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 題幹的關鍵條件:系統自動決定「買進、持有、賣出」的行動,依每次交易後的盈虧結果逐步優化策略,且不依賴事先標記的資料。這完全對應強化式學習(Reinforcement Learning)的框架:代理人(Agent)在環境中採取行動(Action),依行動結果獲得獎勵(Reward,如盈虧),透過試誤(Trial and Error)不斷調整策略(Policy)以最大化累積獎勵,適合此類動態決策情境。 【為何其他選項錯了?】 - (B):監督式學習需要「輸入與正確答案」成對的標記資料進行訓練;題幹明言不依賴事先標記的資料,且投資決策的「正確行動」難以事先給定。 - (C):非監督式學習用於從無標籤資料中發掘結構(如分群、降維),不涉及行動選擇與獎勵回饋,無法完成「決定行動並優化策略」的需求。 - (D):遷移學習是將既有任務學到的知識轉用於新任務的技術,重點在知識重用,與「依盈虧回饋逐步調整策略」的核心機制無關。 提示:「行動、獎勵回饋、試誤調整策略」三要素同時出現,即為強化式學習。
第四梯次初級AI應用規劃師第二科生成式AI應用與規劃 第11題

Agentic AI 在解決方案圖譜(Solution Graph)上尋找最佳解決路徑時,通常會使用什麼樣的搜尋策略?

  1. A使用廣度優先、深度優先或最佳優先等演算法進行探索
  2. B每一步都隨機選擇動作,反覆嘗試直到找到一條可行路徑
  3. C只執行事先假定的一條路徑,失敗就停止
  4. D完全依靠 LLM 一次性推斷最優完整路徑
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 解決方案圖譜(Solution Graph)將任務的狀態與可行步驟組織成圖結構,Agentic AI 在其上尋找最佳解決路徑時,通常採用系統性的圖搜尋策略:廣度優先搜尋(BFS)適合尋找步驟最少的路徑,深度優先搜尋(DFS)適合先深入探索再回溯,最佳優先搜尋(Best-First Search)則以評估函數引導,優先展開最有希望的節點。這類演算法能有系統地探索、支援回溯與更換路徑,是代理在圖上規劃路徑的主流作法。 【為何其他選項錯了?】 - (B):每一步隨機選擇動作的盲目嘗試,沒有利用圖結構與評估資訊,在分支眾多的解決方案圖上效率極低,不是可行的搜尋策略。 - (C):只執行事先假定的單一路徑、失敗即停止,缺乏探索與回溯能力,等同固定腳本流程,喪失代理應對動態情況的彈性。 - (D):完全依靠 LLM 一次性推斷完整路徑,在多步驟複雜任務中可靠度不足;實務上是以搜尋演算法組織探索過程,LLM 擔任各步驟的評估與規劃角色,而非單次產出整條最優路徑。 提示:Agentic AI 的路徑規劃採用經典圖搜尋(廣度優先/深度優先/最佳優先);隨機嘗試、單一腳本、一次推斷皆非系統性搜尋策略。
第四梯次初級AI應用規劃師第二科生成式AI應用與規劃 第16題

在建置多代理大型語言模型(Multi-agent LLMs)系統時,若未清楚定義每個代理的任務啟動條件和角色分工,最可能出現什麼問題?

  1. A回覆內容前後不連貫,系統邏輯斷裂
  2. B不同代理的答案互相衝突,無法判斷最終決策
  3. C系統陷入無限對話循環,導致資源耗盡
  4. D多個代理重複做同樣的任務,造成效率低落
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 多代理系統中,任務啟動條件(何時由誰接手)與角色分工(誰負責哪類工作)是協作設計的基礎。若未清楚定義,多個代理會對同一任務同時認定自己應該處理,造成重複執行相同工作:同樣的檢索、推理或工具呼叫被多個代理各做一次,運算資源與時間成本倍增,整體效率低落。這是缺乏分工設計最直接、最常見的後果。 【為何其他選項錯了?】 - (A):回覆前後不連貫主要源自上下文管理或記憶機制設計不良,與「誰負責什麼」的分工定義關聯較低。 - (B):代理間答案衝突的癥結在缺乏仲裁或彙整機制;即使分工明確,不同代理仍可能產出不同結論,衝突不是分工缺失最直接的後果。 - (C):無限對話循環主要肇因於缺乏終止條件或互動協定設計不當;分工不清的首要症狀是重複工作,而非必然陷入循環。 提示:啟動條件與分工未定義,最直接的症狀是多代理重複作業;循環問題對應終止條件,衝突問題對應仲裁機制。
第四梯次初級AI應用規劃師第二科生成式AI應用與規劃 第49題

在 Agentic AI 的架構中,解決方案圖譜(Solution Graph)常被用來輔助代理的任務執行,其主要作用為何?

  1. A透過圖形結構完全取代大型語言模型的推理,讓代理只依靠圖演算法完成任務
  2. B僅用於保存代理的輸出結果,方便後續檢視與審計,而不影響實際推理流程
  3. C將代理限制在既定流程內,避免其產生偏離設計腳本的行為
  4. D作為代理在執行過程中的參考框架,用於組織決策步驟並支援任務推理
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 在 Agentic AI 架構中,解決方案圖譜(Solution Graph)的角色是代理執行任務時的參考框架:它將任務分解為節點、將決策選項組織為邊,代理在執行過程中據以確認目前狀態、評估下一步的候選路徑,遇到死路時可回溯或改走分支,同時記錄中間狀態與決策歷程。圖譜負責提供結構與導航,實際的推理與判斷仍由大型語言模型完成,兩者相輔相成,使代理兼具自主性與可控性。 【為何其他選項錯了?】 - (A):圖譜是輔助與組織推理的結構,不是以圖演算法完全取代 LLM 推理;各節點的理解、生成與判斷仍需 LLM 執行。 - (B):圖譜在執行過程中即參與規劃、狀態追蹤與路徑選擇,並非僅事後保存輸出結果的紀錄;若只用於檢視與審計,即失去其輔助推理的核心價值。 - (C):圖譜提供的是可分支、可回溯的參考結構,支援動態調整路徑,而非把代理鎖死在既定腳本內;僵化限制反而違背 Agentic AI 的自主特性。 提示:Solution Graph 是執行中的參考框架與決策骨架;「取代推理」「僅供審計」「限制流程」皆偏離其定位。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第19題

某物流公司導入強化式學習(Reinforcement Learning)優化車隊調度。模型在系 統運行過程中,會依據不同配送狀態動態調整行動選擇方式,使決策結果逐步朝 較佳績效收斂。上述模型在學習過程中的調整行為,最符合下列哪一項強化式學 習核心機制?

  1. A調整策略函數以改變行動選擇機率
  2. B更新訓練資料分布以降低模型偏差
  3. C重新分群狀態資料以識別決策類型
  4. D建立正確決策標籤進行誤差修正
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 強化式學習(Reinforcement Learning)中,代理人(Agent)在某個狀態下採取行動,環境回饋獎勵或懲罰,代理人的目標是學得一套能最大化累積獎勵的策略(Policy)。策略本質上是一個函數,決定在特定狀態下選擇各行動的機率;學習過程即是依據獎懲訊號不斷調整這個策略函數,使能獲得獎勵的行動被選擇的機率提高、造成損失的行動機率降低。題幹「依配送狀態動態調整行動選擇方式,使決策結果逐步朝較佳績效收斂」,正是調整策略函數以改變行動選擇機率的機制。 【名詞白話語典】 - 強化式學習(Reinforcement Learning):一種讓 AI 透過嘗試與回饋來學習的機制,帶來獎勵的行動被強化,帶來懲罰的行動被抑制。 - 策略(Policy):代理人的行動方針,決定在什麼狀態下採取什麼行動,或以多大機率採取各行動。 【為何其他選項錯了?】 - (B):強化式學習透過與環境互動累積經驗,核心機制不是更新訓練資料分布以降低偏差;該敘述屬於資料層面的處理手法。 - (C):重新分群狀態資料是非監督式學習的做法,與強化式學習的獎懲調整機制無關。 - (D):建立正確決策標籤進行誤差修正是監督式學習;強化式學習沒有標準答案標籤,只有獎勵訊號。 提示:強化式學習的核心調整對象是策略函數;監督式靠標籤、非監督式找結構、強化式調策略。
115年第一次初級AI應用規劃師第二科生成式AI應用與規劃 第15題

在生成式 AI 應用設計中,情境感知代理(Context-aware Agent)的核心特性為何?

  1. A能依任務需求即時重新訓練模型參數以優化結果
  2. B僅依使用者當前輸入指令執行任務,不保留歷程資訊
  3. C具備跨模態處理能力,可同時理解文字與影像內容
  4. D能利用對話歷史、任務狀態調整行為與決策
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 情境感知代理(Context-aware Agent)的「情境(Context)」指上下文資訊:除了使用者當前的輸入,還包括對話歷史(先前談過的內容)、任務狀態(目前進行到哪一步)與使用者偏好等。情境感知代理會綜合這些資訊動態調整行為與決策,使回應更連貫、更個人化,這是它與只處理單次輸入的無狀態代理最根本的差異,選項 (D) 正確描述此核心特性。 【為何其他選項錯了?】 - (A):依任務需求即時重新訓練模型參數成本極高且不切實際;情境感知是在推論階段利用上下文資訊,不涉及改變模型參數。 - (B):僅依當前輸入執行、不保留歷程資訊,是無狀態(Stateless)代理的描述,正好是情境感知的反面。 - (C):跨模態處理是模型能力的一種,並非情境感知的核心定義;純文字代理同樣可以具備情境感知能力。 提示:情境感知的關鍵詞是「對話歷史、任務狀態」;與模態種類或重新訓練無關。
115年第一次初級AI應用規劃師第二科生成式AI應用與規劃 第16題

某企業建置 Agentic AI 系統處理跨部門複雜任務,團隊以解決方案圖譜(Solution Graph)作為規劃框架。下列何者為 Solution Graph 的主要功能?

  1. A取代語言模型推理機制,改以圖形搜尋完成決策
  2. B作為任務知識庫,用於儲存 AI 已完成案例以供檢索
  3. C限制代理(Agent)僅能依固定流程執行,以降低行為不確定性
  4. D定義代理(Agent)可參考的任務分解與決策路徑結構
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 解決方案圖譜(Solution Graph)是 Agentic AI 處理複雜多步驟任務時的規劃框架,通常以有向圖表示:節點對應任務分解後的子任務,邊對應可行的決策路徑,並可納入條件判斷、回溯與重試等流程設計。它定義了代理可參考的任務分解與決策路徑結構,如同執行複雜任務時的行動藍圖,選項 (D) 正確描述其主要功能。 【為何其他選項錯了?】 - (A):圖譜用於指引語言模型的推理流程,而非取代推理;各節點的實際執行仍依賴 LLM 的能力。 - (B):圖譜定義的是任務流程結構,不是儲存已完成案例供檢索的知識庫;後者屬於記憶或檢索系統的職責。 - (C):圖譜可包含條件分支與動態選擇,目的在指引而非把代理鎖死於固定流程;「僅能依固定流程執行」與其設計精神不符。 提示:Solution Graph 的兩個關鍵詞是任務分解與決策路徑;它是參考藍圖,不是知識庫,也不是硬性腳本。
115年第二次初級AI應用規劃師第一科人工智慧基礎概論 第24題

某電商平台導入強化學習(Reinforcement Learning)技術優化商品推薦策略,AI 代理(AI Agent)會根據使用者的點擊與購買行為持續調整推薦內容。技術團隊在討論中發現,系統面臨一個核心挑戰:若AI Agent 總是推薦過去表現良好的商品,可能會錯失發掘更高潛力商品的機會;但若頻繁嘗試未知商品,又可能影響短期的推薦成效與使用者體驗。請問上述情境敘述的是強化學習中哪一個核心問題?

  1. A探索與利用的權衡(Exploration vs. Exploitation);
  2. B偏差與變異的權衡(Bias vs. Variance);
  3. C梯度爆炸與消失(Vanishing and Exploding Gradients);
  4. D過擬合與欠擬合(Overfitting and Underfitting)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 持續推薦過去表現良好的商品,是利用(Exploitation)既有知識以確保短期成效;嘗試未知商品則是探索(Exploration)新的可能,以發掘潛在更佳選項。兩者此消彼長:過度利用會錯失更高潛力的商品,過度探索則犧牲短期成效與使用者體驗。如何在兩者間取捨,正是強化學習的核心問題「探索與利用的權衡(Exploration vs. Exploitation)」,題幹情境完全對應。 【為何其他選項錯了?】 - (B):偏差與變異的權衡用於分析模型的泛化誤差組成,屬於模型複雜度議題,不是行動選擇策略的取捨。 - (C):梯度消失與爆炸是深度神經網路反向傳播訓練時的數值問題,與推薦策略的決策取捨無關。 - (D):過擬合與欠擬合描述模型對訓練資料的擬合程度與泛化狀態,並非「沿用既有選項或嘗試新選項」的權衡。 提示:「沿用既有最佳選項」與「嘗試未知選項」之間的取捨,即探索與利用的權衡,是強化學習的標誌性課題。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第31題

某倉儲自動化公司以強化學習(Reinforcement Learning, RL)訓練機器手臂進行揀貨,獎勵函數設計為「每成功抓取一個貨品得+1 分」。部署後發現機器手臂學會反覆放開再抓取同一物品,以累積分數,但實際完成任務的效率極低。請問此現象的核心問題為何?應如何修正獎勵設計?

  1. A獎勵塑形(Reward Shaping):將獎勵改為「成功完成一次揀貨任務」而非單次抓取行為
  2. B策略退化(Policy Degradation):降低學習率以穩定訓練
  3. C信用分配問題(Credit Assignment Problem):引入優勢函數(Advantage Function)
  4. D災難性遺忘(Catastrophic Forgetting):加入經驗回放(Replay Buffer)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 機器手臂學會反覆放開再抓取同一物品以累積分數,是典型的獎勵漏洞利用(Reward Hacking):獎勵函數獎勵的是「抓取動作」而非「完成任務」,代理人便忠實地最大化字面上的獎勵,而非設計者期望的目標。修正之道是獎勵塑形(Reward Shaping)或重新設計獎勵:將獎勵綁定於「成功完成一次揀貨任務」(例如物品放置到目標位置才計分),並可對重複無效動作施加時間或能耗懲罰,使獎勵與真實任務目標對齊。 【為何其他選項錯了?】 - (B):降低學習率只影響訓練的穩定性,無法改變錯誤的最佳化目標;獎勵定義錯誤時,訓練再穩定仍會收斂到相同的投機行為。 - (C):信用分配問題處理的是「長序列中哪個動作對最終結果有貢獻」;本例中代理人明確知道抓取動作可得分,問題在獎勵目標錯位,引入優勢函數無法修正。 - (D):災難性遺忘指學習新任務時喪失舊能力;本例代理人並未遺忘任何能力,而是精確地最佳化了設計不當的計分規則。 提示:獎勵函數決定代理人的行為方向;獎勵應綁定任務「結果」而非中間「動作」,以避免 Reward Hacking。

相關節點