深度學習知識地圖 · 深度強化學習
PPO
Proximal Policy Optimization
觀念教學
PPO (Proximal Policy Optimization) 是穩定的策略優化方法,兼顧訓練穩定性和效率。
為什麼 RLHF 選 PPO?
RLHF(Reinforcement Learning from Human Feedback,人類回饋強化學習)是讓 LLM 對齊人類偏好的關鍵技術,而 PPO 是其中最核心的演算法。
RLHF 流程中 PPO 的角色
- 獎勵模型(Reward Model)根據人類偏好打分
- PPO 根據分數調整 LLM 的生成策略
- 用 KL 散度約束,避免模型偏離太遠變成「討好機器」
為什麼不用其他 RL?
- 傳統 Policy Gradient:更新幅度不穩定,容易崩潰
- PPO 用 Clip 機制限制每次更新幅度,穩定又高效
- 適合語言模型這種超大參數空間的微調
比喻:PPO 像教練帶選手改動作,每次只微調一點點,不會一次改太多導致姿勢全歪。
應用場景
評估指標
iPAS 歷屆考題詳解(1 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某新創公司希望針對特定醫療診斷任務微調語言模型,但受限於資料取得困難,目前僅收集到少量已標註的診斷病例。在標註資料極為有限的條件下,強化微調(Reinforcement Fine-Tuning, RFT)相較於監督式微調(Supervised Fine-Tuning, SFT))最主要的優勢為何?
- ARFT 需仰賴大量高品質標註資料進行訓練,因此在資料有限時仍能維持較佳穩定性;
- BRFT 透過獎懲回饋機制引導模型優化,對大量標註資料的依賴相對較低,較適用於資料有限的情境;
- CRFT 與SFT 在資料需求上本質相同,主要差異僅在訓練效率,資料量不影響兩者適用性;
- DRFT 可直接從未標註的診斷資料中自動產生正確標註,因此在資料有限時可完全取代SFT
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
強化微調(Reinforcement Fine-Tuning, RFT)以獎懲回饋機制引導模型優化:模型產生答案後,依評分或驗證規則給予獎勵訊號,據此調整生成行為。相較之下,監督式微調(SFT)需要大量「輸入-標準答案」成對的標註資料。在標註病例極少的情境下,RFT 可藉由回饋訊號從有限資料中反覆學習,對大量標註資料的依賴相對較低,因此更適用於資料有限的醫療診斷微調任務,選項 (B) 正確。
【為何其他選項錯了?】
- (A):敘述與 RFT 的特性相反;若仍仰賴大量高品質標註資料訓練,便稱不上是資料有限情境下的優勢。
- (C):RFT 與 SFT 的訓練訊號不同,前者靠獎懲回饋、後者靠成對標註,資料需求本質不同,並非僅差在訓練效率。
- (D):RFT 無法自動為未標註資料產生保證正確的標籤,仍需可靠的獎勵或評分機制,也不能完全取代 SFT。
提示:SFT 學標準答案,RFT 以回饋訊號調整行為;「標註極少」的題幹條件指向 RFT 的低標註依賴。