深度學習知識地圖 · NLP 與 LLM

RLHF 對齊

人類回饋強化學習

在互動地圖中開啟 回深度學習知識地圖

觀念教學

GPT-3 會接話但不太聽話,ChatGPT 才像個得體的助理 — 中間那道關鍵工序就是 RLHF:用人類偏好把語言模型「調教變乖」。

核心觀念

RLHF(Reinforcement Learning from Human Feedback,人類回饋強化學習)是 GPT 變成 ChatGPT 的關鍵一步,三階段:

  1. 監督微調(SFT):用人工示範的優質回答,教模型基本對話
  2. 獎勵模型(RM):人類對多個回答排序,訓練出一個會「打分」的模型
  3. 強化學習(PPO):模型往高分方向更新,同時加 KL 散度約束,防止偏離原模型太遠而「走鐘」

白話理解

新進客服的養成。SFT 是先讀標準應答範本;RM 是主管把幾種回法排出高下,內化成評分標準;PPO 是實戰演練、照評分不斷調整,但公司規定「不能偏離原本的專業話術太遠」— 那條規定就是 KL 約束。

關鍵細節

  • 對齊目標 3H:Helpful(有幫助)、Harmless(無害)、Honest(誠實)
  • 評估:人類偏好勝率(回答被人類選中的比例)、獎勵分數KL 散度
  • 副作用:獎勵駭客(鑽評分漏洞)、諂媚(一味順著使用者)、對齊稅(對齊後部分能力略降)
  • 延伸:DPO 直接用偏好資料最佳化,跳過獎勵模型與強化學習,更簡單穩定
🎯 口訣:SFT 學說話、RM 學打分、PPO 練討好;3H 是目標,KL 是韁繩。

iPAS 考點

三階段順序 SFT → RM → PPO 是排序題常客。考「獎勵模型用什麼訓練」→ 人類的排序偏好資料,不是標準答案標註。易混淆對:RLHF 對 DPO — DPO 不訓練獎勵模型、不跑強化學習。3H 名詞配對,以及「KL 約束是為了防走鐘」,也常入題。

應用場景

ChatGPT 對齊客服語氣控制安全護欄偏好最佳化

評估指標

人類偏好勝率獎勵分數KL 散度

相關節點