深度學習知識地圖 · 深度強化學習
深度強化學習
DQN, PPO
觀念教學
深度強化學習結合深度學習和強化學習,用神經網路處理高維度狀態空間。
白話說明
傳統強化學習用表格記錄「每個狀態做什麼動作最好」,但狀態太多時表格裝不下(圍棋、影像輸入)。深度強化學習用神經網路取代表格,直接從像素或複雜狀態中學會最佳策略。
兩大路線
- Value-based(DQN):學「每個動作值多少分」,選分最高的
- Policy-based(PPO):直接學「該怎麼做」的策略函數
使用場景
Atari 遊戲、機器人控制、自動駕駛、ChatGPT 的 RLHF、推薦系統。
優點
能處理超複雜的決策問題、不需要標註資料。
缺點
訓練不穩定、需要大量互動經驗、獎勵設計困難。