深度學習知識地圖 · 深度強化學習

深度強化學習

DQN, PPO

在互動地圖中開啟 回深度學習知識地圖

觀念教學

深度強化學習結合深度學習和強化學習,用神經網路處理高維度狀態空間。

白話說明
傳統強化學習用表格記錄「每個狀態做什麼動作最好」,但狀態太多時表格裝不下(圍棋、影像輸入)。深度強化學習用神經網路取代表格,直接從像素或複雜狀態中學會最佳策略。

兩大路線

  • Value-based(DQN):學「每個動作值多少分」,選分最高的
  • Policy-based(PPO):直接學「該怎麼做」的策略函數

使用場景
Atari 遊戲、機器人控制、自動駕駛、ChatGPT 的 RLHF、推薦系統。

優點
能處理超複雜的決策問題、不需要標註資料。

缺點
訓練不穩定、需要大量互動經驗、獎勵設計困難。

應用場景

Atari 遊戲機器人控制推薦系統ChatGPT (RLHF)OpenAI Five自動駕駛遊戲 AI

評估指標

累積獎勵成功率Q 值收斂曲線KL 散度Clip 比例價值損失

相關節點