深度學習知識地圖 · 深度強化學習

AlphaGo

CNN + MCTS

在互動地圖中開啟 回深度學習知識地圖

觀念教學

2016 年,DeepMind 的 AlphaGo 擊敗人類世界棋王,把「AI 要贏圍棋至少還要十年」的預言當場作廢 — 深度強化學習最著名的成名作。

核心觀念

AlphaGo 的配方是 CNN 加 MCTS深度卷積神經網路(CNN)把棋盤當影像讀,負責評估盤面(價值網路:這個局面誰佔優)與選擇落子(策略網路:高手最可能下哪一手);蒙地卡羅樹搜尋(MCTS)再以 CNN 的判斷為指引,往前模擬搜索未來可能的變化,把運算力集中在少數有希望的分支。圍棋的可能局面數遠超西洋棋,暴力搜索無望;CNN 的「棋感」把搜索空間砍到可行,才是勝負手。

白話理解

像頂尖棋士的思考:直覺(CNN)先圈出幾個候選點,再腦內推演(MCTS)每個候選的後續變化,挑勝率最高的一手。AlphaGo 把「直覺加推演」全部變成可訓練、可搜索的模組。

關鍵細節

  • 策略網路先向人類棋譜做監督式學習,再靠自我對弈的強化學習持續變強
  • 價值網路直接輸出盤面的預期勝率,省去每次都模擬到終局
  • 棋力以 Elo 等級分衡量,最終超越人類世界棋王水準
  • 後繼者 AlphaGo Zero 完全不用人類棋譜,從零自我對弈,反而更強
🎯 口訣:CNN 出直覺,MCTS 算變化,自我對弈登棋王。

iPAS 考點

考組件配對:「評估盤面與選擇落子」→ CNN;「搜索未來可能的變化」→ MCTS。第二刀考學習範式:AlphaGo 結合監督式(學人類棋譜)與強化學習(自我對弈),選項寫「純監督式學習」就是陷阱。另一個坑:把 MCTS 說成神經網路 — 它是搜索演算法,不是網路。

應用場景

圍棋策略遊戲

評估指標

Elo 等級分世界棋王

相關節點