深度學習知識地圖 · 評估指標

評估指標

世界棋王

在互動地圖中開啟 回深度學習知識地圖

觀念教學

別的模型比 loss、比基準分數,AlphaGo 的評估指標大概是史上最霸氣的一條:贏過世界棋王。

核心觀念

AlphaGo 直接拿人類最高水準當標竿:終極評估指標就是戰勝人類頂尖棋手、成為世界棋王。量化上用 Elo 等級分(棋類通用的實力量表,由對弈勝率換算),AlphaGo 系列估計達 Elo 3500 以上,超越所有人類棋手。

白話理解

2016 年 AlphaGo 以 4 比 1 擊敗世界冠軍李世乭,隔年再勝世界排名第一的柯潔。圍棋的可能局面約「10 的 170 次方」,窮舉不可能,它靠的是學出來的「棋感」— 這一勝證明:深度學習加強化學習,能在人類最自豪的直覺領域封頂。

關鍵細節

  • 評估邏輯:自我對弈與對人勝率 → 換算 Elo → 終極驗收是擊敗棋王
  • 技術三件套:策略網路(下哪步)、價值網路(局面多好)、蒙地卡羅樹搜尋(MCTS)
  • 訓練路線:先用人類棋譜起步,再靠自我對弈的強化學習超越人類
  • 後繼者 AlphaGo Zero:完全不用人類棋譜,從零自我對弈,反而更強
  • 啟示:評估指標要對齊終極目標 — 不是 loss 多低,而是「贏了沒」
🎯 口訣:AlphaGo 的 KPI 只有一條 — 贏過棋王;Elo 是尺,棋王是終點線。

iPAS 考點

考 AlphaGo 屬於哪類學習 → 強化學習(自我對弈、以勝負為獎勵);陷阱是選「純監督式」— 人類棋譜只是起步,核心在強化學習。考 AlphaGo Zero 的差異 → 零人類棋譜。考里程碑意義 → 深度學習加強化學習加樹搜尋,首次在圍棋超越人類頂尖水準。

應用場景

人機對戰勝率職業段位

評估指標

世界棋王Elo 3500+

相關節點