深度學習知識地圖 · NLP 與 LLM

Scaling Laws

規模法則 / Chinchilla

在互動地圖中開啟 回深度學習知識地圖

觀念教學

大模型不是「越大越好」的玄學,而是可以先算再蓋的工程 — Scaling Laws 告訴你:參數、資料、算力加多少,loss 會降多少。

核心觀念

Scaling Laws(規模法則):模型的 Loss 隨參數量 N、資料量 D、算力 C 以冪次律可預測地下降,畫在對數座標上近乎直線。價值在「可預測」:先用小模型量出曲線,就能外推大模型的成本效益,再決定要不要砸錢。

白話理解

像蓋摩天大樓前的結構計算:不必真的蓋一棟來試,先算就知道多少鋼筋撐多高。訓練 GPT 等級的模型燒的是天文數字的算力,Scaling Laws 就是開工前那張試算表。

關鍵細節

  • Chinchilla 法則:固定算力下,N 與 D 等比例一起放大最有效率(compute-optimal);經驗值是每個參數約配 20 個 token
  • 經典反例:GPT-3 參數大、資料太少,屬「欠訓練」 — 同樣算力改用小一點的模型配更多資料,效果更好
  • 算力速算:C 約等於 6 × N × D(單位 FLOPs),訓練預算的估算公式
  • 邊界:存在不可約 Loss E(規模再大也降不掉的底線);高品質資料有上限;成本與能耗是硬牆
  • 能力湧現(Emergence):某些能力跨過規模門檻才突然出現 — 冪次律預測得了 Loss,預測不了湧現
🎯 口訣:參數配資料、一比二十;算力 6ND,Loss 冪次降。

iPAS 考點

必考 Chinchilla 結論:「固定算力,該加參數還是加資料?」→ 等比例一起加;陷阱選項是「參數越大越好」。「GPT-3 的問題出在哪」→ 資料不足、欠訓練。名詞題:compute-optimal、能力湧現;「每參數約 20 個 token」也適合出成配對選項。

應用場景

模型規模規劃訓練預算估算算力與成本評估

評估指標

LossFLOPstokens/參數

相關節點