深度學習知識地圖 · NLP 與 LLM
Scaling Laws
規模法則 / Chinchilla
觀念教學
大模型不是「越大越好」的玄學,而是可以先算再蓋的工程 — Scaling Laws 告訴你:參數、資料、算力加多少,loss 會降多少。
核心觀念
Scaling Laws(規模法則):模型的 Loss 隨參數量 N、資料量 D、算力 C 以冪次律可預測地下降,畫在對數座標上近乎直線。價值在「可預測」:先用小模型量出曲線,就能外推大模型的成本效益,再決定要不要砸錢。
白話理解
像蓋摩天大樓前的結構計算:不必真的蓋一棟來試,先算就知道多少鋼筋撐多高。訓練 GPT 等級的模型燒的是天文數字的算力,Scaling Laws 就是開工前那張試算表。
關鍵細節
- Chinchilla 法則:固定算力下,N 與 D 等比例一起放大最有效率(compute-optimal);經驗值是每個參數約配 20 個 token
- 經典反例:GPT-3 參數大、資料太少,屬「欠訓練」 — 同樣算力改用小一點的模型配更多資料,效果更好
- 算力速算:C 約等於 6 × N × D(單位 FLOPs),訓練預算的估算公式
- 邊界:存在不可約 Loss E(規模再大也降不掉的底線);高品質資料有上限;成本與能耗是硬牆
- 能力湧現(Emergence):某些能力跨過規模門檻才突然出現 — 冪次律預測得了 Loss,預測不了湧現
🎯 口訣:參數配資料、一比二十;算力 6ND,Loss 冪次降。
iPAS 考點
必考 Chinchilla 結論:「固定算力,該加參數還是加資料?」→ 等比例一起加;陷阱選項是「參數越大越好」。「GPT-3 的問題出在哪」→ 資料不足、欠訓練。名詞題:compute-optimal、能力湧現;「每參數約 20 個 token」也適合出成配對選項。