模型與訓練

Scaling Law 規模法則是什麼?把模型變大真的就會變強嗎

Scaling Law(規模法則)是一組經驗規律,描述當模型參數量、訓練資料量與運算量同時放大時,模型的預測誤差會隨之穩定下降。它的實務價值在於可預測性:在真正投入訓練之前,就能大致估算需要多少資料與算力。但它描述的是平滑趨勢,不保證特定能力何時出現,也不是無限延伸的保證。
Scaling Law 規模法則是什麼?把模型變大真的就會變強嗎:文章重點卡

Scaling Law 規模法則是什麼?把模型變大真的就會變強嗎

這幾年模型一代比一代大,背後不是拍腦袋決定的,而是有一組經驗規律在指路。

這組規律叫規模法則。懂它,你才會知道「參數越多越強」這句話哪裡對、哪裡不對。

你將學到什麼

定義

規模法則描述模型參數量、資料量與運算量放大之後,模型表現如何隨之改善的經驗規律。

白話比喻

像備考。書量、練習量、時間三者一起加,分數會穩定上升,但不是加一倍就多一倍。

跟誰容易搞混

規模法則講的是平滑趨勢,湧現能力講的是某些能力到一定規模才突然出現。

定義

Scaling Law(規模法則)是一組經驗規律,描述當模型的參數量訓練資料量運算量放大時,模型的預測誤差會隨之穩定下降。

它的重點不是「大就是好」,而是「大得可以預測」。有了這條規律,團隊在真正投入訓練之前,就能大致估算需要多少資料與算力才划算。

白話比喻

想像準備一場考試。你可以增加念的書量、增加練習題量、增加投入的時間,三者一起加,分數會穩定往上。

但沒有人會期待「時間加一倍,分數就加一倍」。規模法則描述的正是這種穩定上升但報酬遞減的關係。

三個要素要一起放大

要素說明只放大它會怎樣
參數量模型能記住與表達的容量資料跟不上就容易過擬合,投資報酬很差
訓練資料量模型看過多少內容,以及內容的品質模型容量不足時,多餘的資料學不進去
運算量訓練所需的算力與時間算力不足會導致訓練不充分,模型沒學飽

所以「把參數堆大就會變強」是一句半對的話。三者失衡的時候,多花的錢多半換不到相稱的效果。

它的天花板在哪

  • 報酬遞減,誤差下降的幅度會越來越小,成本卻持續上升。
  • 資料有限,高品質的訓練資料不是無限供應,也牽涉授權與版權。
  • 成本與能耗GPU 稀缺,電力與散熱同樣是現實限制。
  • 能力不保證,它描述的是平滑趨勢,不保證某項特定能力會在哪個規模出現。

實際用例

廠商發表新模型時常說「效能隨規模提升」,指的就是這條規律。反過來,當一代模型的提升幅度明顯變小,討論就會轉向架構與資料品質,而不是繼續堆參數。

對使用者來說,實務上的意義是:不要只用參數量挑模型。任務適配、上下文長度、速度與成本,往往比規模數字更能決定你用得順不順。

常見誤解最常見的誤解是把規模法則當成「模型越大,什麼都會」。它預測的是整體誤差趨勢,不是個別能力的出現時機,那件事屬於 Emergent Ability 湧現能力 的討論範圍。另一個誤解是以為它是定律,它其實是從實驗歸納出來的經驗規律,會因為架構、資料與訓練方法而改變。
本文源起本文為酒Ann 的 AI 名詞彙編系列,用白話把常見名詞一次講清楚。歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

參數越多就一定越強嗎?
不一定。三個要素必須一起放大才有效:參數量、訓練資料量、運算量。只把參數堆大而資料量與訓練量跟不上,效果會遠低於預期,還可能過擬合。實務上也證明,訓練資料的品質與配比往往比單純堆參數更關鍵。
規模法則會一直成立嗎?
它描述的是經驗趨勢,不是物理定律。改善幅度會遞減,成本與能耗卻線性甚至更快上升,高品質資料也不是無限供應。所以業界同時在往另外幾個方向走,例如專家混合架構、推理階段增加運算,以及提升資料品質。
它跟我用 AI 有什麼關係?
它解釋了兩件你會遇到的事。第一,為什麼大模型貴而且慢,因為算力就是成本。第二,為什麼小模型在特定任務上未必輸,因為規模不是唯一變因,任務適配與微調同樣有效。