模型與訓練
Scaling Law 規模法則是什麼?把模型變大真的就會變強嗎
Scaling Law 規模法則是什麼?把模型變大真的就會變強嗎
這幾年模型一代比一代大,背後不是拍腦袋決定的,而是有一組經驗規律在指路。
這組規律叫規模法則。懂它,你才會知道「參數越多越強」這句話哪裡對、哪裡不對。
你將學到什麼
定義
規模法則描述模型參數量、資料量與運算量放大之後,模型表現如何隨之改善的經驗規律。
白話比喻
像備考。書量、練習量、時間三者一起加,分數會穩定上升,但不是加一倍就多一倍。
跟誰容易搞混
規模法則講的是平滑趨勢,湧現能力講的是某些能力到一定規模才突然出現。
定義
Scaling Law(規模法則)是一組經驗規律,描述當模型的參數量、訓練資料量與運算量放大時,模型的預測誤差會隨之穩定下降。
它的重點不是「大就是好」,而是「大得可以預測」。有了這條規律,團隊在真正投入訓練之前,就能大致估算需要多少資料與算力才划算。
白話比喻
想像準備一場考試。你可以增加念的書量、增加練習題量、增加投入的時間,三者一起加,分數會穩定往上。
但沒有人會期待「時間加一倍,分數就加一倍」。規模法則描述的正是這種穩定上升但報酬遞減的關係。
三個要素要一起放大
| 要素 | 說明 | 只放大它會怎樣 |
|---|---|---|
| 參數量 | 模型能記住與表達的容量 | 資料跟不上就容易過擬合,投資報酬很差 |
| 訓練資料量 | 模型看過多少內容,以及內容的品質 | 模型容量不足時,多餘的資料學不進去 |
| 運算量 | 訓練所需的算力與時間 | 算力不足會導致訓練不充分,模型沒學飽 |
所以「把參數堆大就會變強」是一句半對的話。三者失衡的時候,多花的錢多半換不到相稱的效果。
它的天花板在哪
- 報酬遞減,誤差下降的幅度會越來越小,成本卻持續上升。
- 資料有限,高品質的訓練資料不是無限供應,也牽涉授權與版權。
- 成本與能耗,GPU 稀缺,電力與散熱同樣是現實限制。
- 能力不保證,它描述的是平滑趨勢,不保證某項特定能力會在哪個規模出現。
實際用例
廠商發表新模型時常說「效能隨規模提升」,指的就是這條規律。反過來,當一代模型的提升幅度明顯變小,討論就會轉向架構與資料品質,而不是繼續堆參數。
對使用者來說,實務上的意義是:不要只用參數量挑模型。任務適配、上下文長度、速度與成本,往往比規模數字更能決定你用得順不順。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
做出你的第一個 Skill
一場快閃直播的完整重製。從搞懂 Skill 的五個層級開始,帶你把一件你每天在做的重複工作,寫成一支 AI 真的會照做的 Skill ── 命名、description、輸入拆解、Workflow 訪談、Output 與 Checks,最後組成一份能通過格式檢查的 SKILL.md。
NT$ 999

