模型與訓練
Emergent Ability 湧現能力是什麼?模型大到一定程度才長出來的本事
Emergent Ability 湧現能力是什麼?模型大到一定程度才長出來的本事
同一套訓練方法,小模型完全不會做的事,大模型突然就會了。而且不是慢慢變好,是某個規模之後一下子跳上來。
這個現象被稱為湧現。它很有名,但也是誤解最多的名詞之一。
你將學到什麼
定義
規模跨過門檻後才明顯出現的能力,成長是非線性的。
白話比喻
像水加熱到一百度才沸騰,前面九十九度看起來都差不多。
要小心的地方
有研究指出,部分湧現可能來自評測指標的選擇。
定義
湧現能力(Emergent Ability)指的是某些能力在較小的模型上幾乎完全看不到,當模型規模、訓練資料與運算量跨過某個門檻之後,才突然明顯展現出來。
重點在非線性這三個字。它不是隨著規模一點一點變好,而是在某個區間之前近乎隨機,之後迅速拉升。
白話比喻
像燒水。從二十度加到九十九度,水都只是變熱,外觀沒有質變。到了一百度,它開始沸騰,那是另一種狀態。
也像學語言。背了三個月單字,講話還是零零落落;某一天突然可以整句對話。前面的累積不是白費,只是還沒跨過那個門檻。
常被舉出的例子
- 多步推理:要連續好幾步才能得到答案的題目,小模型幾乎全錯。
- 依範例類推:只給幾個範例就抓到規則並套用到新題目上。
- 指令組合:一句話裡有多個條件時,能同時滿足而不是只做到其中一個。
- 跨語言遷移:在某個語言學到的能力,能用到訓練資料很少的語言上。
這些能力有一個共同點:都需要模型在內部把多個步驟串起來,而不是單純比對表面規律。這也是 思維鏈 這類技巧在大模型上特別有效的原因。
跟相近名詞的差別
| 名詞 | 在講什麼 |
|---|---|
| Emergent Ability 湧現能力 | 某些能力在跨過規模門檻後才明顯出現。 |
| Scaling Law 規模法則 | 描述規模、資料與算力如何平滑地改善模型表現。 |
| Benchmark 基準測試 | 衡量能力的評測方式,直接影響你看到什麼結果。 |
三者關係很緊密。規模法則 描述平滑的整體趨勢,湧現描述特定任務上的躍升,而你用哪一套 基準測試 去量,會決定你看到的是躍升還是斜坡。
對實務工作者的意義
第一,換模型時要重測。某個提示詞在大模型上很好用,換到小模型可能整組失效,因為它依賴的能力還沒出現。
第二,不要只看參數量。同樣規模的模型,訓練資料與後訓練方式不同,實際能力可以差很多,一定要用你自己的任務去測。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
寫給升國一的你的筆記術
寫給剛升上國中的你:筆記不是寫給老師看的,是寫給考前的自己看的。18 章 85 課圖文,從「為什麼要寫」講到七科各自怎麼記,附 78 份可以印出來寫的練習單,以及 80 課家長專區與 34 張三年筆記養成路徑圖。沒有閱讀期限,國一買、國三還在。
NT$ 3,599

