模型與訓練

Emergent Ability 湧現能力是什麼?模型大到一定程度才長出來的本事

湧現能力(Emergent Ability)是指某些能力在小模型上幾乎看不到,模型規模、資料量與訓練量跨過一定門檻之後才突然明顯出現。像多步推理、依範例類推、跨語言遷移,都被觀察到有這種非線性的躍升。
Emergent Ability 湧現能力是什麼?模型大到一定程度才長出來的本事:文章重點卡

Emergent Ability 湧現能力是什麼?模型大到一定程度才長出來的本事

同一套訓練方法,小模型完全不會做的事,大模型突然就會了。而且不是慢慢變好,是某個規模之後一下子跳上來。

這個現象被稱為湧現。它很有名,但也是誤解最多的名詞之一。

你將學到什麼

定義

規模跨過門檻後才明顯出現的能力,成長是非線性的。

白話比喻

像水加熱到一百度才沸騰,前面九十九度看起來都差不多。

要小心的地方

有研究指出,部分湧現可能來自評測指標的選擇。

定義

湧現能力(Emergent Ability)指的是某些能力在較小的模型上幾乎完全看不到,當模型規模、訓練資料與運算量跨過某個門檻之後,才突然明顯展現出來。

重點在非線性這三個字。它不是隨著規模一點一點變好,而是在某個區間之前近乎隨機,之後迅速拉升。

白話比喻

像燒水。從二十度加到九十九度,水都只是變熱,外觀沒有質變。到了一百度,它開始沸騰,那是另一種狀態。

也像學語言。背了三個月單字,講話還是零零落落;某一天突然可以整句對話。前面的累積不是白費,只是還沒跨過那個門檻。

常被舉出的例子

  • 多步推理:要連續好幾步才能得到答案的題目,小模型幾乎全錯。
  • 依範例類推:只給幾個範例就抓到規則並套用到新題目上。
  • 指令組合:一句話裡有多個條件時,能同時滿足而不是只做到其中一個。
  • 跨語言遷移:在某個語言學到的能力,能用到訓練資料很少的語言上。

這些能力有一個共同點:都需要模型在內部把多個步驟串起來,而不是單純比對表面規律。這也是 思維鏈 這類技巧在大模型上特別有效的原因。

跟相近名詞的差別

名詞在講什麼
Emergent Ability 湧現能力某些能力在跨過規模門檻後才明顯出現。
Scaling Law 規模法則描述規模、資料與算力如何平滑地改善模型表現。
Benchmark 基準測試衡量能力的評測方式,直接影響你看到什麼結果。

三者關係很緊密。規模法則 描述平滑的整體趨勢,湧現描述特定任務上的躍升,而你用哪一套 基準測試 去量,會決定你看到的是躍升還是斜坡。

對實務工作者的意義

第一,換模型時要重測。某個提示詞在大模型上很好用,換到小模型可能整組失效,因為它依賴的能力還沒出現。

第二,不要只看參數量。同樣規模的模型,訓練資料與後訓練方式不同,實際能力可以差很多,一定要用你自己的任務去測。

常見誤解最常見的誤解是把湧現講成模型「覺醒」或「產生意識」,這在技術上完全沒有根據。第二個誤解是以為只要繼續放大就會不斷冒出新能力,實際上規模只是變數之一,而且成本增加得比能力快。第三個要留意的是評測指標本身的影響,同一份結果換一種計分方式,躍升可能就變成平滑曲線。
本文源起本文為酒Ann 的 AI 名詞彙編系列,用白話把常見名詞一次講清楚。歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

湧現能力是模型自己產生意識嗎?
不是。它描述的是統計上的能力躍升,跟意識、自我或意圖沒有關係。用比較嚴謹的說法,它是規模改變帶來的性能非線性變化。
所以模型越大越好嗎?
不能這樣推。規模只是其中一個變數,資料品質、訓練方法與後訓練調校都會影響結果。實務上小模型加上好的檢索與工具,常常比純粹堆大更划算。
為什麼有人說湧現是幻覺?
因為部分研究指出,如果把評測指標從全對才算分改成部分計分,原本看起來斷崖式的躍升會變成平滑的曲線。這代表某些湧現可能是量測方式造成的,值得保留判斷空間。