模型與訓練

Parameter 參數是什麼?模型腦袋裡的連結權重

Parameter(參數)是 AI 模型內部的數值,作用類似大腦裡神經元之間的連結強度,決定輸入的資訊會怎麼被處理與輸出。訓練就是不斷調整這些數值的過程。常聽到的 70B、175B 就是參數量,代表模型的知識容量規模。參數越多通常能學到越複雜的模式,但也需要更多資料與算力,而且不保證在你的任務上表現更好。
Parameter 參數是什麼?模型腦袋裡的連結權重:文章重點卡

Parameter 參數是什麼?模型腦袋裡的連結權重

看模型介紹一定會看到 7B、70B、175B 這些數字。它們指的就是參數量。

這個數字很好用也很容易誤導。搞懂它代表什麼、不代表什麼,選模型的時候會少走很多冤枉路。

你將學到什麼

定義

模型內部的連結權重,由訓練資料調整出來,決定輸入怎麼影響輸出。

白話比喻

像大腦神經元之間的連結強度,強弱決定你怎麼學會與記住一件事。

代表什麼

知識容量的規模上限。容量大,能容納的模式比較複雜。

不代表什麼

不代表答得比較準。資料品質、訓練方法、任務適配同樣關鍵。

定義

參數是模型裡面的一堆數值,作用像神經元之間的連結權重。它決定一段輸入進來之後,會被怎麼加權、怎麼傳遞、最後輸出什麼。

這些數值不是人寫的,是模型從大量資料裡一次次調整出來的。所以參數也可以理解成經驗的累積。

白話比喻

生物大腦靠神經元之間的連結強度來學習與記憶。走過幾次的路徑會變強,沒用到的會變弱。

模型的參數是同一個道理的數學版本。訓練就是反覆調整這些強度,讓預測越來越接近正確答案。

參數量代表什麼、不代表什麼

參數量可以理解成知識容量。容量大,能容納的模式比較複雜,通常在多種任務上的通用能力比較好。

但它不是成績單。同樣參數量的兩個模型,訓練資料與方法不同,表現可以差很多。參數量是容量上限,不是實際發揮。

另外一邊是代價。參數越多,訓練需要的算力與時間越多,跑起來也吃更多硬體,這條成本最後會反映在延遲與價格上。

跟相近名詞的差別

名詞它是什麼跟參數的關係
Parameter模型內部的連結權重本體
Quantization 量化把每個參數用更少位元存參數個數不變,但佔的空間變小
VRAM 顯存顯示卡上的記憶體參數要載進來才能跑,直接決定跑不跑得動
Temperature 溫度推論時的隨機度設定名字也叫參數,但可以隨時改,跟訓練無關

實際用例

本地模型時,參數量與量化程度合起來決定你的顯示卡跑不跑得動。同一個 70B 模型,量化過的版本可能塞得進消費級顯卡,原始精度的版本就得靠伺服器。

用雲端模型時,你其實買的是別人的參數規模與算力。任務單純就選小模型省錢省時間,需要複雜推理再換大的,不必一路用最大的那顆。

常見誤解

最常見的誤解是把參數量當成智力分數,直接比大小決定用哪一個。實務上要看的是「這個任務有沒有被做好」,而不是規格表上的數字。

第二個誤解是以為參數裡存著一句句原文。參數存的是統計上的模式與關聯,不是可查詢的資料庫,所以模型講得出風格卻記不住細節,需要精確資料就要靠 RAG 另外餵。

本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

7B 的 B 是什麼意思?
B 是 billion,十億。7B 就是七十億個參數,70B 是七百億。中文有時寫成 70 億、700 億,換算時容易錯位,看到英文 B 就直接對應十億比較不會弄混。
參數越多一定越好用嗎?
不一定。參數要跟資料量與算力取得平衡:參數太大而資料太少容易過度擬合,資料很多但參數太小又學不到複雜模式。實務上小模型在特定任務微調過之後,常常打得贏通用的大模型,而且更快更便宜。
參數跟我在介面上調的溫度是同一回事嗎?
不是,只是中文都叫參數。模型參數是訓練出來、藏在模型內部、你動不了的權重;溫度、Top-p 這些是推論時的設定值,隨時可以改,改的是這一次生成的行為,不會改動模型本身。