模型與訓練
Parameter 參數是什麼?模型腦袋裡的連結權重
Parameter 參數是什麼?模型腦袋裡的連結權重
看模型介紹一定會看到 7B、70B、175B 這些數字。它們指的就是參數量。
這個數字很好用也很容易誤導。搞懂它代表什麼、不代表什麼,選模型的時候會少走很多冤枉路。
你將學到什麼
定義
模型內部的連結權重,由訓練資料調整出來,決定輸入怎麼影響輸出。
白話比喻
像大腦神經元之間的連結強度,強弱決定你怎麼學會與記住一件事。
代表什麼
知識容量的規模上限。容量大,能容納的模式比較複雜。
不代表什麼
不代表答得比較準。資料品質、訓練方法、任務適配同樣關鍵。
定義
參數是模型裡面的一堆數值,作用像神經元之間的連結權重。它決定一段輸入進來之後,會被怎麼加權、怎麼傳遞、最後輸出什麼。
這些數值不是人寫的,是模型從大量資料裡一次次調整出來的。所以參數也可以理解成經驗的累積。
白話比喻
生物大腦靠神經元之間的連結強度來學習與記憶。走過幾次的路徑會變強,沒用到的會變弱。
模型的參數是同一個道理的數學版本。訓練就是反覆調整這些強度,讓預測越來越接近正確答案。
參數量代表什麼、不代表什麼
參數量可以理解成知識容量。容量大,能容納的模式比較複雜,通常在多種任務上的通用能力比較好。
但它不是成績單。同樣參數量的兩個模型,訓練資料與方法不同,表現可以差很多。參數量是容量上限,不是實際發揮。
另外一邊是代價。參數越多,訓練需要的算力與時間越多,跑起來也吃更多硬體,這條成本最後會反映在延遲與價格上。
跟相近名詞的差別
| 名詞 | 它是什麼 | 跟參數的關係 |
|---|---|---|
| Parameter | 模型內部的連結權重 | 本體 |
| Quantization 量化 | 把每個參數用更少位元存 | 參數個數不變,但佔的空間變小 |
| VRAM 顯存 | 顯示卡上的記憶體 | 參數要載進來才能跑,直接決定跑不跑得動 |
| Temperature 溫度 | 推論時的隨機度設定 | 名字也叫參數,但可以隨時改,跟訓練無關 |
實際用例
選本地模型時,參數量與量化程度合起來決定你的顯示卡跑不跑得動。同一個 70B 模型,量化過的版本可能塞得進消費級顯卡,原始精度的版本就得靠伺服器。
用雲端模型時,你其實買的是別人的參數規模與算力。任務單純就選小模型省錢省時間,需要複雜推理再換大的,不必一路用最大的那顆。
最常見的誤解是把參數量當成智力分數,直接比大小決定用哪一個。實務上要看的是「這個任務有沒有被做好」,而不是規格表上的數字。
第二個誤解是以為參數裡存著一句句原文。參數存的是統計上的模式與關聯,不是可查詢的資料庫,所以模型講得出風格卻記不住細節,需要精確資料就要靠 RAG 另外餵。
延伸學習
思維邏輯自我訓練:28 天養成計畫(含入門練習版)
四週把「有感覺」練成「有觀點」。每天一題、一個高階任務配一個低階任務,忙的日子也接得上。買這門課直接附贈《入門練習版》八單元 22 課完整講義與練習單,排在課程最前面,先把思維訓練三部曲、知識吸收金三角這些底層工具建立起來,再進入 28 天的每日練習。
NT$ 999
寫給升國一的你的筆記術
寫給剛升上國中的你:筆記不是寫給老師看的,是寫給考前的自己看的。18 章 85 課圖文,從「為什麼要寫」講到七科各自怎麼記,附 78 份可以印出來寫的練習單,以及 80 課家長專區與 34 張三年筆記養成路徑圖。沒有閱讀期限,國一買、國三還在。
NT$ 3,599

