模型與訓練
Knowledge Distillation 知識蒸餾是什麼?大模型教小模型
Knowledge Distillation 知識蒸餾是什麼?大模型教小模型
你手機裡那個離線也能用的小模型,很可能就是被大模型「教」出來的。它沒有雲端的算力,卻能回答得像模像樣。
背後的技術叫知識蒸餾。這篇用一個考試的比喻,把它一次講清楚。
你將學到什麼
定義
大模型當老師,把知識轉移給小模型的壓縮技術。
白話比喻
老師不只公布答案,還教你為什麼別的選項不太可能。
跟誰容易搞混
剪枝是刪掉沒用的部分,量化是降低精度,蒸餾是重新訓練一個新模型。
定義
知識蒸餾(Knowledge Distillation)是一種模型壓縮技術。它把一個非常龐大、聰明但跑得很慢的「教師模型」的精華知識,轉移訓練到一個體積小、速度快的「學生模型」上。
目標是在盡量保住準確率的同時,大幅減少模型的大小與計算成本。學生模型學的不只是正確答案,還有教師模型思考時的機率分佈。
白話比喻
傳統訓練像是只給你標準答案:這題選 B,其他都是零分。學生只知道結果,不知道為什麼。
知識蒸餾像是老師把整張思考過程攤開來:這題我有九成把握選 B,但 C 也有一點道理,A 幾乎不可能。這些「軟標籤」帶著暗知識,學生因此學得更細。
蒸餾的流程
- 準備訓練資料,可以是問題、影像或文本。
- 讓教師模型跑一遍,產出軟輸出(Soft Targets),也就是各個答案的機率分佈。
- 讓學生模型同時學兩件事:學正確答案,也學模仿教師的機率分佈。
- 用蒸餾損失衡量兩者的差距,反覆訓練直到學生模型穩定收斂。
教師模型選得越強,蒸餾效果通常越好。學生模型則要視最終要跑在什麼裝置上來決定大小。
跟剪枝與量化差在哪?
| 技術 | 做法 | 產出 |
|---|---|---|
| Knowledge Distillation 知識蒸餾 | 用大模型的輸出當教材,訓練一個新的小模型 | 一個結構全新的小模型 |
| Pruning 模型剪枝 | 把貢獻很小的參數或連結直接剪掉 | 同一個模型,但變瘦了 |
| Quantization 量化 | 把參數的數值精度降低,例如從 16 位元降到 4 位元 | 同一個模型,但每個數字變輕了 |
三者常常一起用。先蒸餾出小模型,再做 剪枝 與 量化,最後才塞進手機或邊緣裝置。
實際用例
同一個模型家族常會推出旗艦版與輕量版,輕量版多半就是走蒸餾這條路。前者留在雲端負責難題,後者放進 App 負責即時反應。
對一般使用者來說,蒸餾的價值很直接:離線可用、回應更快、電池更耐,隱私敏感的資料也不必離開你的裝置。
延伸學習
思維邏輯自我訓練:28 天養成計畫(含入門練習版)
四週把「有感覺」練成「有觀點」。每天一題、一個高階任務配一個低階任務,忙的日子也接得上。買這門課直接附贈《入門練習版》八單元 22 課完整講義與練習單,排在課程最前面,先把思維訓練三部曲、知識吸收金三角這些底層工具建立起來,再進入 28 天的每日練習。
NT$ 999
知識變現切割地圖(高清版下載及陪跑型教材)
《知識變現切割地圖》的完整陪跑版:地圖高清檔,加上五章 27 萬字的網頁版講義與200 張練習卡。從語感引流設計、互動與轉化、內容分層與產品路徑,到角色鏡像與心理設計、內容資源切割再利用,一層一層把「會做內容」變成「能賣內容」。每一節後面都接著可以直接動手填的練習卡。
NT$ 19,800

