模型與訓練

SLM 微型語言模型是什麼?小而美,把一個專業塞滿一顆小模型

SLM(Small Language Model,微型語言模型)是刻意把參數量控制在 1B 到 3B 左右的語言模型。它不追求什麼都會,而是透過知識蒸餾,把某個專業領域的知識濃縮進小模型裡。好處是體積小、延遲低、耗資源少,可以在一般設備甚至手機上離線運行,資料不必外送;代價是通用能力遠不如大模型。
SLM 微型語言模型是什麼?小而美,把一個專業塞滿一顆小模型:文章重點卡

SLM 微型語言模型是什麼?小而美,把一個專業塞滿一顆小模型

你會在兩個場合遇到 SLM:一是有人說「這個功能可以在手機上離線跑」,二是有人說「我們不想把資料傳出去」。這兩句話背後,通常指的都是微型語言模型。

很多人以為模型越大越好,於是把所有任務都丟給最貴的那一顆。SLM 的存在就是提醒你,選型是一道取捨題,不是排名題。

你將學到什麼

定義

參數量約 1B 到 3B、專攻特定領域的小型語言模型。

白話比喻

大模型像通才顧問,SLM 像只做一件事但做得又快又準的專科師傅。

怎麼做出來

靠知識蒸餾,把大模型的判斷方式教給小模型。

跟誰容易搞混

SLM 講的是模型大小,本地端大模型講的是跑在哪裡,兩件事。

定義

SLM 是 Small Language Model 的縮寫,中文叫微型語言模型。它指的是參數量刻意被控制在小範圍的語言模型,常見規格大約落在 1B 到 3B 參數之間。

重點在「刻意」兩個字。SLM 不是做失敗的大模型,而是設計上就決定放棄通用性,換取體積、速度與成本上的優勢。

白話比喻

大模型像一位讀過所有科目的通才顧問,什麼都能聊,但請他來一趟很貴,也要等比較久。

SLM 像巷口那位只修一種機器的老師傅。他不會跟你談文學,但你把機器拿過去,他三分鐘就修好,而且不用預約。

跟 LLM 差在哪

項目SLM 微型語言模型LLM 大型語言模型
參數量約 1B 到 3B約 10B 以上
模型大小幾百 MB 到幾 GB數十 GB 到數百 GB
推理速度快,延遲低較慢,延遲高
硬體需求中低,一般 GPU 或 CPU 就跑得動高,需要高階顯示卡或多卡
能力特性專精特定領域知識廣泛、通用性強
適用場景特定任務、裝置端、離線應用通用對話、複雜推理、創作

小模型的專業是怎麼來的

主要靠知識蒸餾。先用一個能力很強的大模型當老師,讓它對大量專業題目給出答案與判斷方式,再把這套「軟知識」轉移給小模型學習。

配上特定領域的高品質資料、標註問答與專業文件,小模型就能在窄範圍內接近老師的表現。這也是為什麼 SLM 的品質高度取決於資料,而不只是參數。

實際用例

常見的落地場景有幾類:程式碼助手做快速生成與除錯、企業內部知識庫做即時問答、醫療或法律領域做初步整理與判讀、以及手機與車載這類裝置端的智慧功能。

這些場景的共同點是任務範圍固定、要求反應快、而且資料常常不方便外送。要真的塞進一般設備,通常還會再搭配 Quantization 量化 進一步壓縮體積。

常見誤解第一個誤解是把 SLM 當成本地端模型的同義詞。SLM 講的是模型有多大,跑在哪裡是另一回事,大模型也可以放在本機跑,只是要很好的硬體。第二個誤解是覺得小模型一定比較笨,但在它被蒸餾過的專業範圍內,它常常比通用大模型更穩,因為沒有被無關的知識帶偏。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

SLM 和 LLM 差在哪?
差在參數量與定位。LLM 參數通常在百億以上,知識廣泛、通用性強,但體積大、成本高、延遲也高。SLM 參數約 1B 到 3B,專精特定領域,速度快、成本低,可在一般設備上運行。
SLM 是不是就是比較笨的模型?
在通用任務上確實不如大模型,但在它被訓練過的專業範圍內,回答常常更精準也更穩定,因為它沒有被無關知識干擾。用對場景才是重點。
什麼情況該選 SLM?
任務範圍固定、要求低延遲、預算有限,或資料不能外流的時候。像是裝置端助理、企業內部客服問答、程式碼補全這類場景都很適合。