模型與訓練
SLM 微型語言模型是什麼?小而美,把一個專業塞滿一顆小模型
SLM 微型語言模型是什麼?小而美,把一個專業塞滿一顆小模型
你會在兩個場合遇到 SLM:一是有人說「這個功能可以在手機上離線跑」,二是有人說「我們不想把資料傳出去」。這兩句話背後,通常指的都是微型語言模型。
很多人以為模型越大越好,於是把所有任務都丟給最貴的那一顆。SLM 的存在就是提醒你,選型是一道取捨題,不是排名題。
你將學到什麼
定義
參數量約 1B 到 3B、專攻特定領域的小型語言模型。
白話比喻
大模型像通才顧問,SLM 像只做一件事但做得又快又準的專科師傅。
怎麼做出來
靠知識蒸餾,把大模型的判斷方式教給小模型。
跟誰容易搞混
SLM 講的是模型大小,本地端大模型講的是跑在哪裡,兩件事。
定義
SLM 是 Small Language Model 的縮寫,中文叫微型語言模型。它指的是參數量刻意被控制在小範圍的語言模型,常見規格大約落在 1B 到 3B 參數之間。
重點在「刻意」兩個字。SLM 不是做失敗的大模型,而是設計上就決定放棄通用性,換取體積、速度與成本上的優勢。
白話比喻
大模型像一位讀過所有科目的通才顧問,什麼都能聊,但請他來一趟很貴,也要等比較久。
SLM 像巷口那位只修一種機器的老師傅。他不會跟你談文學,但你把機器拿過去,他三分鐘就修好,而且不用預約。
跟 LLM 差在哪
| 項目 | SLM 微型語言模型 | LLM 大型語言模型 |
|---|---|---|
| 參數量 | 約 1B 到 3B | 約 10B 以上 |
| 模型大小 | 幾百 MB 到幾 GB | 數十 GB 到數百 GB |
| 推理速度 | 快,延遲低 | 較慢,延遲高 |
| 硬體需求 | 中低,一般 GPU 或 CPU 就跑得動 | 高,需要高階顯示卡或多卡 |
| 能力特性 | 專精特定領域 | 知識廣泛、通用性強 |
| 適用場景 | 特定任務、裝置端、離線應用 | 通用對話、複雜推理、創作 |
小模型的專業是怎麼來的
主要靠知識蒸餾。先用一個能力很強的大模型當老師,讓它對大量專業題目給出答案與判斷方式,再把這套「軟知識」轉移給小模型學習。
配上特定領域的高品質資料、標註問答與專業文件,小模型就能在窄範圍內接近老師的表現。這也是為什麼 SLM 的品質高度取決於資料,而不只是參數。
實際用例
常見的落地場景有幾類:程式碼助手做快速生成與除錯、企業內部知識庫做即時問答、醫療或法律領域做初步整理與判讀、以及手機與車載這類裝置端的智慧功能。
這些場景的共同點是任務範圍固定、要求反應快、而且資料常常不方便外送。要真的塞進一般設備,通常還會再搭配 Quantization 量化 進一步壓縮體積。
延伸學習
思維邏輯自我訓練:28 天養成計畫(含入門練習版)
四週把「有感覺」練成「有觀點」。每天一題、一個高階任務配一個低階任務,忙的日子也接得上。買這門課直接附贈《入門練習版》八單元 22 課完整講義與練習單,排在課程最前面,先把思維訓練三部曲、知識吸收金三角這些底層工具建立起來,再進入 28 天的每日練習。
NT$ 999
做出你的第一個 Skill
一場快閃直播的完整重製。從搞懂 Skill 的五個層級開始,帶你把一件你每天在做的重複工作,寫成一支 AI 真的會照做的 Skill ── 命名、description、輸入拆解、Workflow 訪談、Output 與 Checks,最後組成一份能通過格式檢查的 SKILL.md。
NT$ 999

