阿里 AI
開源權重模型怎麼用,以 Qwen 為例談自架與雲端的取捨
開源權重模型怎麼用,以 Qwen 為例談自架與雲端的取捨
「模型可以下載」這件事,聽起來只是多一個選項,實際上會改變你整個系統的長相。
這篇用 Qwen 當例子,把開放權重這條路攤開來看:拿到權重之後你要做什麼、自架跟雲端 API 各自的代價,以及什麼時候值得換。
你將學到什麼
開放權重是什麼
模型參數檔公開可下載,你可以把模型跑在自己的環境裡,資料不必離開。
拿到之後怎麼跑
本機工具、伺服器推論引擎、量化與微調,官方文件各有一整批被支援的框架。
真正的取捨
不是誰比較便宜,而是資料落地、用量穩定度、版本掌控與維運人力四件事。
怎麼決定
先用雲端 API 把題目做對,出現明確觸發條件再自架。順序反了最容易白做工。
先分清楚開放權重與開源
這兩個詞常被混用,但差別會影響你的判斷。開放權重指的是模型的參數檔可以公開下載,你能把它載回來執行、量化、微調。
完整意義的開源通常還會期待訓練資料與訓練流程一併公開,多數大型模型並沒有走到那一步。所以描述 Qwen 這類模型時,說開放權重比說開源精準。
至於能不能商用、有沒有附加義務,這是授權條款的事。請直接打開該模型官方 repo 裡的授權檔,以那份文件為準,不同模型不一定相同。
權重從哪裡來
常見的取得管道有兩個:國際上以 Hugging Face 為主,中文圈則有阿里主導的 ModelScope。ModelScope 官方把自己的理念寫成模型即服務(Model as a Service),並提供統一的介面讓你用少量程式碼就把模型載入並取得推論結果。
無論從哪裡下載,你拿到的都是同一組東西:模型參數檔、設定檔、分詞器。真正的差別在後面你打算用什麼跑它。
拿到權重之後的四條路
Qwen 官方文件把工具鏈分得很清楚,你可以照自己的階段對號入座。
| 階段 | 官方文件列出的代表工具 | 你在這個階段要驗什麼 |
|---|---|---|
| 本機試跑 | llama.cpp、Ollama、LM Studio、MLX LM | 這顆模型的口味與品質,你自己感受一次 |
| 伺服器推論 | vLLM、SGLang、TGI | 併發、延遲與吞吐量撐不撐得住你的流量 |
| 量化壓縮 | AWQ、GPTQ、llama.cpp 的量化 | 換到更小的硬體之後,品質掉多少還能接受 |
| 微調訓練 | LLaMA-Factory、MS-SWIFT、Unsloth、Axolotl | 你的專業資料能不能讓它比通用模型更準 |
多數人卡在第一步就以為自己完成了評估。本機用聊天介面跑得順,跟服務要撐住同時進來的請求,完全是兩件事。
自架與雲端 API 的真實取捨
這個決定不該只看單價。以下四個面向才是實際會咬到你的地方。
- 資料落地:自架的最大價值。資料不出你的環境,這件事在受規範的產業裡常常是唯一的理由。
- 成本結構:雲端 API 是有用才付,自架是機器開著就在燒。流量的形狀決定誰划算。
- 版本掌控:自架的模型不會被別人下架或悄悄換掉,你的行為基準是固定的。
- 維運責任:顯卡、驅動、推論引擎升級、監控與故障排除,全部變成你的事。
一個可以照做的順序
第一步,用雲端 API 把功能做出來,同時把評估題組建起來。沒有評估題組,後面所有比較都是憑感覺。
第二步,等到出現明確觸發條件才動。條件通常是這三個之一:資料不能外流、用量大到成本結構要重算、通用模型在你的領域怎麼調都不夠準。
第三步,自架時從小尺寸開始往上試,不要一開始就挑最大的。用你的評估題組找出最小可接受的那一個,硬體需求會差很多。
延伸學習
寫給升國一的你的筆記術
寫給剛升上國中的你:筆記不是寫給老師看的,是寫給考前的自己看的。18 章 85 課圖文,從「為什麼要寫」講到七科各自怎麼記,附 78 份可以印出來寫的練習單,以及 80 課家長專區與 34 張三年筆記養成路徑圖。沒有閱讀期限,國一買、國三還在。
NT$ 3,599
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599

