阿里 AI

開源權重模型怎麼用,以 Qwen 為例談自架與雲端的取捨

開放權重指的是模型的參數檔公開可下載,你能把模型放在自己的機器或自己的雲上執行。以 Qwen 為例,官方文件記載了一整套可用的工具鏈:本機執行、伺服器推論、量化與微調各有支援的框架。要不要自架不是技術問題而是取捨問題,關鍵在資料能不能外流、用量是否穩定、以及你有沒有人維運。授權條款一律以該模型官方 repo 的授權檔為準。
開源權重模型怎麼用,以 Qwen 為例談自架與雲端的取捨:文章重點卡

開源權重模型怎麼用,以 Qwen 為例談自架與雲端的取捨

「模型可以下載」這件事,聽起來只是多一個選項,實際上會改變你整個系統的長相。

這篇用 Qwen 當例子,把開放權重這條路攤開來看:拿到權重之後你要做什麼、自架跟雲端 API 各自的代價,以及什麼時候值得換。

你將學到什麼

開放權重是什麼

模型參數檔公開可下載,你可以把模型跑在自己的環境裡,資料不必離開。

拿到之後怎麼跑

本機工具、伺服器推論引擎、量化與微調,官方文件各有一整批被支援的框架。

真正的取捨

不是誰比較便宜,而是資料落地、用量穩定度、版本掌控與維運人力四件事。

怎麼決定

先用雲端 API 把題目做對,出現明確觸發條件再自架。順序反了最容易白做工。

先分清楚開放權重與開源

這兩個詞常被混用,但差別會影響你的判斷。開放權重指的是模型的參數檔可以公開下載,你能把它載回來執行、量化、微調。

完整意義的開源通常還會期待訓練資料與訓練流程一併公開,多數大型模型並沒有走到那一步。所以描述 Qwen 這類模型時,說開放權重比說開源精準。

至於能不能商用、有沒有附加義務,這是授權條款的事。請直接打開該模型官方 repo 裡的授權檔,以那份文件為準,不同模型不一定相同。

權重從哪裡來

常見的取得管道有兩個:國際上以 Hugging Face 為主,中文圈則有阿里主導的 ModelScope。ModelScope 官方把自己的理念寫成模型即服務(Model as a Service),並提供統一的介面讓你用少量程式碼就把模型載入並取得推論結果。

無論從哪裡下載,你拿到的都是同一組東西:模型參數檔、設定檔、分詞器。真正的差別在後面你打算用什麼跑它。

拿到權重之後的四條路

Qwen 官方文件把工具鏈分得很清楚,你可以照自己的階段對號入座。

階段官方文件列出的代表工具你在這個階段要驗什麼
本機試跑llama.cpp、Ollama、LM Studio、MLX LM這顆模型的口味與品質,你自己感受一次
伺服器推論vLLM、SGLang、TGI併發、延遲與吞吐量撐不撐得住你的流量
量化壓縮AWQ、GPTQ、llama.cpp 的量化換到更小的硬體之後,品質掉多少還能接受
微調訓練LLaMA-Factory、MS-SWIFT、Unsloth、Axolotl你的專業資料能不能讓它比通用模型更準

多數人卡在第一步就以為自己完成了評估。本機用聊天介面跑得順,跟服務要撐住同時進來的請求,完全是兩件事。

自架與雲端 API 的真實取捨

這個決定不該只看單價。以下四個面向才是實際會咬到你的地方。

  • 資料落地:自架的最大價值。資料不出你的環境,這件事在受規範的產業裡常常是唯一的理由。
  • 成本結構:雲端 API 是有用才付,自架是機器開著就在燒。流量的形狀決定誰划算。
  • 版本掌控:自架的模型不會被別人下架或悄悄換掉,你的行為基準是固定的。
  • 維運責任:顯卡、驅動、推論引擎升級、監控與故障排除,全部變成你的事。
混合是常態實務上很少非黑即白。常見的做法是敏感資料走自架的小模型,複雜任務走雲端的大模型,中間用一層自己的路由決定走哪邊。這樣既守住了資料邊界,也不必為了少數難題養一台永遠開著的大機器。

一個可以照做的順序

第一步,用雲端 API 把功能做出來,同時把評估題組建起來。沒有評估題組,後面所有比較都是憑感覺。

第二步,等到出現明確觸發條件才動。條件通常是這三個之一:資料不能外流、用量大到成本結構要重算、通用模型在你的領域怎麼調都不夠準。

第三步,自架時從小尺寸開始往上試,不要一開始就挑最大的。用你的評估題組找出最小可接受的那一個,硬體需求會差很多。

常見誤解最貴的誤解是「先自架比較安全,之後再說」。實際上前期你最需要的是快速換模型、快速改需求,而自架會把你綁在一套環境上,改一次就痛一次。想先認識模型家族可以讀 通義千問 Qwen 是什麼;想知道雲端那邊有哪些現成服務,可以讀 阿里雲的 AI 服務地圖
本文源起本文依阿里雲官方公開資料整理,由酒Ann 以自己的視角編寫成中文導覽。實際功能與授權條款以 阿里雲官網 為準。

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

開放權重跟開源是一樣的意思嗎?
不完全一樣,值得分清楚。開放權重指的是模型參數檔可以下載使用,這是你實際會用到的部分。而完整意義上的開源通常還會期待訓練資料與訓練流程也公開,多數大型模型不會做到這一步。所以比較準確的說法是開放權重,而能不能商用、有什麼限制,要看該模型官方 repo 的授權檔怎麼寫。
自架真的比較省錢嗎?
要看用量型態,不能一概而論。雲端 API 是有呼叫才付費,沒有流量就沒有成本。自架是把成本前置到機器上,機器開著就在算錢,跟你有沒有請求無關。所以流量高又穩定的服務自架比較有機會划算,流量低或起伏很大的服務通常反而更貴,還要加上維運的人力成本。
量化之後品質會掉多少?
沒有一個通用答案,會因模型、量化方法與任務而異,所以請自己量。務實的做法是準備一組貼近你實際任務的題目當基準,先用未量化的版本跑一次當對照,再逐步試更激進的量化設定,看到品質掉到不可接受就退回上一格。用感覺判斷一定會出事。