模型與訓練
VRAM 顯存是什麼?決定你跑得動多大的模型
VRAM 顯存是什麼?決定你跑得動多大的模型
想在自己電腦上跑模型的人,第一個撞到的牆幾乎都是同一個:顯存不夠。畫面轉一轉,然後跳出一串看不懂的錯誤。
顯存是本機跑模型的生命線。這篇把它是什麼、怎麼算、不夠時怎麼辦,一次講完。
你將學到什麼
定義
顯示卡上的專屬記憶體,速度極快但容量有限。
白話比喻
顯存是廚房的流理台,桌面不夠大,再好的廚師也擺不開。
跟誰容易搞混
跟一般記憶體不同,顯存只屬於 GPU,換不了也借不到。
定義
VRAM(Video RAM,顯存)是顯示卡上的專屬記憶體,也可以理解成 AI 運算時的大腦記憶體。模型的權重、每一層運算的中間結果、快取與輸入輸出資料,全部都在顯存裡運作。
它的特性是速度極快但容量有限,而且只屬於 GPU。這也是為什麼跑本機模型時,顯存是最核心的瓶頸。
白話比喻
顯存像廚房的流理台。冰箱再大(硬碟),食材再多,一次能攤開處理的東西還是看檯面有多寬。
檯面不夠,你就得一直把東西搬進搬出,動作全部卡在來回搬運上。這就是顯存不足時「速度突然變成十分之一」的感覺。
顯存需求怎麼估
最粗略的算法是看參數量與精度。以推理、含快取、中等上下文長度來估,大致是這個量級。
| 模型參數量 | FP16 高精度 | INT8 中等精度 | INT4 低精度 |
|---|---|---|---|
| 7B | 約 14 GB | 約 7 GB | 約 3.5 GB |
| 8B | 約 16 GB 起 | 約 8 GB 起 | 約 4 GB 起 |
| 13B | 約 26 GB | 約 13 GB | 約 6.5 GB |
| 70B | 約 140 GB | 約 70 GB | 約 35 GB |
實際需求會因模型架構、實作方式與上下文長度而異,上表只是抓量級用。影響需求的四個變數是參數量、精度、上下文長度與批次大小。
顯存不夠會發生什麼
- 無法載入模型:直接報錯,常見的字眼是記憶體不足。
- 極度緩慢:資料頻繁在顯存與系統記憶體之間搬運。
- 生成中斷:跑到一半突然停住,長文特別容易中招。
- 系統不穩:嚴重時會導致驅動重啟或整機當機。
省顯存的做法有四招:改用較低精度的 量化 版本、縮短上下文長度、減少批次大小、換一個參數量更小的模型。
實際用例
如果你想在本機跑一個 8B 等級的模型,FP16 大約需要 16 GB 以上的顯存,主流的中階顯卡通常只有 8 GB 到 12 GB。
這時候把模型換成 INT4 量化版,需求會掉到 4 GB 左右,就跑得起來了。選對模型大小加上選對精度,才是順暢體驗的關鍵。
延伸學習
思維邏輯自我訓練:28 天養成計畫(含入門練習版)
四週把「有感覺」練成「有觀點」。每天一題、一個高階任務配一個低階任務,忙的日子也接得上。買這門課直接附贈《入門練習版》八單元 22 課完整講義與練習單,排在課程最前面,先把思維訓練三部曲、知識吸收金三角這些底層工具建立起來,再進入 28 天的每日練習。
NT$ 999
高效思維與腦內模擬:30 日練習與行動系統
每天一件事,三十天把「想到就做」換成「先在腦中跑一遍再動手」。六週依序練目標設定、腦內模擬、結果檢查、反饋與應變、知識萃取、總結與新目標,每天一課圖文,附可以直接填的練習表。週一給概念、週二實作、週三看案例、週四反思、週五收束,跟著節奏走就好,不必自己安排。
NT$ 1,599

