模型與訓練

VRAM 顯存是什麼?決定你跑得動多大的模型

VRAM(Video RAM,顯存)是顯示卡上的專屬記憶體,用來存放模型參數、運算中間結果與快取資料。跑本機模型時,顯存大小直接決定你載得動多大的模型,不夠就會載入失敗、龜速運行,或直接爆出記憶體不足的錯誤。
VRAM 顯存是什麼?決定你跑得動多大的模型:文章重點卡

VRAM 顯存是什麼?決定你跑得動多大的模型

想在自己電腦上跑模型的人,第一個撞到的牆幾乎都是同一個:顯存不夠。畫面轉一轉,然後跳出一串看不懂的錯誤。

顯存是本機跑模型的生命線。這篇把它是什麼、怎麼算、不夠時怎麼辦,一次講完。

你將學到什麼

定義

顯示卡上的專屬記憶體,速度極快但容量有限。

白話比喻

顯存是廚房的流理台,桌面不夠大,再好的廚師也擺不開。

跟誰容易搞混

跟一般記憶體不同,顯存只屬於 GPU,換不了也借不到。

定義

VRAM(Video RAM,顯存)是顯示卡上的專屬記憶體,也可以理解成 AI 運算時的大腦記憶體。模型的權重、每一層運算的中間結果、快取與輸入輸出資料,全部都在顯存裡運作。

它的特性是速度極快但容量有限,而且只屬於 GPU。這也是為什麼跑本機模型時,顯存是最核心的瓶頸。

白話比喻

顯存像廚房的流理台。冰箱再大(硬碟),食材再多,一次能攤開處理的東西還是看檯面有多寬。

檯面不夠,你就得一直把東西搬進搬出,動作全部卡在來回搬運上。這就是顯存不足時「速度突然變成十分之一」的感覺。

顯存需求怎麼估

最粗略的算法是看參數量與精度。以推理、含快取、中等上下文長度來估,大致是這個量級。

模型參數量FP16 高精度INT8 中等精度INT4 低精度
7B約 14 GB約 7 GB約 3.5 GB
8B約 16 GB 起約 8 GB 起約 4 GB 起
13B約 26 GB約 13 GB約 6.5 GB
70B約 140 GB約 70 GB約 35 GB

實際需求會因模型架構、實作方式與上下文長度而異,上表只是抓量級用。影響需求的四個變數是參數量、精度、上下文長度與批次大小。

顯存不夠會發生什麼

  • 無法載入模型:直接報錯,常見的字眼是記憶體不足。
  • 極度緩慢:資料頻繁在顯存與系統記憶體之間搬運。
  • 生成中斷:跑到一半突然停住,長文特別容易中招。
  • 系統不穩:嚴重時會導致驅動重啟或整機當機。

省顯存的做法有四招:改用較低精度的 量化 版本、縮短上下文長度、減少批次大小、換一個參數量更小的模型。

實際用例

如果你想在本機跑一個 8B 等級的模型,FP16 大約需要 16 GB 以上的顯存,主流的中階顯卡通常只有 8 GB 到 12 GB。

這時候把模型換成 INT4 量化版,需求會掉到 4 GB 左右,就跑得起來了。選對模型大小加上選對精度,才是順暢體驗的關鍵。

常見誤解最常見的誤解是拿顯示卡的效能當唯一指標。跑 本地模型 時,容量往往比速度更重要:載不進去,再快的 GPU 也毫無意義。另一個誤解是忘了上下文長度也吃顯存,同一個模型把脈絡開很長,需求會明顯往上跳。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

電腦記憶體很大,可以拿來當顯存用嗎?
技術上可以讓部分資料溢出到系統記憶體,但速度會掉得非常明顯,體感就是龜速。實務上這只能算救急,不能當成解方。
顯存不夠一定跑不動嗎?
不一定。降低量化精度、縮短上下文長度、減少批次大小,都能把需求壓下來。換成參數量更小的模型也是最直接的做法。
Mac 沒有獨立顯卡怎麼辦?
Apple 晶片採統一記憶體架構,CPU 與 GPU 共用同一份記憶體,所以判斷標準會變成整機記憶體有多大,而不是顯示卡有幾 GB。