GPU 觀念
在自己的電腦跑 AI:RTX 與本地推論的入門觀念
在自己的電腦跑 AI:RTX 與本地推論的入門觀念
用 ChatGPT 或 Claude 時,你的問題其實是被送到雲端的資料中心,在別人的 GPU 上算完再傳回來。但還有另一條路:把模型下載到自己的電腦,在自己的顯卡上跑,這就是所謂的本地推論(local inference)。
NVIDIA 這幾年大力推「AI on RTX」,就是在講這件事。我把官方資料與這個領域的基本觀念整理成這篇:本地 AI 好在哪、RTX 與 VRAM 扮演什麼角色、有哪些現成工具可以直接上手。
你將學到什麼
雲端與本地
資料留在自己電腦,離線也能跑。
RTX 的角色
Tensor Core 是消費級電腦的 AI 引擎。
VRAM 是關鍵
顯示記憶體決定跑得動多大的模型。
現成工具
ChatRTX、NIM 與開源生態系入口。
雲端 AI 與本地 AI:同一件事的兩種跑法
推論(inference)指的是模型根據輸入產生輸出的過程,也就是「用」模型。雲端推論是把資料送去資料中心算;本地推論則是模型住在你的電腦裡,運算在你的顯卡上完成。
- 隱私:官方的說法很直接:資料留在你的裝置上,不需要網路。合約、病歷、財務資料這類敏感內容,本地跑就不用把資料交給任何服務商。
- 離線與穩定:飛機上、斷網時照常運作,也不受服務商當機或改版影響。
- 成本結構:沒有訂閱費與 API 計費,換成一次性的硬體投資,用得越多越划算。
代價也要說清楚:本地模型的能力上限受硬體限制,目前最強的模型仍在雲端。所以實務上多半是混合使用:日常與敏感內容在本地,重活交給雲端。
RTX 與 Tensor Core:消費級電腦的 AI 引擎
本地推論能普及,關鍵是消費級顯卡裝上了專用 AI 硬體。GeForce RTX 系列內建 Tensor Core:專為矩陣運算設計的加速單元,而矩陣運算正是 AI 工作負載的底層。
這代表本來為了打遊戲買的顯卡,同時就是一台 AI 機器。NVIDIA 把這類機器統稱 RTX AI PC:跑語言模型、生圖、語音辨識,都在同一張卡上完成。
模型太大怎麼辦?這個領域的通用解法是量化(quantization):把權重用較低的精度儲存,體積與記憶體佔用大幅下降,能力只小幅折損。社群釋出的開放權重模型,幾乎都找得到現成的量化版本。
官方入口:從 ChatRTX 到 NIM
- ChatRTX:官方的本地對話應用,裝了就能跟自己的文件對話,全程離線。
- NIM 微服務:把語言、語音、視覺等模型包裝成一鍵可用的服務,給想自己組應用的人。
- AI Blueprints:官方預組的工作流範本,例如把 PDF 轉成 podcast、本地生圖。
- Project G-Assist:住在系統裡的本地小助手,幫你調校電腦設定與效能。
官方之外,開源生態系同樣熱鬧:Ollama、LM Studio 讓你點幾下就下載開放權重模型開始聊;ComfyUI 是本地生圖的主流介面;AnythingLLM 這類工具則把本地模型接上你的知識庫。NVIDIA 官方頁面也直接列名支援這些工具。
該不該把 AI 搬回自己電腦?
我的判斷法很簡單,問三個問題:資料敏感嗎?用量大嗎?手上有 RTX 顯卡嗎?三題有兩題是,就值得認真研究本地推論。
反過來說,偶爾用用、追求最強能力、電腦只有內顯,那雲端服務仍是更好的選擇。本地與雲端不是信仰之爭,是工具選擇:了解兩邊的長處,依資料與場景切換,才是真正的行家用法。
想動手的話,從 NVIDIA AI on RTX 官方頁開始逛,那裡把工具、應用與硬體需求整理得很完整。有 RTX 顯卡的人,今天就能下載第一個本地模型試試。
延伸學習
AI Native 工作法
四小時完整實錄。工作已經不是以前的工作了 ── 這門課拆解 AI Native 的四個核心能力,帶你把自己的工作做成一份可執行的 AI Native Blueprint,從「會用 AI 的人」變成「工作本身就長在 AI 上的人」。
NT$ 2,599
HE101|Harness Engineering Foundation(3 小時)
三小時的地圖課,不是操作課。把 Model 與 AI System 分開,拆解一套 AI Harness 的八個組成(Goal、Context、Knowledge、Rules、Tools、Workflow、Evaluation、Iteration),再帶你逆向拆解四個你已經在用的系統,最後畫出自己的第一張 Harness Blueprint。5 章 27 課,附學員講義 PDF 與術語速查表。
NT$ 2,599

