NVIDIA 硬體

雲端數據傳輸的心臟:DPU 與 AI 專用網路

DPU 是一種專門處理基礎設施工作的處理器,把軟體定義網路、儲存加速與即時資安檢測,從主機 CPU 卸載到自己身上,讓 CPU 與 GPU 專心處理應用程式與模型運算。生成式 AI 叢集需要在 GPU 與 GPU、GPU 與儲存之間搬動大量資料,任何一段延遲都會拖慢整組昂貴硬體,這正是需要專門設計的高速網路與 DPU 的原因。以 NVIDIA 官方頁面二零二六年八月查閱資訊為準,目前主力世代是 BlueField 四代。
雲端數據傳輸的心臟:DPU 與 AI 專用網路:文章重點卡

雲端數據傳輸的心臟:DPU 與 AI 專用網路

網路工程師談資料中心,習慣先想機櫃、線路、頻寬。但這幾年真正在改變雲端架構的,是一顆常常被忽略的晶片,叫 DPU。

它解決的不是「連不連得上」,而是「連上之後,誰來處理那些基礎設施雜務」。這篇從這個角度,講清楚 DPU 在做什麼,以及生成式 AI 為什麼需要一整套專門設計的網路。

你將學到什麼

DPU 卸載的是雜務

虛擬化、儲存存取、資安檢測,這些都在跟應用程式搶主機 CPU 的資源。

獨立於主機的資安

資安檢測跑在 DPU 上,主機被打穿不代表網路層的防線也一起倒。

AI 叢集是資料搬運的重活

GPU 之間與 GPU 到儲存的資料量非常大,任何延遲都在浪費昂貴硬體。

世代名稱要查證

以官方頁面為準確認目前主力世代,別憑記憶寫規格。

DPU 解決的不是連不連得上,而是連上之後,誰來處理那些基礎設施雜務。

DPU 在解決什麼問題:把基礎設施工作從主機卸載

任何一台雲端伺服器,除了跑使用者真正在意的應用程式或模型,還要處理一堆基礎設施層級的雜務:虛擬網路、儲存存取、安全掃描。

這些工作如果都留在主機 CPU 上,會跟應用程式搶資源,多租戶環境下這個比重常常比想像中高。DPU 的角色,就是把這些工作接手過去。

  • 軟體定義網路:虛擬網路的路由與轉發邏輯,交給 DPU 處理。
  • 儲存加速:像是 RDMA、NVMe over Fabrics 這類加速資料存取的協定,由 DPU 承擔。
  • 即時資安:威脅偵測與零信任的邊界檢查,跑在獨立於主機的處理器上。
  • 資料搬運:AI 工作負載需要的大量資料搬運管線,透過硬體加速處理。

為什麼生成式 AI 特別需要這一層

生成式 AI 訓練與推論叢集,資料搬運的量級跟一般網路服務完全不同。成千上萬顆 GPU 要頻繁交換中間結果,也要不斷從儲存系統讀取訓練資料。

如果這些搬運工作都靠主機 CPU 處理,CPU 會變成瓶頸,讓後面昂貴的 GPU 一直在閒置等資料。把這些工作卸載到 DPU,才能讓資料搬運跟得上 GPU 的運算速度。

另外一個常被忽略的點是多租戶隔離。雲端環境裡不同客戶共用同一套實體基礎設施,網路與安全層級的隔離做得夠不夠獨立,直接影響整個平台的可信度。

目前的主力世代與定位

以 NVIDIA 官方網路產品頁面二零二六年八月查閱的資訊,目前的產品是 BlueField 第四代,官方定位是服務超大規模 AI 工廠的基礎設施平台。

官方頁面說明這一代的連接能力相較上一代有明顯提升,用來支撐更大規模的 AI 叢集。世代名稱與連接規格更新很快,建議動工前直接查當期官方頁面,不要沿用舊資料。

查證方法

把架構圖上每一個網路元件的官方產品頁打開,看清楚目前列出的是哪一代、支援哪些協定。這件事花不了太久,但能避免規劃書裡寫的世代跟實際能採購到的對不上。

DPU 跟資安架構的關係

依官方頁面說明,DPU 支援即時威脅偵測,並協助落實零信任架構。這句話對安全架構師的意義是,安全檢測不再完全依附在主機的信任狀態上。

就算某台主機被攻破,跑在 DPU 上的網路層級檢測不會因此自動失效,這讓多租戶環境的隔離多一層獨立的防線,而不是把所有雞蛋放在主機作業系統這一個籃子裡。

給網路工程師的檢查清單

  1. 先確認瓶頸在哪:是主機 CPU 被基礎設施工作拖累,還是網路拓撲本身不夠用。
  2. 評估多租戶隔離需求,判斷資安檢測是否需要獨立於主機執行。
  3. 確認 DPU 跟現有的軟體定義網路與資安工具能不能順利整合。
  4. 查官方支援清單,確認你的協定與工作負載是否在目前世代的支援範圍內。
本文源起本文依 NVIDIA 官方公開資料整理,由酒Ann 以自己的視角編寫成中文導覽。實際規格與產品世代以 NVIDIA 官網 當期公告為準。

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

DPU 跟一般網路卡有什麼不同?
一般網路卡主要負責收發封包,運算工作幾乎都丟給主機 CPU 處理。DPU 是一顆具備完整運算能力的處理器,本身就能執行軟體定義網路、儲存協定加速、即時安全檢測這類任務,等於在網路卡的位置多放了一台專用電腦。差別在於誰來做這些基礎設施層級的工作,DPU 讓主機 CPU 可以專心處理應用程式本身。
為什麼虛擬化跟資安工作要卸載到 DPU,不能留在主機上嗎?
可以留在主機上,但代價是這些工作會跟應用程式與模型運算搶 CPU 資源,尤其在雲端多租戶環境下,這類基礎設施工作的比重常常被低估。把它們卸載到 DPU,主機的運算資源可以完全用在使用者真正付錢要的工作上,同時因為 DPU 是獨立的處理單元,資安檢測也不會受到主機本身狀態的影響。
生成式 AI 訓練跟一般網路服務相比,網路需求真的差很多嗎?
差很多。一般網路服務多半是各自獨立的請求,互不影響。生成式 AI 訓練需要成千上萬顆 GPU 之間頻繁交換資料,也需要從儲存系統快速讀取大量訓練資料,任何一段延遲或壅塞,都會讓昂貴的 GPU 閒置等待。這種資料搬運強度跟一般網路服務不是同一個量級,需要專門設計的高速網路與資料搬運路徑。
現在 NVIDIA 官方主力推的 DPU 是哪一代?
以 NVIDIA 官方網路產品頁面二零二六年八月查閱的資訊,目前的產品是 BlueField 第四代,定位為服務超大規模 AI 工廠的基礎設施平台,連接能力比上一代大幅提升。世代名稱與規格更新很快,動工前請直接查當期官方頁面確認,不要沿用舊資料。
DPU 對雲端安全架構師來說,實際的價值是什麼?
價值在於把安全檢測從主機的信任狀態中獨立出來。依官方頁面說明,DPU 支援即時威脅偵測與零信任架構的落地,這代表就算某台主機被入侵,網路層級的安全控制不會因此自動失效,也讓多租戶環境下的隔離更可靠。這對設計雲端安全架構時,是一層值得認真評估的防線。