NVIDIA 雲策略

AI 工廠的標準藍圖:從單機到 DGX SuperPOD 超算架構

DGX SuperPOD 是一套把數千顆到數萬顆 GPU 組成單一超算系統的標準藍圖,關鍵不在單顆晶片多強,而在晶片之間怎麼連。NVLink 負責節點內的高速互聯,NVSwitch 與 NVLink 網路把多台主機接成一個運算結構,再搭配針對集體通訊設計的叢集網路,才撐得起大型模型訓練。散熱與電力也要跟著架構一起設計,不能等機器到貨才想。以 NVIDIA 官方頁面二零二六年八月查閱資訊為準。
AI 工廠的標準藍圖:從單機到 DGX SuperPOD 超算架構:文章重點卡

AI 工廠的標準藍圖:從單機到 DGX SuperPOD 超算架構

第一次看 DGX SuperPOD 的架構圖,很容易被一堆型號名稱唬住,B300、GB200、Rubin NVL72,看起來像是規格表的競賽。

但真正決定這套系統能不能訓練超大型模型的,不是單顆晶片多強,而是晶片跟晶片之間、機櫃跟機櫃之間怎麼連起來。這篇就從這個角度,把 SuperPOD 這張藍圖拆開來看。

你將學到什麼

互聯比晶片本身重要

單一 GPU 的算力再強,接不起來就撐不起大型模型訓練。

三層互聯各司其職

NVLink、NVSwitch、叢集網路分別解決節點內、節點間、跨機櫃的通訊問題。

叢集網路不是接起來就好

大規模訓練需要的是為集體通訊設計過的拓撲,一般乙太網路不夠用。

散熱跟擴展要提前規劃

機櫃密度上去之後,散熱與電力設計要跟架構同時決定,不是事後補救。

決定一套 AI 超算系統能撐多大的,往往不是晶片本身,而是晶片之間怎麼連。

先把互聯拆成三層來看

大規模 AI 訓練需要成千上萬顆 GPU 同時協作,但這些 GPU 分布在不同主機、不同機櫃,甚至不同區域。要讓它們像單一巨大加速器那樣運作,互聯技術要分層解決不同距離的通訊問題。

依 NVIDIA 官方頁面的說法,NVLink 與 NVLink Switch 被定位為多 GPU 通訊與大型 AI 模型所需的高速互聯,另外還有 NVLink Fusion,用於半客製化的規模擴展基礎設施。

  • 節點內互聯(NVLink):解決同一台主機裡,GPU 跟 GPU 之間直接交換資料的需求,延遲最低。
  • 節點間互聯(NVSwitch/NVLink 網路):把多台主機的 GPU 組成一個更大的通訊結構,讓一整組看起來像單一運算體。
  • 跨機櫃叢集網路:把多個這樣的運算群組,再串成整座資料中心等級的超算系統。
層級一:節點內(NVLink)層級二:節點間(NVSwitch)運算節點 A運算節點 BNVSwitch層級三:跨機櫃(叢集網路)運算群組 一運算群組 二運算群組 三
互聯分三層,各自解決不同距離的通訊問題,這張圖比記型號名稱有用。

叢集網路:為什麼不能沿用一般的資料中心網路

一般資料中心的網路,設計前提是各自獨立的請求,快慢不會互相拖累。AI 訓練不是這樣,成千上萬顆 GPU 常常要同時完成一次集體通訊,例如把各自算出來的梯度加總再分發回去。

只要其中一個節點慢了,或者網路發生壅塞,整批運算都要停下來等它。這代表叢集網路必須針對這種集體通訊模式設計,而不是單純把機器接上網路而已。

  • 低延遲、可預期:延遲的變化幅度要小,不然最慢的那個節點會拖垮整體。
  • 針對集體通訊調校:像是全部節點一起加總資料這類操作,要有專門的路徑與演算法支援。
  • 可觀測:出問題時要能定位是哪個節點、哪段連結壅塞,不然除錯會非常花時間。
給架構師的提醒

選擇網路方案時,先回頭看你的訓練工作負載真正的通訊模式是什麼,而不是先比較廠商規格表。同一套網路,對某種模型架構很合適,對另一種可能完全不夠用。

從單機到 SuperPOD:這張藍圖怎麼組出來

依 NVIDIA 官方頁面說明,DGX SuperPOD 被定位為一套「全端資料中心平台」,把運算、網路、儲存與軟體整合在一起考慮,而不是把這幾件事分開採購再拼裝。

官方頁面(二零二六年八月查閱)同時列出以 Blackwell 為基礎的系統,例如 GB300、GB200 系列,以及以 Vera Rubin 平台為基礎的新一代系統,例如 Rubin NVL72、Rubin NVL8。世代名稱更迭很快,實際採用哪一個,請以動工當下的官方頁面為準。

規模上,官方說法是可以從較小的部署,一路擴展到數萬顆 GPU 的等級。這個擴展性能不能只靠加機器達成,前面提到的三層互聯與叢集網路設計,才是撐起這個規模的關鍵。

散熱與擴展的基本概念

機櫃密度提高之後,散熱方式往往要從一般氣冷升級到液冷,這是機房層級的決定,不是伺服器層級的小調整。

電力容量、配線與供電冗餘,也要跟著這個密度一起規劃。等硬體到貨才發現機房電力或散熱撐不住,是最昂貴的一種返工。

擴展這件事,理想的做法是透過複製既有的運算群組單位往外長,而不是每次擴充都重新設計一次網路拓撲。這也是為什麼 SuperPOD 被稱為「藍圖」而不是單一產品,它提供的是一套可重複套用的設計模式。

給架構師的收尾檢查清單

  1. 先確認訓練工作負載的通訊模式,再挑網路拓撲,不要反過來。
  2. 把散熱與電力規劃,跟運算架構選型放在同一張時程表上,不要等硬體到貨。
  3. 動工前重新查一次官方頁面的當期世代與規模,不要沿用舊教材或舊文章的印象。
  4. 把儲存與軟體整合一起考慮,這是全端平台跟自行拼裝硬體最大的差異。
本文源起本文依 NVIDIA 官方公開資料整理,由酒Ann 以自己的視角編寫成中文導覽。實際規格與產品世代以 NVIDIA 官網 當期公告為準。

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

NVLink 跟 NVSwitch 有什麼不同?
NVLink 是 GPU 與 GPU 之間直接的高速連結,解決的是同一台主機或同一個運算節點內部的通訊問題。NVSwitch 則是把多顆 GPU 之間的 NVLink 連結,透過交換器的方式組成一個更大的通訊結構,讓一整組 GPU 可以像單一巨大加速器那樣互相存取。兩者是搭配使用,不是二選一。
為什麼不能直接用一般的資料中心乙太網路組叢集?
一般乙太網路是為了各自獨立的請求設計的,延遲與擁塞控制的假設跟 AI 訓練不一樣。大型模型訓練常常需要所有 GPU 同時完成一次集體通訊,例如把各自算出來的梯度加總,任何一個節點慢了,整批運算都要等它。這種模式需要低延遲、可預期、針對集體通訊調校過的網路拓撲,才不會讓昂貴的 GPU 一直閒置在等資料。
DGX SuperPOD 可以擴到多大?
依 NVIDIA 官方頁面說明,DGX SuperPOD 的定位是可以從小規模部署,一路擴展到數萬顆 GPU 的等級。實際能擴到多大,取決於當下採用的世代與網路拓撲設計,這類具體規模數字建議直接查當期官方頁面,不要沿用舊版本的印象。
現在 NVIDIA 官方在推的 SuperPOD 是哪個世代?
以官方頁面二零二六年八月查閱的資訊,NVIDIA 同時列出以 Blackwell 為基礎的系統(例如 GB300、GB200 系列)以及以 Vera Rubin 平台為基礎的新一代系統(例如 Rubin NVL72、Rubin NVL8)。世代名稱與可用時程變動很快,動工前務必回官方頁面確認當下真正在出貨的是哪一個。
散熱跟擴展要什麼時候開始規劃,是等硬體到貨之後嗎?
不是,這是最常見的錯誤順序。機櫃密度提高之後,散熱方式往往需要液冷這類跟氣冷完全不同的機房設計,電力容量與配線也要跟著調整。這些屬於機房層級的決定,必須在選定架構的同時就一起規劃,等硬體到貨才發現機房撐不住,代價會很高。