請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

輝達Rubin NVL72 實測輸送量較 GB300 NVL72 提升高達 3.7 倍

信傳媒

更新於 09月17日16:44 • 發布於 09月17日23:10 • 曾智能
輝達最新 Vera Rubin NVL72 的輸送量較 GB300 NVL72 提升高達 3.7 倍,這意味著其每token成本要低於GB300。(攝影/鄭國強)

人工智慧晶片龍頭輝達17日公布首次 MLPerf Inference 預覽測試結果中,NVIDIA Vera Rubin NVL72 的輸送量較 GB300 NVL72 提升高達 3.7 倍。

一項橫跨四座 GB300 NVL72 機架、共使用 288 顆GPU的測試配置,達成 99% 的擴展效率,其輸送量相較單一機架基準近乎呈現線性成長。而NVIDIA 在 MLPerf Inference v6.1 提交結果中的軟體最佳化,相較於 v6.0 版本,效能最高提升 1.6 倍。v6.1 提交截止後,最佳化工作仍持續進行,進一步帶來效能提升。

這項效能代表每座 Vera Rubin NVL72 機架所產生的詞元數量、服務的使用者數量,以及創造的營收,均遠高於 GB300 NVL72 機架,同時還能降低每詞元token成本。

每座 Vera Rubin NVL72 機架所產生的詞元token數量、服務的使用者數量,以及創造的營收,均遠高於 GB300 NVL72 機架,同時還能降低每詞元成本。(圖片來源/輝達提供)

這些成果反映硬體與軟體的全端協同設計。Vera Rubin 增強的 Tensor Core 與 Transformer Engine 可加速推論的預填充與解碼階段,而 NVFP4 精度則能降低模型權重、注意力與 KV 快取的記憶體占用量,在幾乎不犧牲輸出品質的情況下提高輸送量。

Vera Rubin 提交結果大量採用分離式服務,將預填充與解碼分開處理,並搭配大規模專家平行化,讓驅動 DeepSeek-R1 與 Qwen3-VL 等模型的混合專家層達到最高效率。
NVL72 垂直擴展網域採用第六代 NVIDIA NVLink 與 NVLink Switch,相較現成乙太網路可提供高達 10 倍的封包速率,並將延遲降低 3 倍,建立互連基礎,讓這些技術能在機架規模下有效運作。

這項協同設計更延伸至 NVIDIA 合作夥伴生態系。Nebius 同樣提交 Vera Rubin NVL72 預覽測試結果,並展現出卓越的效能。

能夠進行多步驟推理、規劃與行動的 AI 代理,正在重塑推論效能的衡量方式。在 SemiAnalysis AgentX 等旨在反映這項轉變的基準測試中,Vera Rubin NVL72 於預覽測試的效能達 GB300 NVL72 的 30 倍。此外,即將推出的 MLPerf Endpoints 基準測試將為代理型推論工作負載帶來標準化的衡量方式,涵蓋傳統輸送量基準測試未能反映的面向。

延伸閱讀

查看原始文章

更多理財相關文章

01

【連假必玩】小兵立大功!每年預算僅1000萬卻創造67億產值 全國觀光工廠有多厲害?

太報
02

錢鏡你家1/台股8萬點、台積電5000元?  杜金龍揭多頭2階段時間表

鏡週刊
03

延後退休潮1/65歲勞保不用「畢業」!繼續工作年資照累積 晚領最高多20%

鏡週刊
04

台股周漲逾843點!電子零組件勇冠三軍 台達電欣興景碩南電皆漲逾10%

CTWANT
05

存800萬「買3檔ETF」…就能月領7.1萬躺平?達人曝2大致命盲點

鏡報
06

快對獎!7-8月統一發票千萬獎「89996565」 完整獎號在這裡

自由電子報
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...