Nvidia Rubin 改用 45°C 液冷:AI data center 慳水講法要點睇
Tech News

Nvidia Rubin 改用 45°C 液冷:AI data center 慳水講法要點睇

圖片:via The Verge — https://www.theverge.com/tech/954139/nvidia-data-centers-rubin-liquid-cooling
TechLab 編輯部(譯)·

重點唔止環保,仲係 GPU server 密度同雲端 AI 成本

45°C 液冷點解值得睇

The Verge 報道,Nvidia 喺 London Climate Week 前後高調講 Rubin generation AI data center 參考設計,賣點係全液冷同「近乎唔用水」。聽落似環保稿,但件事同 AI 算力成本好直接:新 GPU rack 熱到風冷越嚟越吃力,冷卻已經由機房雜務變成每 MW 可以塞幾多 GPU、每粒 token 成本有幾低嘅工程問題。

Nvidia 示意 45°C 熱液冷喺 data center 入面經管路連去多排 server 櫃

圖片:NVIDIA Blog

熱水點樣反而慳水

Nvidia 官方 blog 講,Rubin generation 會用 100% liquid cooling,GPU、CPU 同 networking component 都經封閉液體迴路帶走熱,coolant 入口可去到 45°C,出口大約 55°C。做法同傳統機房用凍風吹過 server 唔同:熱喺 chip 旁邊直接俾液體帶走,再送去外面 dry cooler,好似大型 radiator 咁散熱。戶外空氣未必好凍都做到,所以好多時間唔使開 chiller,亦唔使靠 cooling tower 蒸發大量水。

data center 入面嘅液冷管路同 coolant distribution 設備

圖片:NVIDIA Blog

Nvidia 個數字要加括號

官方話,傳統用 cooling tower 嘅系統每 MW 每年約用 260 萬加侖水,Rubin DSX 參考設計喺合適氣候同 dry cooler 配合下,可以壓到近乎零,按 Nvidia 口徑即係最多減少 100%。呢個講法有用,但要加括號:The Verge 同 Axios 都提醒,Nvidia 冇交代建造全液冷 data center 貴幾多,亦冇解決發電時用水、建築材料同選址爭議。講白啲,呢個係冷卻系統嘅進步,唔等於 AI data center 嘅環境帳已經埋晒單。

液冷 server rack 上方接駁嘅黑色水喉同冷卻接頭

圖片:NVIDIA Blog

45°C 其實係趨勢放大

另一個背景係,warm-water cooling 唔係 2026 先有人諗到。Network World 提到 IBM 2012 年已有 45°C hot-water supercomputer,Lenovo 亦講佢哋 HPC 液冷做咗好多年。Compass / The Tech Capital 訪問業界人士就話,Blackwell 已經可以做到約 40°C 入水,Rubin 推到 45°C 係重要一步,但唔代表一晚之間成個 cooling 行業都要重寫玩法。Amazon 近期亦講自己九成時間靠 free air cooling,只喺最熱時段用水,大家都係沿住同一個方向:少啲機械冷凍,畀 server 接受高啲溫度。

對用雲端 AI 嘅公司有咩關係

有用雲端 AI 做 app、客服自動化、內部搜尋或者開發工具嘅公司,未必會直接見到 Rubin;見到嘅會係 API 價、GPU instance 供應同延遲。Eaton 呢類電力同冷卻供應商講得好直接:hot-water cooling 慳返 chiller 電力之後,data center 營運商可以喺同一個電網接駁容量下,留更多電力畀 GPU。換句話講,慳電未必令總用電跌,可能係同一幅電力天花下跑更多 AI workload。對買雲端服務嘅人,呢件事最後反映喺 token 價、用量上限、地區供應同合約條款入面。

下一步睇真數

Nvidia 呢次講法值得睇,因為風冷轉液冷已經唔只係一兩排高階 rack 嘅選項,AI server 密度再上去,散熱會變成平台設計一部分。不過要判斷佢係咪真係慳水慳電,要等雲端供應商公布實際 PUE、WUE、建造成本、維修成本同電力來源。尤其係新 data center 起得越快,單機效率改善會俾整體需求增長食返幾多,呢條數先最睇到 AI 基建係咪真係慳到。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook