中國 LineShine 拎返超算第一:冇 GPU 點跑贏 El Capitan?
Tech News

中國 LineShine 拎返超算第一:冇 GPU 點跑贏 El Capitan?

圖片:via Engadget — https://www.engadget.com/2199608/china-lineshine-supercomputer-is-worlds-fastest/
TechLab 編輯部(譯)·

TOP500 6 月榜換位,CPU-only 路線要分清 HPC 同 AI 訓練

先講發生咩事

TOP500 2026 年 6 月榜,裝喺 National Supercomputing Centre in Shenzhen 嘅 LineShine 直接排第一,HPL Rmax 2,198.40 PFlop/s,即 2.198 Exaflop/s。上屆冠軍 El Capitan 而家排第二,維持 1.809 Exaflop/s。官方資料亦寫明,LineShine 係之前冇上榜嘅新系統,13,789,440 個 core,由 Shenzhen Cloud Computing Center 建造。中國超算上次排第一已經係 2017 年嘅 Sunway TaihuLight;今次 LineShine 上榜,亦令 TOP500 頭五位都跨過 exascale。

冇 GPU,點解都跑到?

LineShine 最搶眼嘅地方係架構。TOP500 系統頁列出 LingKun 平台、LX2 304C 1.55GHz 處理器、LingQi interconnect、Kylin OS,冇列任何 GPU accelerator。講白啲,佢係用極多 CPU core 同自家互連去堆 FP64 HPL 成績;唔代表單粒 CPU 快過 GPU,亦唔代表 GPU 路線過時。高階超算跑到呢個級數,重點唔單止喺 chip,仲有 network、memory bandwidth、compiler、math library 同 MPI 點夾埋。

HPL 同 AI 榜要分開睇

TOP500 第一主要睇 HPL,即係用雙精度浮點去解大型線性方程,對傳統科學模擬好有代表性,但同今日 AI 訓練常講嘅 BF16、FP16、FP8 低精度矩陣運算唔同。睇 HPL-MxP 就最清楚:TOP500 官方新聞話,El Capitan 喺混合精度榜仍排第一,16.7 Exaflop/s;LineShine 係第四,7.92 Exaflop/s,只係 HPL 成績嘅 3.6 倍。TOP500 原文指,呢個結果同 CPU-only 設計吻合。換句話講,LineShine 喺 FP64 HPC 贏榜,但訓練大型模型嗰種低精度吞吐,GPU/APU 系統仍然好有牙力。

HPCG 排第一都值得睇

另一個值得睇嘅位係 HPCG。HPCG 官方定位係補 HPL 單一指標嘅盲點,因為佢重視資料搬動、memory access 同 sparse 計算,多啲貼近真實工程同科學程式。LineShine 喺 HPCG 交出 22.00 Petaflop/s,壓過 El Capitan 17.41 Petaflop/s。呢個成績令 CPU-only 路線冇咁似「只係刷 HPL」:如果 interconnect 同 memory hierarchy 做得好,傳統 HPC workload 仍可以食到好大規模 CPU 系統嘅好處。

出口管制下嘅另一條路

BIS 自 2022 年起收緊先進運算晶片、supercomputer end-use 同中國相關出口,2023、2024 年再加碼,高階 accelerator 對中國供應亦受到限制。LineShine 反映另一個取向:高階 GPU 供應受限制之下,中國超算團隊可以用 CPU、專用互連、自家 OS 同軟件棧去衝 HPL 成績。呢條路唔便宜,亦唔會自動變成 AI 訓練最佳方案;但亦反映出口管制會影響架構取捨。

電力同透明度仲要追

性能贏榜之外,成本同透明度都要攤開睇。TOP500 系統頁寫 LineShine 功耗 42,220kW,效率 52.07 GF/W;El Capitan 功耗 29,685kW,效率 60.94 GF/W。即係 LineShine HPL 成績高一截,但用電都大一截,效率冇贏。再者,Engadget 引述《紐約時報》話,設計方冇公開 CPU 由邊間製造、用咩製程。對科研團隊同軟件開發者嚟講,硬件資料唔公開,可能同策略考慮有關;但調校工具、compiler、library 同長期支援開得幾多,會影響佢啱唔啱用。

對 AI 產業有咩意思

短期睇,LineShine 唔會令 AI startup 由 GPU 雲端即刻轉去 CPU-only 超算;模型訓練生態、框架支援同低精度 accelerator 仍然偏向 NVIDIA / AMD 嗰邊。長線睇,佢提醒市場,「算力」可以有多過一條產品路線:HPC 模擬、AI 訓練、資料密集 workload 各有瓶頸。下一步要睇 LineShine 有冇公開多啲實際應用成績,特別係大型模型訓練、軟件移植成本同持續運作效率。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook