OpenAI Jalapeño數據背後:推論晶片如何壓低延遲與耗電
Tech News

OpenAI Jalapeño數據背後:推論晶片如何壓低延遲與耗電

圖片:TechLab 自製資訊圖
TechLab 編輯部(譯)·

OpenAI公布首款自研推論晶片 Jalapeño 的首批推論測試結果,直接把焦點放在大型語言模型服務最關鍵的兩項指標:每瓦可處理多少工作,以及用戶由送出請求至收到完整回應要等多久。iThome 報道指出,Jalapeño 在 GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T 三款模型上,峰值每瓦吞吐量為比較系統的 1.5 至 1.9 倍,端到端回應延遲則低約 43% 至 72%。對依賴模型推論提供服務的平台而言,這類提升可影響同一電力與硬件資源下能承接的請求量。

不過,這些結果不應直接理解為 Jalapeño 已在所有生成式 AI 工作負載中全面勝過 Nvidia。測試由 OpenAI 公布,採用公開的 SemiAnalysis InferenceX 基準,並針對三個指定的開放權重模型進行;比較對象亦隨模型而變。晶片尚未開始大規模部署,實際服務的穩定性、供應規模,以及面對不同輸入長度、併發量和模型架構時的表現,仍有待其正式上線後驗證。

效率優勢來自減少資料往返

iThome 報道引述 OpenAI 的說明,Jalapeño 的設計重點是縮減推論時的資料搬移及晶片間通訊。大型語言模型先要讀取整段輸入,再逐步生成輸出 token;兩個階段對運算和 RAM 使用的要求並不相同。尤其在生成過程中,模型會反覆讀取 KV 快取等資料。若資料經常要在不同運算單元之間搬動,處理器即使本身很快,仍會因等待傳輸而拖慢整體回應。

OpenAI 的做法是盡量把這些重複使用的資料留在本地。從工程角度看,這不單是追求較高峰值算力,而是嘗試縮短完整請求路徑上的停頓時間。這亦解釋了為何報道同時列出每瓦吞吐量和端到端延遲:前者較接近資源使用效率,後者則較貼近用戶實際感受到的回應速度。兩項數據同時改善,才較能支持該設計在指定測試流程中確實減少了系統瓶頸。

與 GB200、GB300 的比較應怎樣看

iThome 指出,GPT-OSS 120B 以 Nvidia GB200 作比較,Jalapeño 的峰值每瓦吞吐量約為其 1.9 倍;DeepSeek R1 及 Kimi K2.5 則對比較新的 GB300。DeepSeek R1 的完整請求回應時間由 5.99 秒降至 1.65 秒,每瓦吞吐量約為 GB300 的 1.7 倍;Kimi K2.5 的數字則為由 5.31 秒降至 1.56 秒,以及約 1.5 倍的峰值每瓦吞吐量。

閱讀這組數字時要留意:各項結果均按個別模型配對得出,不能把 GB200 與 GB300 視作完全相同的單一基線,也不宜把三項倍率平均後當成通用結論。峰值每瓦吞吐量尤其受模型、系統設定和工作負載影響;完整回應時間亦包含輸入處理與逐 token 生成的整個流程。較合理的解讀是,OpenAI 已展示 Jalapeño 在這三個選定模型及 InferenceX 測試條件下具備競爭力,但獨立測試和更多模型結果仍是判斷其可泛化程度的必要資料。

Codex 的角色:縮短軟件適配時間

iThome 報道亦顯示,OpenAI 的成果不只來自新硬件。團隊利用 Codex 配合 GPT-Astra,在兩個月內,把原先未列入 Jalapeño 生產規劃的三款開放權重模型優化至高效能水準。這反映專用推論晶片的競爭,不只取決於電路設計,也取決於能否迅速把模型的注意力機制、混合專家模型等運算模式,改寫為適合新硬件的軟件實作。

據 iThome 報道,GPT-OSS 部分注意力機制及混合專家模型運算區塊,AI 產生的實作較既有人類專家版本快 1.5 至 1.8 倍。這是特定程式區塊的比較,並非整個模型端到端速度同樣提高,卻顯示編程代理可協助硬件團隊更快探索及落實最佳化方案。若這種流程能可靠地重複,晶片平台面對新模型時的支援速度或會提升,減少開發者等待特定 kernel 或執行路徑成熟的時間。

部署後要看的不只是跑分

iThome 指出,OpenAI 計劃在 2026 年底開始把第一代 Jalapeño 部署到自家運算基礎設施,第二代正在深入開發,第三代亦已開始規劃。同時,公司表示會繼續使用 Nvidia 及其他合作夥伴的加速器支援模型訓練和推論。這表示 Jalapeño 現階段較像是擴充運算選項,而非取代既有加速器的單一轉向。

下一步最值得觀察的是部署後能否把基準優勢轉化為持續的服務效益,包括高併發下的延遲、不同模型的適配速度,以及每瓦吞吐量改善是否能實際帶來更低的推論資源壓力。對使用 AI 服務的企業和開發者來說,晶片型號未必直接可見,但若推論效率改善能落實於服務層,回應速度、使用配額和採用成本都可能隨之改變;目前這仍是根據已公布測試所作的合理推論,而非已獲確認的市場結果。

延伸閱讀

AI 輔助說明: 本文由 AI 協助整理,並經兩輪獨立自動品質審核;資料及連結仍以原始來源為準。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook