AI agent 愈做愈多嘢,AMD 點解話 server CPU 增速快過 GPU
Tech News

AI agent 愈做愈多嘢,AMD 點解話 server CPU 增速快過 GPU

圖片:via iThome — https://www.ithome.com.tw/news/177586
TechLab 編輯部(譯)·

模型運算交畀 GPU,工具調用同資料處理就壓到 CPU 身上

GPU 計模型,CPU 執行成件事

iThome 報道,AMD 行政總裁蘇姿丰喺 Advancing AI 2026 表示,全球 AI 運算已有超過一半用喺推論,AI agent 帶動嘅非模型工作亦急速增加。GPU 繼續負責神經網絡嗰堆密集運算,不過一個 agent 收到要求之後,仲要拆任務、整理資料、檢查權限、調用 API、查數據庫、執行程式,再將結果送返模型判斷下一步。呢堆控制邏輯、I/O 同通用運算,大部分都落喺 CPU 或其他 CPU server。

普通 chatbot 通常係一個 prompt 換一個答案,agent 就可能行幾個甚至更多回合。舉個例,佢先叫模型規劃,再查公司文件、開 sandbox 跑程式、對照網上資料,最後叫模型整合答案。每做一步,都會用到 CPU、RAM、儲存、網絡,亦可能要再推論一次。模型本身只係整條任務鏈其中一節,所以就算每次推論快咗,周邊服務跟唔上,GPU 一樣會等資料。

AI agent 愈做愈多嘢,AMD 點解話 server CPU 增速快過 GPU

圖片:Wikimedia Commons — Martin Hawlisch (LosHawlos)(CC BY-SA 3.0)

「快過 GPU」講緊預測,唔係實際反超

呢句最容易睇錯。蘇姿丰講嘅係 server CPU 可服務市場規模嘅預測增速,唔係話 CPU 出貨、收入或者運算需求總量已經高過 GPU。AMD 今年五月估計,server CPU 市場到 2030 年會以每年超過 35% 增長,規模升至超過 1,200 億美元;公司之前嘅估算係每年 18%。呢啲數字來自 AMD 自己,官方文件亦列明屬前瞻預測,受產品銷售立場影響,未可以當成已發生嘅市場結果。

但 GPU 需求亦冇因為咁轉弱。訓練大型模型、每次生成 token,同大量平行推論,仍然靠加速器處理。個變化在於每組 GPU 周圍要配幾多 CPU 資源:AMD 話傳統聊天服務常見一粒 CPU 配四至八粒 GPU,agent 場景可能逐步靠近一比一。Intel 喺 Computex 2026 都引用 Creative Strategies 類似估算,不過兩間都賣 server CPU,方向一致只代表供應商睇到同一門生意,仲算唔上中立證明。

數據中心要重新計算資源比例

AMD 因應呢種負載,將 CPU 分成幾個用途:一部分貼住 GPU 做 host,另一層跑 agent、sandbox 同工具調用,原有企業 server 就繼續處理數據庫同內部系統。新一代 EPYC「Venice」最高提供 256 核心,Helios 機櫃就整合 MI455X GPU、EPYC CPU、Pensando 網絡硬件同 ROCm。AMD 想賣嘅已經涵蓋成套機櫃,呢點亦解釋到點解管理層近排特別強調 CPU:CPU 需求升,對佢成套產品組合都有利。

架構上,分開 CPU 同 GPU 資源其實幾合理。工具服務未必同模型放喺同一部機,可能散落喺 Kubernetes、serverless、數據庫或者第三方網上服務。CPU 層可以獨立加機,唔使為咗多跑幾個 API call 就買多張昂貴 GPU;反過來,CPU、RAM 或網絡配得太少,GPU 利用率跌,最貴嗰部分硬件就會白等。單睇 GPU 每秒出幾多 token,已經睇唔晒 agent 系統嘅成本。

Developer 要量度整條任務鏈

用託管模型 API 嘅團隊通常揀唔到背後 CPU 型號,但帳單仍會反映多輪 token、serverless 執行時間、數據庫查詢、儲存同網絡流量。自建推論服務就要再睇 CPU 核心數、RAM 容量、I/O、同時運行幾多個 agent,同埋工具失敗後重試幾多次。較實際嘅做法係用完整任務測延遲、成功率、每單成本同 GPU 利用率,唔好淨係跑模型 benchmark。

AMD 呢個判斷有清楚嘅商業動機,不過 agent 確實令 AI 基建多咗大量通用運算。下一步要睇雲端供應商實際加幾多 CPU 容量、CPU 對 GPU 配置點變,同埋大量企業 agent 投產之後,端到端成本係咪真係跟 AMD 預測咁升。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook