AI 代理食 CPU 傳 AWS 要工程師慳算力,Spot 容量點解值得留意
Tech News

AI 代理食 CPU 傳 AWS 要工程師慳算力,Spot 容量點解值得留意

圖片:via TechNews 科技新報 — https://technews.tw/2026/08/10/amazon-instructs-aws-engineers-to-cut-cpu-waste-amid-capacity-crunch/
TechLab 編輯部(譯)·

報道指內部開發等耐咗,AWS 話只係一貫資源優化

消息講到邊,AWS 又點回應

TechNews 科技新報報道,The Information 引述匿名消息指,AWS 管理層今年 5 月曾叫工程團隊減少浪費 CPU,亦打算喺下半年回收長期閒置嘅 EC2 虛擬機,優先騰出容量畀客戶。部分內部工程師據報以往幾個鐘就攞到開發資源,而家有時要等幾日。呢批講法未獲獨立證實,亦唔代表成個 EC2 平台全面缺貨。

AWS 其後向 Tom’s Hardware 否認報道所講嘅「新容量限制」。公司話 EC2 需求的確好強,但絕大部分內外部運算要求仍然應付到;清理閒置實例、按實際負載調細規格,同按需要增減容量,一直都係內部做法。兩邊真正有分歧嘅地方,係今次節流只屬日常慳資源,定係需求緊張之下收得嚴過以前。

Spot 緊張唔等於所有 EC2 都冇貨

原報道經二手轉述後最易搞亂嘅係 Spot 同 On-Demand。TechNews 科技新報原文將 spot instances 寫成「按需實例」,但按 AWS 官方定義,Spot 其實係平價出租嘅剩餘 EC2 容量;AWS 要攞返容量時,可以提早兩分鐘通知後中斷實例。The Information 嘅消息指缺口主要落喺 Spot,另有顧問話已簽約容量未見短缺,所以暫時唔應推論一般 EC2 客戶都攞唔到 CPU。

呢個分別對開發團隊好實際。CI/CD、批次處理、測試環境同可以重新排程嘅 container 工作,本身幾適合用 Spot 慳錢;但如果成套流程綁死單一 instance type 或 Availability Zone,剩餘容量一收緊就會排長隊。AWS 建議每個工作負載至少準備 10 種合適嘅 instance type,分散到多個 Zone,再由 EC2 Fleet 或 Auto Scaling 揀容量較鬆動嘅 pool。

AI 代理點解連 CPU 都食得快

一般人講 AI 基建,第一時間多數諗 GPU。不過代理唔會淨係問模型一次就停:佢可能同時開幾個 worker,讀 repository、跑測試、build container、操作瀏覽器、查資料庫,再將結果交返模型決定下一步。推論部分可以喺 GPU 做,大量工具調用、流程協調、編譯同傳統 server 工作仍然靠 CPU。一個任務扇出十幾條支線,總 CPU 時數自然可以升得好快。

麻煩位仲有資源生命週期。人手開測試機,做完通常記得關;代理如果權限太闊、失敗後不停重試,或者工作完成但清理步驟冇跑到,就可能留低一批低使用率實例。單部機睇落唔誇張,數十個團隊長時間累積就會同正式工作爭容量。呢亦解釋到點解 AWS 所講嘅回收閒置實例,就算真係慣常管理,喺代理大量普及後都重要咗。

成本警報唔夠,代理要有硬上限

開發團隊唔應淨係靠月底帳單先發現問題。較穩陣嘅做法係用獨立 account 跑代理,或者只畀代理用受限角色,再限制佢可以啟動嘅 EC2 類型、Region、vCPU 數量同並行 worker。再為每個任務設最長執行時間、重試次數同自動清理期限。IAM 亦應跟最小權限做,代理唔使開機就唔畀 RunInstances,要開亦只准操作指定 tag 嘅開發資源。

AWS Budgets 可以按實際或預測開支發警報,去到門檻後亦可套用拒絕新增 EC2 資源嘅 IAM policy。不過 AWS 官方提醒,成本資料同通知有延遲,失控代理可以喺警報到達前繼續燒錢。所以預算工具適合做第二道防線,真正有效嘅煞車仍然要放喺代理調度層:每次任務有配額,超時即停,開出嚟嘅資源亦要有可追蹤嘅擁有者。

下一步要睇實際容量數據

暫時資料冇證明香港區域 ap-east-1、區內價錢或本地客戶受影響,亦冇足夠證據話 AWS 出現全面 CPU 危機。用開 Spot 嘅團隊可以睇 EC2 Capacity Manager 新增嘅中斷次數同中斷率,按 Region、Zone 同 account 比較趨勢。如果申請失敗、輪候時間或中斷率持續升,先再調整 instance 組合同 On-Demand 比例,會實際過跟住一篇匿名消息大幅改架構。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook