Google 傳造 Gemini 專用 Frozen v2,目標提升 6 至 10 倍能源效率
Tech News

Google 傳造 Gemini 專用 Frozen v2,目標提升 6 至 10 倍能源效率

圖片:via TechNews 科技新報 — https://technews.tw/2026/07/21/google-plans-new-frozen-chip-to-run-its-ai-models-much-more-efficiently/
TechLab 編輯部(譯)·

項目最快 2028 年部署,效率數字仍係內部目標

將 Gemini 部分運算直接做入晶片

TechNews 科技新報引述 The Information 報道,Google 正研究代號 Frozen v2 嘅 server 晶片,最快 2028 年部署。據報個設計會將 Gemini 模型架構嘅部分內容固定喺矽晶片,減少生成答案時要做嘅運算步驟同晶片內部數據搬運。據報工程團隊嘅目標係同樣耗電之下,處理到嘅 token 數量係 Google 最新自家 AI 晶片嘅 6 至 10 倍,但 Google 未正式公布項目,規格同時間表都未定案。

呢個方向其實係將 Google 一向做開嘅軟硬件共同設計推到再專門一級。TPU 仍然要兼顧唔同模型、訓練同推理工作,Frozen v2 就據報會針對 Gemini 常用嘅運算路徑執到好盡。晶片少咗通用控制同不必要嘅數據來回搬動,理論上可以用少啲電完成同一批工作;當每日請求量去到極大規模,慳落嘅電力、散熱同機房容量就相當可觀。

Google Cloud 第八代 TPU 8t 同 TPU 8i 官方配圖

圖片:Google Cloud

6 至 10 倍要先睇清楚點計

Google 喺 2026 年公布嘅 TPU 8i 已經專攻推理,官方資料提到佢有 384MB 片上 SRAM、288GB HBM,推理效能成本較上代改善最多 80%,每瓦效能亦最多高兩倍。Frozen v2 據報瞄準 6 至 10 倍 token/瓦,幅度遠高過一般換代,不過報道冇交代測試用邊個 Gemini 版本、精度、延遲要求、批次大小同負載率。呢個數字只係內部工程目標,暫時冇獨立 benchmark 證實。

每瓦多幾倍 token,亦唔等於 Gemini API 收費可以直接劈低同一比例。AI 服務仲要計晶片製造、HBM、連接設備、server、機房、軟件同備用容量,Google亦會按市場策略定價。比較實際嘅影響係邊際推理成本有機會下降,同一座數據中心可以接更多請求。Gemini、Google AI Studio 或 Vertex AI 用戶日後可能先感受到繁忙時間容量穩定咗、配額鬆動,跟住先有機會見到價格調整;而家未有收費或地區安排。

專用得越盡,改模型越麻煩

不過,將模型架構固定入硬件,亦會令日後改模型麻煩好多。一般 TPU 可以靠 compiler 同軟件配合新模型,專用晶片就會將更多假設寫入硬件;Gemini 到 2028 年如果改咗模型結構、記憶體使用方式或者推理流程,原先固化嘅部分可能要重新設計。晶片由設計到量產要用幾年,所以 Google 要預早押注邊類運算會長期保留,亦要為軟件更新留返足夠空間。

咁睇,Frozen v2 較適合承擔版本穩定、請求量極高嘅 Gemini 工作,例如 Google 自家服務入面大量重複出現嘅推理路徑;快速試驗嘅新模型就繼續交畀 TPU 或 GPU。呢種分工可以將昂貴嘅通用運算資源留畀訓練、研究同雲端客戶,亦解釋咗點解報道指 Frozen v2 生產規模暫時唔會追上 TPU。

對 Nvidia 嘅影響冇表面咁直接

Frozen v2 如果做到目標,Google 跑 Gemini 時要買嘅通用加速器確實有機會少一截,亦可以紓緩 AI 運算容量緊張。不過 Alphabet 喺 2025 年第四季業績會提到,Google 嘅運算選擇包括 Nvidia GPU 同自家 TPU。Frozen v2 據報又唔會取代 TPU,面對其他模型、雲端客戶負載同大型訓練,GPU 同通用 TPU仍有價值,所以短期談不上擺脫 Nvidia。

Alphabet 回應相關報道時,只確認團隊一直研究同測試新技術,亦提醒唔係每個項目都會量產。由早期設計行到 2028 年仲有唔少關口,下一步要睇 Google會唔會正式確認晶片、公開量產規模同實際工作負載;未見到同延遲、模型質素一齊公布嘅測試結果之前,6 至 10 倍仍然只可以當研發目標睇。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook