
Google 傳研發 Frozen v2:將 Gemini 架構刻入晶片,慳電背後要押中模型方向
工程團隊估計每瓦可處理多 6 至 10 倍 token,但架構一改就可能提早退役
Google 據報研究一款內部叫做 Frozen v2 嘅 server 晶片,打算將 Gemini 部分模型架構直接固定喺電路。Tom’s Hardware 引述 The Information 報道,項目工程團隊估計,佢每瓦可處理嘅 token 數量有機會去到最新一代 TPU 嘅 6 至 10 倍,最快 2028 年部署。不過呢個係兩名匿名知情人士提供嘅消息,Google 未有正式公布,效率數字亦只係工程預測,離實際晶片同公開測試仲有一大段路。
刻入去嘅係運算方法,唔代表答案寫死咗
一般 GPU 或 TPU 要先由記憶體載入模型,再按每層結構、數值格式同運算次序調度硬件。大型模型每生成一個 token,都要反覆讀取大量參數;運算單元本身可能夠快,記憶體同晶片之間搬資料反而食咗唔少時間同電。Frozen v2 嘅構想係預先固定部分 Gemini 運算路徑,減少晶片執行時要落嘅決定,同時縮短資料來回搬運嘅距離。報道冇公開具體電路細節,所以而家仍然無法判斷佢會固定到幾深入。
呢度要分清楚 模型架構同 weights。架構決定模型有幾多層、資料點樣流、每層做咩運算;weights 就係訓練期間學返嚟、數量極多嘅參數。據報 Jeff Dean 帶頭研究嘅第一版 Frozen 曾考慮連 weights 都寫入晶片,但 Google 最後擱置,原因係 Gemini 一更新,成批晶片就可能失去用途。Frozen v2 將風險收窄:weights 仍然可以更新,只固定部分架構,不過新一代 Gemini 仍要沿用兼容設計先食得盡塊晶片。

圖片:Google
點解少搬資料可以快咁多
AI 推理除咗睇計算量,記憶體頻寬亦好關鍵。TPU、GPU 要支援多款模型同工作,所以要保留可編程能力、外置高頻寬記憶體同複雜調度;呢份彈性實用,但每次搬參數、檢查指令同協調運算都有成本。Frozen v2 如果真係可以為 Gemini 剪走一批通用電路同資料流,首個 token 嘅等待時間、持續輸出速度同耗電都有機會改善,尤其 agent 要連續呼叫模型幾十次時,每次慳少少延遲,累積效果可以幾明顯。
市場上已經有人行得再盡。加拿大公司 Taalas 嘅 HC1 將 Llama 3.1 8B 連架構同 weights 固定落晶片,唔使配搭 HBM。Taalas 聲稱每名用戶可做到接近 17,000 tokens/s;Heise 試用佢嘅示範服務時錄得接近 16,000 tokens/s。不過 HC1 只跑指定模型,仲用咗較進取嘅量化格式,速度比較亦未有廣泛獨立驗證。Frozen v2 保留可換 weights,彈性高過 HC1,但理論效率亦未必去到完全寫死模型咁盡。

圖片:Taalas
Google 已經開始將 TPU 分工
Google 喺 Cloud Next 2026 公布第八代 TPU,首次分拆成訓練用 TPU 8t 同推理用 TPU 8i。官方資料話,8i 加大咗晶片內 SRAM,主攻低延遲推理;8t 就集中處理大型訓練工作。Frozen v2 可以理解成呢條專用化路線再向前推:由「專做推理」縮窄到「專做 Gemini 某類架構」。報道亦話 Google 冇打算用 TPU 同等規模生產,初期較似技術試驗,會同 TPU 一齊用。
背後壓力其實相當現實。The Information 嘅消息指,Google Cloud 嘅 AI 運算量短缺嚴重到要推走部分外部客戶生意。Google 官方就話,Cloud 客戶經 API 處理嘅自家模型流量已超過每分鐘 160 億 token。假如 6 至 10 倍 tokens per watt 最終做得到,同一座數據中心、同一份電力就可以回應多好多請求,亦可能減少繁忙時間排隊。不過成本下降會唔會反映落 Gemini 訂閱或 Cloud API 價錢,仍然係 Google 嘅商業決定,硬件慳電唔會自動變成用戶平咗。
最大風險係晶片追唔上模型
晶片由定案、流片到部署通常以年計,模型架構就可能幾個月已經轉一次。Gemini 如果改用 Frozen v2 冇預留嘅 attention、稀疏運算、專家混合方式或者數值格式,舊晶片即使仲正常運作,都可能食唔到新模型。Google 固定幾多架構、保留幾多可編程空間,會直接影響效率同晶片壽命。固定得愈多,理論上效率愈高,但模型架構一改,晶片亦可能更快失去用途。
所以 2028 呢個時間點只可以當目標,唔應當成產品承諾。Frozen v2 真正值得睇嘅下一步,包括 Google 最後固定咗邊部分、實際晶片跑邊代 Gemini、同 TPU 8i 用同一模型比較時有幾快同幾慳電。呢幾項有公開數據之前,6 至 10 倍仍然係一個幾吸引、但未經證實嘅工程估算。
參考來源
- Tom's Hardware — Google reportedly developing 'Frozen v2' chip with Gemini's architecture etched into the silicon — engineers project 6 to 10 times more tokens per watt than latest TPUs — original report
- Google plans new chip to run Gemini models more efficiently, The Information reports — Reuters 轉述,交叉核對 Google 回應、運算量短缺、部署時程同計劃定位。
- Our eighth-generation TPUs: two chips for the agentic era — Google 官方資料,核對 TPU 8t、8i 分工、SRAM、記憶體頻寬同推理定位。
- Cloud Next ’26: Momentum and innovation at Google scale — Google 官方公布 TPU 8t、8i 規模、效能方向同每分鐘 API token 流量。
- The path to ubiquitous AI — Taalas 官方介紹 HC1、模型固化、無 HBM 設計同廠方效能數字。
- AI inference cast in silicon: Taalas announces HC1 chip — 補充 HC1 試用速度、量化限制、硬件資料同缺乏廣泛獨立驗證嘅背景。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







