
AMD 簽協議擬收購 Taalas:AI 模型直接入晶片,快得有代價
固定模型換推論效率,彈性、精度同量產仍未有答案
TechNews 科技新報報道,AMD 喺 8 月 6 日宣布同 Taalas 簽咗最終收購協議,打算把呢間加拿大 AI 晶片公司納入旗下。要講清楚,交易仲未完成交割,仍要等監管審批同一般交割條件;AMD 亦冇公開作價或者預計完成日期。今次值得睇,因為 AI 支出重心逐步由訓練移去日常推論,模型每答一次都會產生成本,流量愈大,硬件效率愈直接影響服務毛利。
點解要把模型固定喺晶片
GPU 同一般可編程 AI accelerator 嘅好處係彈性高,同一套硬件可以靠軟件、編譯器同 kernel 跑唔同模型。不過模型權重通常放喺 HBM,每生成一輪 token,硬件都要搬動大量資料;遇上低 batch、要即時回應嘅工作,運算單元未必食得盡。Taalas 揀咗極端做法:把模型權重放入晶片內嘅 Mask ROM,再按固定 dataflow 設計運算路徑,減少外置記憶體流量、排程同通用控制開支。動態嘅 KV cache 同 LoRA adapter 就留喺 SRAM,保留少量調校空間。

圖片:Taalas
HC1 快,但數字要睇埋條件
Taalas 首款 HC1 係一粒針對 Llama 3.1 8B 嘅示範晶片,用台積電 6nm 製程,面積 815mm²,包含 530 億粒 transistor;官方產品頁列出完整 server 功耗為 2.5kW。Taalas Labs 聲稱,HC1 喺 1,000 token 輸入、1,000 token 輸出條件下,每名用戶可跑約 17,000 token/s。不過呢個係廠方自測,圖表入面部分對手數據又來自其他測試來源,暫時冇第三方用一致設定重跑,唔可以直接當成整體快過 NVIDIA GPU 嘅證明。

圖片:Taalas
換模型唔係更新軟件咁簡單
HC1 跑得快,代價係 Llama 3.1 8B 嘅基本架構同權重已經固定。LoRA 可以針對特定工作微調輸出,但換唔到另一個基礎模型,更處理唔到大幅架構改動。TrendForce 整理 Taalas 資料時提到,新模型只要改兩層光罩,廠方亦聲稱由收到模型到做成硬件約需兩個月。兩個月對晶片業算快,但同 AI 模型嘅更新速度比,就未必夠快。設計確認、投片、封裝、測試同良率爬升亦唔會憑空消失,晶片到手時模型可能已經落後一輪。
低精度量化亦會犧牲質素
第一代平台用自訂 3-bit 基本數值格式,實際模型混合 3-bit 同 6-bit 參數。Taalas 創辦人 Ljubisa Bajic 自己承認,呢種進取量化會令輸出質素差過 GPU 上嘅版本;公司話第二代會改用標準 4-bit 浮點格式。速度圖如果冇連同答案準確度、長上下文表現同推理能力一齊睇,參考價值有限。固定工作如分類、簡短摘要或者語音回應可能容易接受,要求細微語意同複雜推理嘅服務,就要逐項驗證先知個折衷值唔值。
AMD 可以點樣補齊產品線
AMD 官方話,Taalas 技術會加入 accelerator roadmap,亦會同 Instinct GPU 組成系統級方案。合理推斷係把高流量、模型穩定嘅推論交俾專用晶片,訓練、新模型同多模型工作繼續由 Instinct 處理;EPYC CPU 就負責主機、請求分流同系統控制。呢種混合架構啱過硬要一粒晶片包辦所有工作,亦可以令 Helios 機櫃按 workload 配搭唔同運算資源。至於軟件整合得有幾順,AMD 暫時只提到 ROCm 生態,未公開工具鏈同產品時間表。
Xilinx 有協同空間,但官方未交代
AMD 公告冇講 Taalas 會點同 Xilinx 技術整合,所以呢部分只可以作策略推論。FPGA 同 adaptive SoC 嘅彈性介乎 GPU 同固定 ASIC 之間,適合做資料前後處理、控制邏輯,亦可以喺正式投片前驗證部分 dataflow。AMD 手上同時有 EPYC、Instinct、Xilinx、Pensando 同機櫃系統能力,的確較有條件把 Taalas 由技術示範變成完整產品。不過產品線多,唔代表擺埋一齊就會運作暢順;API、編譯工具、部署管理同客戶支援仍要逐樣做好。
足以挑戰 NVIDIA?暫時只限窄場景
NVIDIA 嘅護城河包括 CUDA、開發工具、網絡互連、整櫃系統同龐大軟件生態,單一固定模型晶片未足以全面追上。Taalas 技術如果做到穩定量產,喺長期跑同一模型、低延遲同高流量嘅推論服務,確實有機會壓低每個 token 成本,甚至迫 GPU 方案重新定價。但 HC1 面積大,量產良率、實際售價、客戶規模同供貨能力全部未公開;省下 HBM 同先進封裝,亦要有足夠固定需求先攤薄每款模型嘅設計同光罩成本。下一步要等交易交割、AMD 公布產品路線,再睇第三方效能同質素測試能否重現廠方結果。
參考來源
- TechNews 科技新報 — 模型直接寫入晶片!AMD 收購 AI 新創 Taalas,與輝達 AI 推論晶片一較高下 — original report
- AMD Acquires Taalas to Advance Compute Solutions for Rapidly Growing AI Inference Market — AMD 官方公告,確認交易仍待交割、監管審批同預計整合方向。
- Taalas HC1 Products — HC1 官方產品頁,列出製程、晶片面積、transistor 數量、server 功耗同測試條件。
- The path to ubiquitous AI — Taalas 創辦人技術文章,交代固定模型架構、LoRA、量化質素折損同模型轉晶片時間。
- Inference Economy Arrives: AI Chip Rules Are Being Rewritten — 補充 GPU 記憶體樽頸、Mask ROM、製造週期同固定推論晶片嘅商業限制。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







