AMD 簽協議擬收購 Taalas:AI 模型直接入晶片,快得有代價
Tech News

AMD 簽協議擬收購 Taalas:AI 模型直接入晶片,快得有代價

圖片:via TechNews 科技新報 — https://technews.tw/2026/08/07/amd-buy-ai-taalas/
TechLab 編輯部(譯)·

固定模型換推論效率,彈性、精度同量產仍未有答案

TechNews 科技新報報道,AMD 喺 8 月 6 日宣布同 Taalas 簽咗最終收購協議,打算把呢間加拿大 AI 晶片公司納入旗下。要講清楚,交易仲未完成交割,仍要等監管審批同一般交割條件;AMD 亦冇公開作價或者預計完成日期。今次值得睇,因為 AI 支出重心逐步由訓練移去日常推論,模型每答一次都會產生成本,流量愈大,硬件效率愈直接影響服務毛利。

點解要把模型固定喺晶片

GPU 同一般可編程 AI accelerator 嘅好處係彈性高,同一套硬件可以靠軟件、編譯器同 kernel 跑唔同模型。不過模型權重通常放喺 HBM,每生成一輪 token,硬件都要搬動大量資料;遇上低 batch、要即時回應嘅工作,運算單元未必食得盡。Taalas 揀咗極端做法:把模型權重放入晶片內嘅 Mask ROM,再按固定 dataflow 設計運算路徑,減少外置記憶體流量、排程同通用控制開支。動態嘅 KV cache 同 LoRA adapter 就留喺 SRAM,保留少量調校空間。

Taalas HC1 固定模型 AI 推論晶片板卡

圖片:Taalas

HC1 快,但數字要睇埋條件

Taalas 首款 HC1 係一粒針對 Llama 3.1 8B 嘅示範晶片,用台積電 6nm 製程,面積 815mm²,包含 530 億粒 transistor;官方產品頁列出完整 server 功耗為 2.5kW。Taalas Labs 聲稱,HC1 喺 1,000 token 輸入、1,000 token 輸出條件下,每名用戶可跑約 17,000 token/s。不過呢個係廠方自測,圖表入面部分對手數據又來自其他測試來源,暫時冇第三方用一致設定重跑,唔可以直接當成整體快過 NVIDIA GPU 嘅證明。

Taalas 公布嘅 Llama 3.1 8B 每用戶 token 速度比較圖

圖片:Taalas

換模型唔係更新軟件咁簡單

HC1 跑得快,代價係 Llama 3.1 8B 嘅基本架構同權重已經固定。LoRA 可以針對特定工作微調輸出,但換唔到另一個基礎模型,更處理唔到大幅架構改動。TrendForce 整理 Taalas 資料時提到,新模型只要改兩層光罩,廠方亦聲稱由收到模型到做成硬件約需兩個月。兩個月對晶片業算快,但同 AI 模型嘅更新速度比,就未必夠快。設計確認、投片、封裝、測試同良率爬升亦唔會憑空消失,晶片到手時模型可能已經落後一輪。

低精度量化亦會犧牲質素

第一代平台用自訂 3-bit 基本數值格式,實際模型混合 3-bit 同 6-bit 參數。Taalas 創辦人 Ljubisa Bajic 自己承認,呢種進取量化會令輸出質素差過 GPU 上嘅版本;公司話第二代會改用標準 4-bit 浮點格式。速度圖如果冇連同答案準確度、長上下文表現同推理能力一齊睇,參考價值有限。固定工作如分類、簡短摘要或者語音回應可能容易接受,要求細微語意同複雜推理嘅服務,就要逐項驗證先知個折衷值唔值。

AMD 可以點樣補齊產品線

AMD 官方話,Taalas 技術會加入 accelerator roadmap,亦會同 Instinct GPU 組成系統級方案。合理推斷係把高流量、模型穩定嘅推論交俾專用晶片,訓練、新模型同多模型工作繼續由 Instinct 處理;EPYC CPU 就負責主機、請求分流同系統控制。呢種混合架構啱過硬要一粒晶片包辦所有工作,亦可以令 Helios 機櫃按 workload 配搭唔同運算資源。至於軟件整合得有幾順,AMD 暫時只提到 ROCm 生態,未公開工具鏈同產品時間表。

Xilinx 有協同空間,但官方未交代

AMD 公告冇講 Taalas 會點同 Xilinx 技術整合,所以呢部分只可以作策略推論。FPGA 同 adaptive SoC 嘅彈性介乎 GPU 同固定 ASIC 之間,適合做資料前後處理、控制邏輯,亦可以喺正式投片前驗證部分 dataflow。AMD 手上同時有 EPYC、Instinct、Xilinx、Pensando 同機櫃系統能力,的確較有條件把 Taalas 由技術示範變成完整產品。不過產品線多,唔代表擺埋一齊就會運作暢順;API、編譯工具、部署管理同客戶支援仍要逐樣做好。

足以挑戰 NVIDIA?暫時只限窄場景

NVIDIA 嘅護城河包括 CUDA、開發工具、網絡互連、整櫃系統同龐大軟件生態,單一固定模型晶片未足以全面追上。Taalas 技術如果做到穩定量產,喺長期跑同一模型、低延遲同高流量嘅推論服務,確實有機會壓低每個 token 成本,甚至迫 GPU 方案重新定價。但 HC1 面積大,量產良率、實際售價、客戶規模同供貨能力全部未公開;省下 HBM 同先進封裝,亦要有足夠固定需求先攤薄每款模型嘅設計同光罩成本。下一步要等交易交割、AMD 公布產品路線,再睇第三方效能同質素測試能否重現廠方結果。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook