#AI 推論
6 篇文章
TechLab 所有關於「AI 推論」嘅文章、評測同教學,由最新排起。
Tech News傳 Anthropic 60 億美元收購 Decart,盤算由推論成本去到即時影片
Anthropic 據報洽購 Decart,睇中嘅可能唔止係世界模型。Decart 擅長由晶片、compiler 到模型推論逐層調校,啱啱配合 Claude 橫跨 Trainium、TPU 同 NVIDIA GPU 嘅運算部署;若果交易成事,回應速度、服務成本同新產品形態都有機會受影響。
Tech NewsNVIDIA Dynamo 多項漏洞一次修補:遠端攻擊條件同升級版本點睇
NVIDIA 為 Linux 版 Dynamo 公開 15 個漏洞,當中 CVE-2026-24254 可經網上連線觸發,唔使權限或用戶操作,後果包括執行程式碼。高分唔代表所有部署已經暴露,不過管理員要查清楚入口設定,再升上 v1.3.0。
Tech NewsAMD 簽協議擬收購 Taalas:AI 模型直接入晶片,快得有代價
AMD 想買入 Taalas 嘅固定模型晶片技術,避開 GPU 搬運模型權重嘅效率樽頸。不過 HC1 嘅高速數字來自廠方自測,模型更新、低精度量化同大晶片量產風險,全部都要計入成本。
Tech NewsGPT‑5.6 Sol 跑到 750 tokens/s,Codex 工作節奏會點變
GPT‑5.6 Sol 喺 Cerebras 硬件上最高可跑到每秒 750 tokens,coding agent 等模型回應嘅時間有望大減。不過數字只代表最高生成速度,瀏覽器、測試同網上服務仍然會拖慢任務;AMD Helios 聯合方案亦要到 2026 年下半年先推出。
Tech NewsHBM 頻寬點樣拖慢 ChatGPT token,同雲端 AI 成本有咩關係
SK hynix 美東 7 月 10 日喺 Nasdaq 以 ADR 掛牌,市場又放大 HBM 呢條線。對開發者同 AI 團隊嚟講,真正要睇係 ChatGPT、agent 每出一粒 token 點樣食 HBM 頻寬,未來 AI API 同雲端 GPU 成本會跟住變。
Tech NewsZML/LLMD 想拆 CUDA 綁死,企業私有 LLM 部署多一個硬件選擇
ZML 推出 LLMD alpha,官方話同一套推論 server 可跑 NVIDIA、AMD、TPU、Intel 同 Apple Metal。賣點係幫企業試唔同 AI 晶片,減少 CUDA 綁定;但 LLMD 暫時未開源,效能數字亦主要嚟自官方。