TAG

#AI 推論

6 篇文章

TechLab 所有關於「AI 推論」嘅文章、評測同教學,由最新排起。

傳 Anthropic 60 億美元收購 Decart,盤算由推論成本去到即時影片Tech News

傳 Anthropic 60 億美元收購 Decart,盤算由推論成本去到即時影片

Anthropic 據報洽購 Decart,睇中嘅可能唔止係世界模型。Decart 擅長由晶片、compiler 到模型推論逐層調校,啱啱配合 Claude 橫跨 Trainium、TPU 同 NVIDIA GPU 嘅運算部署;若果交易成事,回應速度、服務成本同新產品形態都有機會受影響。

29 天前
NVIDIA Dynamo 多項漏洞一次修補:遠端攻擊條件同升級版本點睇Tech News

NVIDIA Dynamo 多項漏洞一次修補:遠端攻擊條件同升級版本點睇

NVIDIA 為 Linux 版 Dynamo 公開 15 個漏洞,當中 CVE-2026-24254 可經網上連線觸發,唔使權限或用戶操作,後果包括執行程式碼。高分唔代表所有部署已經暴露,不過管理員要查清楚入口設定,再升上 v1.3.0。

1 個月前
AMD 簽協議擬收購 Taalas:AI 模型直接入晶片,快得有代價Tech News

AMD 簽協議擬收購 Taalas:AI 模型直接入晶片,快得有代價

AMD 想買入 Taalas 嘅固定模型晶片技術,避開 GPU 搬運模型權重嘅效率樽頸。不過 HC1 嘅高速數字來自廠方自測,模型更新、低精度量化同大晶片量產風險,全部都要計入成本。

1 個月前
GPT‑5.6 Sol 跑到 750 tokens/s,Codex 工作節奏會點變Tech News

GPT‑5.6 Sol 跑到 750 tokens/s,Codex 工作節奏會點變

GPT‑5.6 Sol 喺 Cerebras 硬件上最高可跑到每秒 750 tokens,coding agent 等模型回應嘅時間有望大減。不過數字只代表最高生成速度,瀏覽器、測試同網上服務仍然會拖慢任務;AMD Helios 聯合方案亦要到 2026 年下半年先推出。

1 個月前
HBM 頻寬點樣拖慢 ChatGPT token,同雲端 AI 成本有咩關係Tech News

HBM 頻寬點樣拖慢 ChatGPT token,同雲端 AI 成本有咩關係

SK hynix 美東 7 月 10 日喺 Nasdaq 以 ADR 掛牌,市場又放大 HBM 呢條線。對開發者同 AI 團隊嚟講,真正要睇係 ChatGPT、agent 每出一粒 token 點樣食 HBM 頻寬,未來 AI API 同雲端 GPU 成本會跟住變。

2 個月前
ZML/LLMD 想拆 CUDA 綁死,企業私有 LLM 部署多一個硬件選擇Tech News

ZML/LLMD 想拆 CUDA 綁死,企業私有 LLM 部署多一個硬件選擇

ZML 推出 LLMD alpha,官方話同一套推論 server 可跑 NVIDIA、AMD、TPU、Intel 同 Apple Metal。賣點係幫企業試唔同 AI 晶片,減少 CUDA 綁定;但 LLMD 暫時未開源,效能數字亦主要嚟自官方。

2 個月前