
ZML/LLMD 想拆 CUDA 綁死,企業私有 LLM 部署多一個硬件選擇
免費 alpha 支援多款 AI 晶片,重點係減少供應商綁定同試機成本
ZML 今次拎出嚟嘅係 LLMD
ZML 喺 2026 年 7 月 8 日放出 ZML/LLMD alpha,官方講法係一個自成一套嘅 LLM 推論 server,可以跑 Llama、Gemma、Qwen、Mistral,目標平台包括 NVIDIA CUDA、AMD ROCm、Google TPU、Intel oneAPI 同 Apple Metal。TechNews 科技新報 報道,呢間法國 AI startup 想拆開晶片同軟件之間嘅孤島;TechCrunch 就引述創辦人 Steeve Morin 話,佢哋想畀公司重新掌握砌自己系統嘅主導權。呢句聽落似 PR,不過問題本身好實際:LLM 推論成本愈嚟愈大,硬件供應又唔係永遠任買。

圖片:ZML
CUDA 綁定點解咁難拆
而家好多公司講「用開源模型自己跑」,但真係部署時,常見路線仍然係 NVIDIA GPU 加 CUDA 周邊工具。買卡只係第一步,後面仲有 driver、container、kernel、batching、監控、模型載入、autoscaling,全部都會影響 token 成本同延遲。ZML 要賣嘅概念,其實係將呢堆推論層抽出嚟,等同一個 app endpoint 背後可以試 H100、MI300X、TPU、Intel GPU,甚至 Apple Silicon 做開發或細量任務。對企業 IT 嚟講,最大價值係採購同架構討論多咗籌碼。
功能表睇落似成熟,但 alpha 就係 alpha
官方 blog 列咗 continuous batching、paged attention、tensor parallel sharding、prefix caching、tool calling 同 Prometheus metrics,呢啲都係現代 LLM serving 會睇嘅基本功。ZML 亦放咗自家效能表,例如 Gemma 4 喺 H100、MI300X、TPU v6e、M3 Max 等平台嘅 TTFT、ITL 同 tok/s。呢啲數字有參考價值,但要講清楚:暫時見到主要係官方數據,唔係第三方實測,亦未必等於你自己個模型、context 長度、batch size 同連線環境。
同 vLLM、SGLang 撞正邊度
LLM serving 已經好多人做,vLLM 同 SGLang 都有 OpenAI-compatible API、batching、prefix cache 呢類能力,SGLang 官方仲列到好多硬件目標。所以 ZML 唔係淨係靠「有個 endpoint」出位。佢較特別嘅位,係由 Zig、MLIR、OpenXLA 嗰套底層開始,嘗試用同一套 codebase 編譯到唔同硬件。呢個方向如果做得穩,可以減少團隊為每款 accelerator 分開維護 serving stack 嘅麻煩;做唔穩,就會變成另一層要 debug 嘅複雜度。
免費兩隻字要睇清楚
TechCrunch 報道話,LLMD 而家以免費產品推出,但同 ZML 早前公開嘅 ML framework 唔同,LLMD 本身未開源;TechNews 科技新報 亦轉述咗呢點。Docker Hub 上面嘅 zmlai/llmd 寫明係 alpha,日後可能大改,呢個訊號好重要。公司如果打算放入私有 LLM 項目或客戶案,唔好只睇「免費」兩隻字,仲要問清楚授權、SLA、版本支援、日後收費、資料路徑同供應商風險。
對公司部署 LLM 嘅實際意思
如果你係 AI startup、system integrator,或者公司 IT 想喺自己 server 跑 Qwen、Llama、Mistral 呢類模型,LLMD 值得放入 shortlist 試。原因好直接:你可以用同一個 serving 介面,對比唔同 GPU 或加速器嘅吞吐、延遲、電費同採購價,而唔使一開始就俾某一套硬件生態綁到死。香港角度唔使硬砌,暫時冇本地推出或價錢資訊;真正有關嘅場景係啲要幫客戶砌私有 AI、又要控制硬件成本嘅團隊。
下一步睇咩
LLMD 係值得睇,但未到可以閉眼換 production stack 嘅階段。真正要睇嘅係三樣:第三方 benchmark 會唔會對得住官方數字;DeepSeek、Kimi、GLM 等官方話就嚟支援嘅模型幾時到;仲有免費 alpha 之後嘅商業條款點寫。推論 server 呢層一旦放入生產環境,換走成本好高,試新嘢可以快,簽落去就要慢慢睇。
參考來源
- TechNews 科技新報 — 打破晶片孤島!法國 AI 新創 ZML 推出跨平台推論伺服器,挑戰硬體供應商壟斷 — original report
- ZML/LLMD alpha | ZML — 官方發佈文,用嚟確認支援平台、模型、功能同官方效能數字。
- ZML/LLMD product page | ZML — 官方產品頁,用嚟核對 accelerator targets、image size 同基本啟動方式。
- zmlai/llmd | Docker Hub — Docker image 頁面,顯示 alpha 狀態、OpenAI-compatible API 同支援模型類型。
- Hot French startup ZML releases free product to speed inference across lots of AI chips | TechCrunch — 專訪原報道,用嚟核對免費但未開源、融資、競爭背景同 Morin 講法。
- zml/zml | GitHub — ZML framework repo,用嚟確認 ZML 本體嘅 Apache-2.0 授權、技術棧同硬件旗標。
- vLLM Documentation — 背景資料,用嚟對照現有 LLM serving 工具嘅 batching、PagedAttention、OpenAI-compatible API。
- SGLang GitHub — 背景資料,用嚟對照 SGLang 嘅模型同硬件支援。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







