
一部 Strix Halo mini PC 包辦本機 AI:Lemonade 11 有幾實用?
由寫字、出圖、語音到 3D,一個本機 server 串起多種 AI 任務
Lemonade Server 以前主要幫你喺本機載入模型,再畀其他 app 呼叫。去到 11 系列,佢開始識得自己揀模型、出圖、讀稿、聽錄音同由圖片砌 3D,角色已經接近一個本機 AI 中樞。呢個轉變值得睇,因為公司文件、會議錄音同未公開素材可以留喺自己部機,開發者亦有機會用一套介面頂走幾個分散嘅雲端服務。
一個要求,一次過用四個模型
XDA 測試嘅 RPG-HaloTales-V1,實際係由 Qwen3.6-27B、Flux、Whisper 同 Kokoro 組成。作者只叫佢描述眼前嘅酒館同顯示畫面,router 已經自動交出文字、油畫風圖片同 21 秒旁白,仲會保存角色外貌、場景格局同美術方向,等之後生成嘅內容唔會每次變樣。呢類一致性對互動故事、遊戲原型同教學內容幾實際,亦示範到多個模型可以收埋喺同一個 model ID 後面。
文章講嘅起點係 v11.0,但寫稿時最新穩定版已去到 v11.5.1。v11.5 補完整 router、視覺化設定、分類器同 server 端 job engine,v11.5.1 再加路由測試同逐步 decision trace。即係兩星期內已經由功能首發追到較完整嘅管理工具;更新速度好快係好事,不過公司真係攞嚟長期跑自動化,就要鎖版本同先測清楚,唔好當每次升級都一定冇相容問題。

圖片:MINISFORUM
OpenAI-compatible API 最有實際價值
Lemonade 支援 chat、embeddings、語音轉文字、文字轉語音、出圖同圖片編輯等 OpenAI 格式 endpoint。用緊現成 SDK、聊天介面或者內部工具嘅開發者,通常改 server 位址同 model ID 已經可以轉用本機模型,唔使每個 backend 重新寫一次整合。3D 生成就用 Lemonade 自家 extension,未完全跟 OpenAI 規格,但整體思路好清楚:上層 app 只對住一個入口,底層用 AMD、NVIDIA、CPU、Vulkan、ROCm 定 NPU,可以按部機再揀。
Router 仲可以按規則、語意、分類器或者細模型判斷 prompt,再分去唔同模型。簡單問題交畀 3B,程式問題交畀 coding model,難題先用大模型,理論上可以慳記憶體同雲端 API 費。不過 XDA 發現私隱分類器嘅錯誤策略預設係 match_false:一旦分類失敗,含個人資料嘅內容有機會照送去雲端。作者改成失敗時當作命中,先變成較穩陣嘅設定。公司 IT 要逐條檢查呢道閘,淨係標榜「本機優先」,唔代表資料一定留喺本機。
128GB 統一記憶體先撐得起成套玩法
效能方面只可以引用 XDA 嗰部 Ryzen AI Max+ 395 主機。作者用 Qwen3-8B 測到 Radeon 8060S iGPU 有 37.7 token/s、首個 token 約 0.08 秒;FastFlowLM 跑 NPU 就係 10.9 token/s,同約 1.5 秒,生成速度相差約 3.4 倍。作者亦同時載住 Flux、Whisper、語音模型、router、小型 LLM、gpt-oss-120b 同 3D pipeline,合共用咗 128GB 入面嘅 117GB。呢組數字反映最大賣點其實係大容量統一記憶體同 iGPU,NPU 較適合留住細模型做輔助。
3D 就要收一收期望。XDA 將酒館圖片交畀 TRELLIS,兩分鐘內整到帶紋理嘅 3D 檔,但系統抽出嘅兩個人物正面睇尚算合理,轉去側面就近乎紙板。單張圖本身冇背面、深度同遮擋資料,模型只能估,背景移除設定亦會直接影響佢揀中咩物件。用嚟做概念模型或者快速預覽有用,距離可直接放入遊戲或產品製作嘅資產仲有一段路。
香港買到,但條數未必即刻平過雲端
香港已有 Ryzen AI Max+ 395 主機正式賣。GMKtec 香港頁面將 128GB RAM、2TB SSD 嘅 EVO-X2 標價 HK$26,999,查閱時顯示售罄,連兩年保養;MINISFORUM 香港就有同樣 128GB/2TB 配置嘅 MS-S1 Max 現貨,售 HK$29,999,連三年原廠有限保養。呢個前期投入唔細,XDA 今次亦冇量度整機耗電、長時間溫度或者噪音,所以暫時未有足夠數據證明佢跑幾耐先慳得返 API 月費。
如果團隊每日都要處理內部文件、錄音、圖片素材同重複生成任務,一部 128GB Strix Halo 主機確實有機會接手幾個雲端 AI 工具,仲方便將敏感資料留喺辦公室。不過 OpenMOSS 語音複製要先取得聲音持有人同意,亦要處理冒認同版權風險;3D、新語音功能同部分 ROCm/vLLM backend 嘅成熟度亦未一致,其中 vLLM ROCm 官方仍列作 experimental。打算正式部署嘅團隊,適合先揀一兩個高頻任務試跑,再睇穩定性、電費同維護時間值唔值得。
參考來源
- XDA Developers — This AMD Strix Halo mini PC generates 3D models, images, and speech without touching the cloud — original report
- Lemonade Server v11.5.1 release notes — 核對寫稿時最新版本、router 測試工具、backend 預設同修正內容。
- Lemonade OpenAI-compatible API 官方文件 — 核對文字、圖片、語音、embeddings 同語音複製等 endpoint 支援。
- Lemonade API 官方文件 — 核對 router、分類器同 3D 生成屬 Lemonade extension 嘅細節。
- Lemonade vLLM backend 官方文件 — 確認 ROCm vLLM backend 仍列作 experimental,同已驗證嘅 AMD 平台範圍。
- GMKtec EVO-X2 香港產品頁 — 核對香港標價、128GB/2TB 配置、供貨狀態同兩年保養。
- MINISFORUM MS-S1 Max 香港產品頁 — 核對香港現貨價、128GB/2TB 配置同三年原廠有限保養。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







